Duplicate content i tag canonical to dwa pojęcia, które wracają w każdej poważniejszej rozmowie o technicznym SEO. Pierwsze opisuje problem, drugie – jedno z narzędzi do jego rozwiązania. Żeby stosować canonical skutecznie, warto najpierw zrozumieć, skąd właściwie bierze się zduplikowana treść i co dzieje się z nią w indeksie wyszukiwarki.
Czym jest duplicate content
Duplicate content to sytuacja, w której ta sama lub bardzo podobna treść pojawia się pod więcej niż jednym adresem URL. Wyszukiwarka napotyka wtedy kilka wersji tej samej strony i musi zdecydować, którą z nich pokazać w wynikach. Problem w tym, że ta decyzja niekoniecznie pokrywa się z intencją właściciela serwisu.
Duplikaty mogą być wewnętrzne – w obrębie jednej domeny – albo zewnętrzne, gdy ta sama treść pojawia się na kilku różnych serwisach. Z perspektywy technicznej SEO trudniejsze do opanowania są duplikaty wewnętrzne, bo często powstają automatycznie, bez świadomości właściciela strony.
Skąd biorą się duplikaty w praktyce
Najczęstsze przyczyny to:
- dostępność strony jednocześnie pod adresem z
wwwi bez niego - wersja HTTP i HTTPS prowadząca do tej samej treści bez przekierowania
- parametry URL generowane przez filtry, sortowania i wyszukiwarkę wewnętrzną – typowe w sklepach WooCommerce
- stronicowanie kategorii i archiwów bez odpowiedniej obsługi
- wersje mobilne działające pod osobnym adresem (m.domena.pl)
- sesyjne identyfikatory w URL-ach
- treści syndykowane lub importowane z zewnętrznych źródeł
W przypadku WordPressa i WooCommerce parametryczne duplikaty potrafią urosnąć do setek lub tysięcy adresów URL, z których większość nigdy nie powinna trafić do indeksu.
Co robi Google z duplikatem
Kiedy Googlebot napotka kilka adresów z identyczną treścią, przeprowadza proces nazywany canonicalization – wybiera jeden adres jako wersję kanoniczną i to ją traktuje jako reprezentanta grupy. Pozostałe adresy mogą zostać zignorowane, nie zbierają autorytetu z linków i rzadko pojawiają się w wynikach wyszukiwania.
Ważna uwaga: Google nie traktuje duplikatów jako naruszenia zasad i nie nakłada za nie ręcznych kar. Problem jest innej natury – zduplikowany budżet indeksowania, rozproszenie sygnałów rankingowych i brak kontroli nad tym, który URL trafia do wyników.
Tag canonical – jak działa
Tag rel="canonical" to wskazówka umieszczana w sekcji <head> strony lub w nagłówku HTTP. Informuje wyszukiwarkę, który adres URL należy traktować jako wersję preferowaną danej treści.
Przykład kodu w sekcji <head>:
<link rel="canonical" href="https://example.com/strona/" />
Strona może wskazywać canonical na siebie samą – to tzw. self-referencing canonical, które jest dobrą praktyką i chroni przed przypadkowym zduplikowaniem przez zewnętrzne parametry. Strona może też wskazywać canonical na inny adres, np. gdy kilka URL-i prowadzi do tej samej treści produktu.
Canonical a przekierowanie 301
Canonical i przekierowanie 301 rozwiązują podobny problem, ale działają inaczej. Przekierowanie całkowicie przenosi użytkownika i robota na nowy adres – stary przestaje istnieć z punktu widzenia wyszukiwarki. Canonical pozostawia oba adresy dostępne, ale wskazuje preferowaną wersję.
Kiedy stosować przekierowanie: gdy stary adres nie powinien już być dostępny, a jego utrzymanie nie ma uzasadnienia. Kiedy stosować canonical: gdy duplikat musi technicznie istnieć (np. wersja do druku, strona z parametrem kampanii UTM, filtry w sklepie), ale nie powinien konkurować z wersją główną w indeksie.
Canonical a noindex
Dyrektywa noindex usuwa stronę z indeksu, ale nie konsoliduje jej sygnałów rankingowych w kierunku innego adresu. Canonical przenosi wartość linkową na wskazany URL, nawet jeśli sam nie jest indeksowany. W niektórych sytuacjach uzasadnione jest łączenie obu podejść, ale nie powinny one zastępować się nawzajem bez przemyślenia.
Typowe błędy przy wdrożeniu canonical
Canonical to wskazówka, nie dyrektywa – Google może ją zignorować, jeśli uzna, że wskazanie jest sprzeczne z innymi sygnałami. Najczęstsze przyczyny, dla których canonical nie działa zgodnie z oczekiwaniami:
- canonical wskazuje na adres, który sam ma inny canonical lub jest przekierowany
- treść na stronie kanonicznej znacząco różni się od strony wskazującej
- na stronie pojawia się więcej niż jeden tag canonical – wyszukiwarki zwykle ignorują wtedy oba
- canonical w kodzie HTML jest nadpisywany przez inny canonical w nagłówku HTTP
- brak spójności między wersją HTTP i HTTPS w samym tagu
Jak sprawdzić i wdrożyć canonical w WordPress
WordPress generuje canonical automatycznie dla większości typów stron. Można to zweryfikować, przeglądając źródło strony i szukając tagu rel="canonical" w sekcji <head>. Wtyczki SEO takie jak Yoast SEO czy Rank Math pozwalają nadpisać domyślny canonical na poziomie pojedynczego wpisu lub strony.
W przypadku sklepów WooCommerce warto przejrzeć, jakie URL-e generują filtry produktów i czy są one prawidłowo obsługiwane przez canonical lub regułę noindex. Parametry sortowania i filtrowania to jedno z częstszych źródeł niekontrolowanego rozrostu indeksu.
Audyt duplikatów warto przeprowadzić narzędziami takimi jak Google Search Console (raport pokrycia indeksu), Screaming Frog lub Sitebulb. Search Console pokaże, które adresy Google uznał za duplikaty i którą wersję wybrał jako kanoniczną – niezależnie od tego, co wskazuje tag w kodzie.
FAQ - najczęstsze pytania
Czy canonical działa tak samo we wszystkich wyszukiwarkach?
Tag canonical jest obsługiwany przez Google, Bing i większość liczących się wyszukiwarek, ale każda z nich traktuje go jako wskazówkę, nie nakaz. Bing bywa mniej skłonny do respektowania canonical niż Google, dlatego przy wdrożeniu warto dodatkowo wspierać wskazanie spójnymi przekierowaniami i strukturą linków wewnętrznych.
Czy strona z tagiem canonical na inny adres może się indeksować?
Tak, sam tag canonical nie wyklucza strony z indeksu – do tego służy dyrektywa noindex. Canonical mówi wyszukiwarce, który adres preferować, ale strona wskazująca może nadal pojawić się w wynikach, jeśli robot oceni wskazanie jako niespójne lub błędne.
Jak szybko Google reaguje na dodanie lub zmianę tagu canonical?
Nie ma sztywnego czasu reakcji – zależy to od częstotliwości indeksowania danej strony i jej autorytetu. W praktyce zmiany są widoczne w Google Search Console od kilku dni do kilku tygodni, a dla mniej popularnych witryn może minąć więcej czasu.
Czy canonical na stronie głównej jest potrzebny?
Tak, strona główna jest szczególnie narażona na duplikaty wynikające z różnych wariantów adresu – z www, bez www, z ukośnikiem na końcu lub bez. Self-referencing canonical na stronie głównej to prosta i zalecana praktyka, którą WordPress z wtyczką SEO zwykle ustawia automatycznie.
Czy parametry UTM w linkach kampanii mogą zaszkodzić indeksowi?
Jeśli strony z parametrami UTM są dostępne publicznie i linkowane w sposób umożliwiający ich indeksowanie, mogą tworzyć duplikaty. Standardowe rozwiązanie to canonical wskazujący na wersję bez parametrów lub wykluczenie tych URL-i przez Google Search Console w konfiguracji parametrów URL.