Zacznij od stanu, a nie diagnozy
Raport indeksowania strony uwzględnia zarówno rzeczywiste problemy techniczne, jak i oczekiwane wykluczenia. Reguła robots.txt, dyrektywa noindex, wymóg uwierzytelnienia lub brak odpowiedzi mogą uniemożliwić indeksowanie; statusy zduplikowane i kanoniczne mogą działać dokładnie tak, jak powinny; a odkryty URL mógł po prostu nie zostać jeszcze przeszukany.
Najbardziej wprowadzający w błąd stan to „Przeszukano — obecnie nieindeksowane”. Potwierdza, że Google pobrał stronę, ale nie dodał jej wówczas do indeksu. Google wyraźnie stwierdza, że strona może zostać później zaindeksowana lub nie, i że nie ma potrzeby ponownego jej przesyłania tylko ze względu na ten status.
Statusy, które naprawdę są błędami
Opisują coś po twojej stronie, co uniemożliwiło zapis. Google oznacza źródło każdego jako Witryna, gdy możesz to naprawić sam, i jako Google, gdy przyczyna leży u nich. Poprawienie leżącej u podstaw odpowiedzi to całe rozwiązanie.
| Status | Co oznacza | Źródło |
|---|---|---|
| Błąd serwera (5xx) | Serwer zwrócił błąd z rodziny 500 | |
| Błąd przekierowania | Łańcuch przekierowań zapętlił się lub zawiódł | Witryna |
| Adres URL zablokowany przez plik robots.txt | robots.txt odmówił zgody na pobranie | Witryna |
| Strona oznaczona tagiem „noindex” | Strona podała dyrektywę noindex | Witryna |
| Miękki błąd 404 | Komunikat o braku zwrócony z kodem 200 | Witryna |
| Zablokowana z powodu nieautoryzowanego żądania (401) | Strona zażądała danych logowania | Witryna |
| Nie znaleziono (404) | Adres zwrócił 404 | Witryna |
| Zablokowana z powodu zakazu dostępu (403) | Serwer zwrócił 403 | Witryna |
| Zablokowana z powodu innego problemu 4xx | Jakaś inna odpowiedź 4xx | Witryna |
Dwa z nich zasługują na szczególną uwagę, bo bywają zawinione przez nas samych. Miękki błąd 404 oznacza, że zwracasz uprzejmą stronę „nic tu nie ma” ze statusem 200: wyszukiwarka widzi sukces i ubogą treść zamiast nieobecności, więc powiedz prawdę kodem 404 lub 410. A 401 albo 403 na stronach, które miały być publiczne, zwykle znaczy, że reguła ze środowiska testowego albo zapora trafiła na produkcję.
Statusy, które wyglądają jak błędy, a nimi nie są
To one generują najwięcej zmarnowanej pracy. Każdy z nich to Google raportujący własną decyzję, a nie usterkę, którą wprowadziłeś. Ściganie ich pochłania uwagę potrzebną prawdziwym problemom.
| Status | Co naprawdę oznacza |
|---|---|
| Strona alternatywna z prawidłowym tagiem kanonicznym | Konsolidacja działająca dokładnie tak, jak zamierzono |
| Duplikat bez kanonicznego wskazanego przez użytkownika | Nie zadeklarowałeś kanonicznego, więc Google wybrał |
| Duplikat, Google wybrał inny adres kanoniczny | Zadeklarowałeś jeden, Google się nie zgodził |
| Strona z przekierowaniem | Niekanoniczny adres przekierowuje, zgodnie z projektem |
| Wykryto – aktualnie nie zaindeksowano | Znany, ale jeszcze nie pobrany |
| Przeskanowano – aktualnie nie zaindeksowano | Pobrany, oceniony i odłożony |
Dwa statusy duplikatu warto rozróżnić. „Bez kanonicznego wskazanego przez użytkownika” znaczy, że nigdy żadnego nie zadeklarowałeś i Google wybrał za ciebie — zwykle nieszkodliwe, ale oddałeś decyzję, którą mogłeś podjąć sam. „Google wybrał inny adres kanoniczny” znaczy, że jednak zadeklarowałeś i zostałeś przegłosowany, co sygnalizuje, że wskazana przez ciebie strona nie jest tą, którą wyszukiwarka uważa za główną.
Uczciwe czytanie „przeskanowano, nie zaindeksowano”
Ten stan oznacza, że Google crawlowal stronę, ale w tym momencie jej nie zaindeksował. Nie wskazuje jednej uniwersalnej przyczyny, a test URL Inspection na żywo nie może z pełną pewnością przewidzieć późniejszego indeksowania. Nie ma sensu wymyślać błędu technicznego, którego raport nie wymienia.
W witrynach opartych na szablonach warto sprawdzić podobieństwo między stronami, sygnały canonical, linki wewnętrzne oraz to, czy każda strona wnosi informacje, których nie mają podobne strony. To kontrole diagnostyczne, a nie twierdzenie, że każdy URL z tym statusem nie przekroczył progu jakości.
- Otwórz Sprawdzenie adresu URL i potwierdź, że strona zwraca 200, jest samokanoniczna i renderuje treść główną.
- Porównaj ją z trzema najbliższymi siostrami. Jeśli da się podmienić podstawione wartości i otrzymać równoważną stronę, wyszukiwarka też to widzi.
- Sprawdź, czy cokolwiek linkuje do niej wewnętrznie opisowym tekstem kotwicy, czy istnieje wyłącznie w mapie witryny.
- Zapytaj, na co ta strona odpowiada, na co nie odpowiada żadna siostra. Jeśli odpowiedzi nie ma, to właśnie jest wniosek.
- Zmień stronę tak, by odpowiedź istniała, i dopiero wtedy poproś o indeksację — w tej kolejności.
„Wykryto, nie zaindeksowano” to inny sygnał
Ten oznacza, że adres jest znany, ale nie został pobrany. W małej witrynie zwykle jest to stan przejściowy. W skali to najczystszy objaw, jaki Google nazywa, realnego ograniczenia budżetu crawlowania: za dużo adresów, za mały popyt, a kolejka nigdy do nich nie dociera.
Jeśli duża część twoich adresów tkwi tutaj, produktywna praca to zmniejszenie liczby mało wartościowych adresów, które podsuwasz wyszukiwarce do rozważenia — scalić duplikaty, zwracać porządne 404 dla tego, czego już nie ma, skrócić łańcuchy przekierowań — a nie zgłaszać strony pojedynczo.
Praca nad raportem zamiast nad objawami
Raport jest uporządkowany według przyczyn, co kusi, by przerabiać go z góry według wolumenu. Oprzyj się temu. Tysiąc adresów pod „Strona z przekierowaniem” to zwykle działająca mapa przekierowań, podczas gdy czterdzieści pod „Miękki błąd 404” to prawdziwa usterka dotykająca prawdziwych stron.
- Najpierw napraw wszystko z tabeli błędów — to jednoznaczne i mechaniczne.
- Odłóż statusy informacyjne, chyba że wolumen przeczy twoim zamiarom, jak konsolidacja kanoniczna, której nigdy nie projektowałeś.
- Traktuj „przeskanowano, nie zaindeksowano” jako zaległość redakcyjną, nie techniczną.
- Waliduj ponownie dopiero wtedy, gdy odpowiedź albo treść naprawdę się zmieniły.