Cztery etapy i dlaczego to rozróżnienie ma znaczenie
Wyszukiwarka wykonuje na stronie cztery odrębne kroki i jeden może się powieść, podczas gdy następny zawiedzie. Odkrywanie sprawia, że adres URL staje się znany. Podczas crawlowania strona jest pobierana. Indeksowanie decyduje, czy ją zapisać. Ranking określa dla każdego zapytania, czy ją wyświetlić. Funkcje AI Google są częścią wyszukiwarki i nadal opierają się na tych samych podstawach crawlowania, indeksowania i kwalifikowalności, nawet jeśli pobieranie rozszerza się na powiązane wyszukiwania.
Niemal każde pytanie zaczynające się od „dlaczego moja strona się nie pojawia” jest w istocie pytaniem o to, na którym etapie się zatrzymała. Odpowiedź całkowicie zmienia dalsze kroki, a etapy zawodzą w sposób, który z zewnątrz wygląda tak samo: brakująca strona wygląda w wynikach identycznie, czy nigdy nie została odkryta, czy zablokowano ją przy pobraniu, uznano za niewartą zapisania, czy też zapisano ją i po prostu wyprzedzono.
| Etap | Co się dzieje | Jak zawodzi |
|---|---|---|
| Odkrycie | Adres staje się znany — przez link lub mapę witryny | Nic nie linkuje do strony i żadna mapa jej nie wymienia |
| Crawl | Adres zostaje pobrany i wyrenderowany jak w przeglądarce | robots.txt odmawia zgody albo serwer zwraca błąd |
| Indeksowanie | Wyszukiwarka decyduje, czy zapisać stronę | Treść uznano za duplikat, zbyt ubogą lub niewartą zapisu |
| Ranking | Zapisane strony ocenia się względem intencji | Strona jest zapisana, ale istnieje lepsza odpowiedź |
Odkrycie: jak adres staje się znany
Google podaje, że zdecydowana większość nowych stron znajdowanych każdego dnia przychodzi z linków. Robot, który już pobiera jedną z twoich stron, wyciąga adresy z jej kodu i ustawia je w kolejce. To czyni linkowanie wewnętrzne podstawowym mechanizmem odkrywania w każdej witrynie, a nie optymalizacją dokładaną później.
Mapy witryny są drogą drugą. Liczą się najbardziej tam, gdzie linkowanie jest najsłabsze: przy bardzo dużych witrynach, przy witrynach zupełnie nowych z niewieloma linkami przychodzącymi oraz przy witrynach pełnych mediów bez naturalnego tekstu kotwicy. Google mówi wprost, że umieszczenie adresu nie gwarantuje ani zescanowania, ani zaindeksowania — to propozycja do rozważenia, a nie kolejka, która zostanie obsłużona.
Praktyczny wniosek: strona, do której nic nie linkuje, opiera się na słabszym z dwóch mechanizmów. Wpis w mapie witryny nie niesie kontekstu — mówi, że adres istnieje, ale nic o tym, po co ta strona jest ani jak łączy się z resztą. Link niesie jedno i drugie: przez swoje umiejscowienie i przez tekst kotwicy.
Crawl: zgoda, przepustowość i popyt
Crawl ograniczają dwie rzeczy, które Google nazywa osobno. Limit przepustowości to liczba równoczesnych połączeń otwieranych bez obciążania serwera; dostosowuje się do twoich czasów odpowiedzi i odsetka błędów. Popyt na crawl to ile wyszukiwarka faktycznie chce pobrać — zależnie od rozmiaru witryny, częstotliwości zmian i jej oceny jakości.
Własna wskazówka Google brzmi, że większość witryn w ogóle nie powinna o tym myśleć. Budżet crawlowania staje się realnym tematem powyżej mniej więcej miliona stron aktualizowanych tygodniowo, powyżej dziesięciu tysięcy stron zmieniających się codziennie albo w każdej witrynie, gdzie duża część adresów utknęła na „Wykryto – aktualnie nie zaindeksowano”. Poniżej tego wolny crawl jest niemal zawsze objawem czegoś innego.
Tam, gdzie temat jest realny, dźwignie są mało efektowne: scal duplikaty, dla trwale usuniętych stron zwracaj prawdziwe 404 lub 410 zamiast miękkiego 404, skracaj łańcuchy przekierowań, popraw czas odpowiedzi serwera i obsługuj żądania warunkowe, by tanio odpowiadać na strony niezmienione. Zwróć uwagę, czego na tej liście brakuje: noindex nie jest narzędziem budżetu crawlowania, bo robot musi pobrać stronę, żeby w ogóle odczytać dyrektywę.
Renderowanie: etap, o którym się zapomina
Między pobraniem a indeksowaniem stoi renderowanie. Wyszukiwarka wykonuje stronę mniej więcej tak jak przeglądarka, a potem indeksuje to, co zawiera wyrenderowany efekt. Treść pojawiająca się dopiero po wykonaniu JavaScriptu może więc zostać zaindeksowana — ale zależy to od powodzenia tego wykonania i od tego, czy potrzebne zasoby da się zescanować.
To tutaj reguła w robots.txt czyni szkodę daleko od miejsca, w którym ją zapisano. Zablokowanie ścieżki skryptów lub API uniemożliwia robotowi pobranie właśnie tych plików, z których strona buduje swoją treść. HTML pobiera się bez problemu, renderuje niemal pusty i niemal pusty trafia do indeksu. Żaden status nie powie „zablokowana” — sama strona nigdy nie była.
Indeksowanie to ocena, nie kolejka
Najczęstszym błędnym odczytem całego łańcucha jest traktowanie indeksowania jak kolejki: daj się zescanować, poczekaj na swoją kolej, zostań zaindeksowany. Tak to nie działa. Po renderowaniu wyszukiwarka decyduje, czy strona jest warta zapisania, a ta decyzja może brzmieć: nie.
Dokładnie to ma na myśli Search Console, pisząc „Przeskanowano – aktualnie nie zaindeksowano”. Nic nie jest zepsute, nic nie blokuje, pobranie się powiodło. Stronę oceniono i odłożono. Niemal identyczne strony generowane z szablonu — różniące się wyłącznie podstawioną nazwą lub liczbą — to typowy powód, a ponowne zgłaszanie nic nie zmienia, bo nie zmieniły się dane, na których oparto tę decyzję.
Ranking i funkcje sztucznej inteligencji Google mają te same podstawy
Dla danego zapytania wyszukiwarka pobiera i klasyfikuje odpowiednie materiały. AI Overviews i AI Mode Google mogą też korzystać z query fan-out, wykonując wiele powiązanych wyszukiwań w podtematach i źródłach danych przed wygenerowaniem odpowiedzi z linkami pomocniczymi.
Konsekwencja jest prosta: widoczność w funkcjach AI wyszukiwarki Google nadal zależy od zwykłych podstaw kwalifikowalności w Search. Google twierdzi, że nie ma dodatkowych wymagań technicznych ani specjalnego znacznika AI; crawling musi być dozwolony, ważne treści powinny być indeksowalne i dostępne jako tekst, a kontrolki podglądu, takie jak nosnippet, mogą ograniczać to, co pojawia się w funkcjach AI.