Чотири етапи й чому їх варто розрізняти
Пошукова система проходить із сторінкою чотири окремі етапи, і один може завершитися успішно, а наступний — ні. Виявлення робить URL відомою. Сканування завантажує сторінку. Індексація вирішує, чи зберігати її. Ранжування визначає для кожного запиту, чи показувати її. Функції ШІ Google є частиною Пошуку й далі спираються на ті самі основи сканування, індексації та відповідності вимогам, навіть коли отримання даних розгалужується на пов’язані пошуки.
Майже кожне питання, що починається з «чому моя сторінка не з'являється», насправді є питанням про те, на якому етапі вона зупинилася. Відповідь цілком змінює подальші дії, а етапи зазнають невдачі так, що ззовні виглядає однаково: відсутня сторінка має в результатах однаковий вигляд і тоді, коли її ніколи не виявили, і коли її заблокували на завантаженні, і коли визнали не вартою збереження, і коли зберегли, але просто випередили.
| Етап | Що відбувається | Як зазнає невдачі |
|---|---|---|
| Виявлення | Адреса стає відомою — через посилання чи карту сайту | Ніщо не посилається на сторінку і жодна карта її не містить |
| Сканування | Адресу завантажують і рендерять як у браузері | robots.txt відмовляє в дозволі або сервер віддає помилку |
| Індексація | Система вирішує, чи зберігати сторінку | Вміст визнано дублем, надто бідним або не вартим збереження |
| Ранжування | Збережені сторінки оцінюють щодо наміру | Сторінка збережена, але існує краща відповідь |
Виявлення: як адреса стає відомою
Google повідомляє, що переважна більшість нових сторінок, які він знаходить щодня, надходить через посилання. Сканер, що вже завантажує одну з ваших сторінок, витягує адреси з її розмітки й ставить у чергу. Це робить внутрішні посилання основним механізмом виявлення на будь-якому сайті, а не оптимізацією, яку додають потім.
Карти сайту — другий шлях. Вони важать найбільше там, де посилань найменше: на дуже великих сайтах, на цілком нових сайтах із небагатьма вхідними посиланнями та на сайтах, насичених медіа без природного тексту посилання. Google прямо каже, що перелічення адреси не гарантує ні сканування, ні індексації — це пропозиція до розгляду, а не черга, яку опрацюють.
Практичний наслідок: сторінка, на яку ніщо не посилається, спирається на слабший із двох механізмів. Запис у карті сайту не несе контексту — він каже, що адреса існує, але нічого про те, для чого сторінка й як вона пов'язана з рештою. Посилання несе і те, і те: своїм розташуванням і своїм текстом.
Сканування: дозвіл, спроможність і попит
Сканування обмежують дві речі, які Google називає окремо. Ліміт спроможності — це скільки одночасних з'єднань він відкриє, не перевантажуючи ваш сервер; він підлаштовується під ваш час відповіді та частку помилок. Попит на сканування — це скільки він насправді хоче завантажити, зважаючи на розмір сайту, частоту оновлень і свою оцінку якості.
Власна настанова Google полягає в тому, що більшості сайтів про це взагалі не варто думати. Бюджет сканування стає справжньою темою понад приблизно мільйон сторінок із щотижневим оновленням, понад десять тисяч сторінок, що змінюються щодня, або на будь-якому сайті, де велика частка адрес застрягла на «Виявлено — наразі не проіндексовано». Нижче цього повільне сканування майже завжди є симптомом чогось іншого.
Там, де тема реальна, важелі невидовищні: об'єднати дублі, для остаточно вилучених сторінок віддавати справжній 404 або 410 замість м'якого 404, скорочувати ланцюги перенаправлень, поліпшити час відповіді сервера й підтримувати умовні запити, щоб дешево відповідати на незмінені сторінки. Зверніть увагу, чого в цьому переліку бракує: noindex не є інструментом бюджету сканування, бо сканер мусить завантажити сторінку, щоб узагалі прочитати директиву.
Рендеринг: етап, про який забувають
Між завантаженням та індексацією стоїть рендеринг. Система виконує сторінку приблизно так, як це зробив би браузер, а потім індексує те, що містить відрендерений результат. Вміст, який з'являється лише після виконання JavaScript, отже, може бути проіндексований — але це залежить від успіху того виконання й від того, чи можна сканувати потрібні ресурси.
Саме тут правило в robots.txt завдає шкоди далеко від місця, де його написали. Блокування шляху зі скриптами чи API не дає сканеру завантажити саме ті файли, з яких сторінка будує свій вміст. HTML завантажується чудово, рендериться майже порожнім і майже порожнім потрапляє в індекс. Жоден статус не скаже «заблоковано» — сама сторінка ніколи нею не була.
Індексація — це судження, а не черга
Найпоширеніше хибне прочитання всього ланцюга — сприймати індексацію як чергу: тебе сканують, ти чекаєш, тебе індексують. Так це не працює. Після рендерингу система вирішує, чи варта сторінка збереження, і це рішення може бути «ні».
Саме це має на увазі Search Console під «Просканована, але поки не проіндексована». Ніщо не зламане, ніщо не блокує, завантаження вдалося. Сторінку оцінили й відклали. Майже однакові сторінки, згенеровані з шаблону — що різняться лише підставленим іменем чи числом, — звичайна причина, і повторне подання нічого не змінює, бо не змінилися дані, на яких ґрунтувалося рішення.
Рейтинг і функції штучного інтелекту Google мають однакові основи
Для заданого запиту Google Пошук отримує та ранжує релевантні матеріали. AI Overviews і AI Mode також можуть використовувати query fan-out, виконуючи кілька пов’язаних пошуків у підтемах і джерелах даних перед генеруванням відповіді з допоміжними посиланнями.
Наслідок простий: видимість у функціях ШІ-пошуку Google усе ще залежить від звичайної відповідності Пошуку. Google каже, що немає додаткових технічних вимог або спеціальної розмітки AI; має бути дозволено сканування, важливий вміст має бути індексованим і доступним у вигляді тексту, а елементи керування попереднім переглядом, такі як nosnippet, можуть обмежувати те, що відображається у функціях ШІ.