Перейти до основного вмісту
← Усі посібники

Як працюють пошукові системи

Між опублікованою сторінкою та результатом пошуку стоять три етапи. Більшість проблем SEO належить рівно до одного з них, і назвати правильний — значить не ремонтувати не те.

Чотири етапи й чому їх варто розрізняти

Пошукова система проходить із сторінкою чотири окремі етапи, і один може завершитися успішно, а наступний — ні. Виявлення робить URL відомою. Сканування завантажує сторінку. Індексація вирішує, чи зберігати її. Ранжування визначає для кожного запиту, чи показувати її. Функції ШІ Google є частиною Пошуку й далі спираються на ті самі основи сканування, індексації та відповідності вимогам, навіть коли отримання даних розгалужується на пов’язані пошуки.

Майже кожне питання, що починається з «чому моя сторінка не з'являється», насправді є питанням про те, на якому етапі вона зупинилася. Відповідь цілком змінює подальші дії, а етапи зазнають невдачі так, що ззовні виглядає однаково: відсутня сторінка має в результатах однаковий вигляд і тоді, коли її ніколи не виявили, і коли її заблокували на завантаженні, і коли визнали не вартою збереження, і коли зберегли, але просто випередили.

ЕтапЩо відбуваєтьсяЯк зазнає невдачі
ВиявленняАдреса стає відомою — через посилання чи карту сайтуНіщо не посилається на сторінку і жодна карта її не містить
СкануванняАдресу завантажують і рендерять як у браузеріrobots.txt відмовляє в дозволі або сервер віддає помилку
ІндексаціяСистема вирішує, чи зберігати сторінкуВміст визнано дублем, надто бідним або не вартим збереження
РанжуванняЗбережені сторінки оцінюють щодо наміруСторінка збережена, але існує краща відповідь

Виявлення: як адреса стає відомою

Google повідомляє, що переважна більшість нових сторінок, які він знаходить щодня, надходить через посилання. Сканер, що вже завантажує одну з ваших сторінок, витягує адреси з її розмітки й ставить у чергу. Це робить внутрішні посилання основним механізмом виявлення на будь-якому сайті, а не оптимізацією, яку додають потім.

Карти сайту — другий шлях. Вони важать найбільше там, де посилань найменше: на дуже великих сайтах, на цілком нових сайтах із небагатьма вхідними посиланнями та на сайтах, насичених медіа без природного тексту посилання. Google прямо каже, що перелічення адреси не гарантує ні сканування, ні індексації — це пропозиція до розгляду, а не черга, яку опрацюють.

Практичний наслідок: сторінка, на яку ніщо не посилається, спирається на слабший із двох механізмів. Запис у карті сайту не несе контексту — він каже, що адреса існує, але нічого про те, для чого сторінка й як вона пов'язана з рештою. Посилання несе і те, і те: своїм розташуванням і своїм текстом.

Сканування: дозвіл, спроможність і попит

Сканування обмежують дві речі, які Google називає окремо. Ліміт спроможності — це скільки одночасних з'єднань він відкриє, не перевантажуючи ваш сервер; він підлаштовується під ваш час відповіді та частку помилок. Попит на сканування — це скільки він насправді хоче завантажити, зважаючи на розмір сайту, частоту оновлень і свою оцінку якості.

Власна настанова Google полягає в тому, що більшості сайтів про це взагалі не варто думати. Бюджет сканування стає справжньою темою понад приблизно мільйон сторінок із щотижневим оновленням, понад десять тисяч сторінок, що змінюються щодня, або на будь-якому сайті, де велика частка адрес застрягла на «Виявлено — наразі не проіндексовано». Нижче цього повільне сканування майже завжди є симптомом чогось іншого.

Там, де тема реальна, важелі невидовищні: об'єднати дублі, для остаточно вилучених сторінок віддавати справжній 404 або 410 замість м'якого 404, скорочувати ланцюги перенаправлень, поліпшити час відповіді сервера й підтримувати умовні запити, щоб дешево відповідати на незмінені сторінки. Зверніть увагу, чого в цьому переліку бракує: noindex не є інструментом бюджету сканування, бо сканер мусить завантажити сторінку, щоб узагалі прочитати директиву.

Рендеринг: етап, про який забувають

Між завантаженням та індексацією стоїть рендеринг. Система виконує сторінку приблизно так, як це зробив би браузер, а потім індексує те, що містить відрендерений результат. Вміст, який з'являється лише після виконання JavaScript, отже, може бути проіндексований — але це залежить від успіху того виконання й від того, чи можна сканувати потрібні ресурси.

Саме тут правило в robots.txt завдає шкоди далеко від місця, де його написали. Блокування шляху зі скриптами чи API не дає сканеру завантажити саме ті файли, з яких сторінка будує свій вміст. HTML завантажується чудово, рендериться майже порожнім і майже порожнім потрапляє в індекс. Жоден статус не скаже «заблоковано» — сама сторінка ніколи нею не була.

Індексація — це судження, а не черга

Найпоширеніше хибне прочитання всього ланцюга — сприймати індексацію як чергу: тебе сканують, ти чекаєш, тебе індексують. Так це не працює. Після рендерингу система вирішує, чи варта сторінка збереження, і це рішення може бути «ні».

Саме це має на увазі Search Console під «Просканована, але поки не проіндексована». Ніщо не зламане, ніщо не блокує, завантаження вдалося. Сторінку оцінили й відклали. Майже однакові сторінки, згенеровані з шаблону — що різняться лише підставленим іменем чи числом, — звичайна причина, і повторне подання нічого не змінює, бо не змінилися дані, на яких ґрунтувалося рішення.

Рейтинг і функції штучного інтелекту Google мають однакові основи

Для заданого запиту Google Пошук отримує та ранжує релевантні матеріали. AI Overviews і AI Mode також можуть використовувати query fan-out, виконуючи кілька пов’язаних пошуків у підтемах і джерелах даних перед генеруванням відповіді з допоміжними посиланнями.

Наслідок простий: видимість у функціях ШІ-пошуку Google усе ще залежить від звичайної відповідності Пошуку. Google каже, що немає додаткових технічних вимог або спеціальної розмітки AI; має бути дозволено сканування, важливий вміст має бути індексованим і доступним у вигляді тексту, а елементи керування попереднім переглядом, такі як nosnippet, можуть обмежувати те, що відображається у функціях ШІ.

Спробуйте на власному сайті

Запитання та відповіді

Чи прибирає блокування в robots.txt сторінку з Google?

Ні. robots.txt зупиняє завантаження, а не індексацію. Заблокована адреса, на яку посилаються інші сайти, все одно може потрапити в індекс і показатися без опису, бо сканеру ніколи не дозволили прочитати директиву noindex, яка б її виключила. Щоб тримати сторінку поза результатами, дозвольте сканування й віддайте noindex або вимагайте автентифікації.

Скільки має тривати індексація?

Гарантованого вікна немає. Нова сторінка може потрапити в індекс за години або пролежати тижнями, і Google прямо каже, що сканування не обіцяє включення. Якщо сторінка лежить тижнями без індексації, тоді як подібні сторінки того самого сайту зайшли швидко, сприймайте це як судження про сторінку, а не як затримку.

Чи треба перейматися бюджетом сканування?

Майже напевно ні. Пороги Google — близько мільйона сторінок із щотижневим оновленням або десяти тисяч сторінок, що змінюються щодня. Нижче цього сторінки, які з'являються повільно, зазвичай зазнають невдачі на індексації, а не чекають на спроможність.

Чи можна проіндексувати вміст на JavaScript?

Так, бо система рендерить сторінки перед індексацією. Ризик не в самому JavaScript, а в його залежностях: якщо robots.txt блокує скрипти чи точки доступу, потрібні сторінці, вона відрендериться порожньою і порожньою потрапить в індекс, і жоден статус не назве причини.