As quatro etapas, e por que distingui-las importa
Um mecanismo de pesquisa passa por quatro etapas distintas com uma página, e uma pode dar certo enquanto a seguinte falha. A descoberta torna a URL conhecida. O rastreamento a busca. A indexação decide se ela será armazenada. O ranking decide, para cada consulta, se ela será exibida. Os recursos de IA do Google fazem parte da Pesquisa e continuam dependendo das mesmas bases de rastreamento, indexação e elegibilidade, mesmo quando a recuperação se expande para pesquisas relacionadas.
Quase toda pergunta que começa com «por que minha página não aparece» é, na verdade, a pergunta sobre em que etapa ela parou. A resposta muda completamente o que você faz depois, e as etapas falham de formas que, de fora, parecem iguais: uma página ausente parece idêntica nos resultados, seja porque nunca foi descoberta, foi bloqueada no download, julgada não digna de armazenar, ou armazenada e simplesmente superada.
| Etapa | O que acontece | Como falha |
|---|---|---|
| Descoberta | A URL passa a ser conhecida, por link ou sitemap | Nada aponta para a página e nenhum sitemap a lista |
| Rastreio | A URL é baixada e renderizada como num navegador | robots.txt nega a permissão, ou o servidor devolve erro |
| Indexação | O buscador decide se guarda a página | O conteúdo é julgado duplicado, raso ou não digno de guardar |
| Ranking | As páginas guardadas são pontuadas frente à intenção | A página está guardada, mas existe resposta melhor |
Descoberta: como uma URL passa a ser conhecida
O Google afirma que a grande maioria das páginas novas que encontra por dia chega por links. Um rastreador que já está baixando uma das suas páginas extrai as URLs do markup dela e as enfileira. Isso faz dos links internos o mecanismo primário de descoberta de qualquer site, não uma otimização aplicada depois.
Os sitemaps são a via secundária. Importam sobretudo onde os links são mais fracos: sites muito grandes, sites recém-criados com poucos links de entrada e sites carregados de mídia sem texto âncora natural. O Google é explícito: listar uma URL não garante nem rastreio nem indexação — é uma sugestão oferecida para avaliação, não uma fila que será despachada.
A consequência prática é que uma página para a qual nada aponta depende do mais fraco dos dois mecanismos. Uma entrada de sitemap não carrega contexto: diz que uma URL existe, mas nada sobre para que serve a página ou como ela se liga ao resto. Um link carrega as duas coisas, pela posição e pelo texto âncora.
Rastreio: permissão, capacidade e demanda
O rastreio é limitado por duas coisas que o Google nomeia separadamente. O limite de capacidade de rastreio é quantas conexões simultâneas ele abrirá sem sobrecarregar seu servidor, e se adapta aos seus tempos de resposta e taxas de erro. A demanda de rastreio é o quanto ele de fato quer baixar, conforme tamanho do site, frequência de atualização e sua avaliação de qualidade.
A própria orientação do Google é que a maioria dos sites não precisa pensar nisso. O crawl budget vira tema real acima de cerca de um milhão de páginas com atualização semanal, acima de dez mil páginas que mudam diariamente, ou em qualquer site com grande parcela de URLs travadas em «Detectada, mas não indexada no momento». Abaixo disso, rastreio lento quase sempre é sintoma de outra coisa.
Onde se aplica, as alavancas são pouco vistosas: consolidar duplicatas, devolver 404 ou 410 de verdade para o que foi removido em definitivo em vez de soft 404, encurtar cadeias de redirecionamento, melhorar o tempo de resposta do servidor e suportar requisições condicionais para responder barato ao que não mudou. Repare no que falta nessa lista: noindex não é ferramenta de crawl budget, porque o rastreador precisa baixar a página para ler a diretiva.
Renderização: a etapa que se esquece
Entre o download e a indexação está a renderização. O buscador executa a página aproximadamente como um navegador faria e então indexa o que a saída renderizada contém. Conteúdo que só aparece depois de o JavaScript rodar pode, portanto, ser indexado — mas isso depende de essa execução dar certo e de os recursos necessários serem rastreáveis.
É aqui que uma regra de robots.txt causa dano longe de onde foi escrita. Bloquear um caminho de scripts ou de API impede o rastreador de baixar justamente os arquivos com que a página monta seu conteúdo. O HTML baixa sem problema, renderiza quase vazio e é indexado quase vazio. Nenhum status dirá «bloqueada»: a página em si nunca esteve.
Indexar é um julgamento, não uma fila
A leitura errada mais comum de toda a cadeia é tratar a indexação como fila de espera: ser rastreado, aguardar a vez, ser indexado. Não funciona assim. Depois da renderização, o buscador decide se a página merece ser armazenada, e essa decisão pode ser não.
É exatamente o que o Search Console quer dizer com «Rastreada, mas não indexada no momento». Nada está quebrado, nada bloqueia, o download deu certo. A página foi avaliada e posta de lado. Páginas quase idênticas geradas de um template — diferindo apenas por um nome ou número substituído — são o motivo habitual, e reenviá-las não muda nada, porque a base daquela decisão não mudou.
A classificação e os recursos de IA do Google compartilham os mesmos fundamentos
Para uma determinada consulta, a Pesquisa recupera e classifica o material relevante. AI Overviews e AI Mode do Google também podem usar query fan-out, executando várias pesquisas relacionadas em subtópicos e fontes de dados antes de gerar uma resposta com links de apoio.
A consequência é simples: a visibilidade nos recursos de pesquisa de IA do Google ainda depende da elegibilidade comum para a pesquisa. O Google afirma que não há requisitos técnicos adicionais ou marcações especiais de IA; o rastreamento deve ser permitido, o conteúdo importante deve ser indexável e disponível em texto, e controles de visualização como nosnippet podem limitar o que aparece nos recursos de IA.