Las cuatro etapas, y por qué distinguirlas importa
Un motor de búsqueda hace cuatro cosas distintas con una página, y puede completar una etapa y fallar en la siguiente. El descubrimiento da a conocer la URL. El rastreo la obtiene. La indexación decide si se almacena. El ranking decide, para cada consulta, si se muestra. Las funciones de IA de Google forman parte de la Búsqueda y siguen dependiendo de los mismos fundamentos de rastreo, indexación y elegibilidad, aunque la recuperación pueda ampliarse a búsquedas relacionadas.
Casi toda pregunta que empieza por «por qué no aparece mi página» es en realidad la pregunta de en qué etapa se detuvo. La respuesta cambia por completo lo que haces después, y las etapas fallan de formas que desde fuera se ven iguales: una página ausente se ve idéntica en los resultados tanto si nunca se descubrió, como si se bloqueó al descargarla, se juzgó no digna de guardar, o se guardó y simplemente la superaron.
| Etapa | Qué ocurre | Cómo falla |
|---|---|---|
| Descubrimiento | La URL se conoce, por un enlace o un sitemap | Nada enlaza la página y ningún sitemap la lista |
| Rastreo | La URL se descarga y se renderiza como en un navegador | robots.txt retira el permiso, o el servidor da error |
| Indexación | El buscador decide si almacena la página | El contenido se juzga duplicado, escaso o no digno de guardar |
| Ranking | Las páginas guardadas se puntúan frente a la intención | La página está guardada pero existe una respuesta mejor |
Descubrimiento: cómo se llega a conocer una URL
Google afirma que la inmensa mayoría de páginas nuevas que encuentra cada día llegan por enlaces. Un rastreador que ya está descargando una de tus páginas extrae las URL de su marcado y las encola. Eso convierte al enlazado interno en el mecanismo primario de descubrimiento de cualquier sitio, no en una optimización que se añade después.
Los sitemaps son la vía secundaria. Importan sobre todo donde el enlazado es más débil: sitios muy grandes, sitios recién creados con pocos enlaces entrantes y sitios cargados de medios sin texto ancla natural. Google es explícito en que listar una URL no garantiza ni el rastreo ni la indexación: es una sugerencia que se ofrece, no una cola que se vaya a despachar.
La consecuencia práctica es que una página a la que nada enlaza depende del más débil de los dos mecanismos. Una entrada de sitemap no lleva contexto: dice que una URL existe, pero nada sobre para qué sirve la página ni cómo se relaciona con el resto. Un enlace lleva ambas cosas, por su ubicación y por su texto ancla.
Rastreo: permiso, capacidad y demanda
El rastreo está acotado por dos cosas que Google nombra por separado. El límite de capacidad de rastreo es cuántas conexiones simultáneas abrirá sin forzar tu servidor, y se adapta a tus tiempos de respuesta y tasas de error. La demanda de rastreo es cuánto quiere descargar realmente, según el tamaño del sitio, la frecuencia de actualización y su valoración de la calidad.
La propia guía de Google dice que la mayoría de sitios no debería pensar en esto. El presupuesto de rastreo importa a partir de sitios por encima del millón de páginas con actualización semanal, sitios por encima de diez mil páginas que cambian a diario, o cualquier sitio con una proporción alta de URL atascadas en «Descubierta: actualmente sin indexar». Por debajo, un rastreo lento casi siempre es síntoma de otra cosa.
Donde sí aplica, las palancas son poco vistosas: consolidar duplicados, devolver un 404 o 410 real para lo definitivamente eliminado en lugar de un soft 404, acortar las cadenas de redirección, mejorar el tiempo de respuesta del servidor y admitir peticiones condicionales para responder barato a lo que no ha cambiado. Fíjate en lo que falta de esa lista: noindex no es una herramienta de presupuesto de rastreo, porque el rastreador tiene que descargar la página para leer la directiva.
Renderizado: la etapa que se olvida
Entre la descarga y la indexación está el renderizado. El buscador ejecuta la página aproximadamente como haría un navegador y después indexa lo que contiene el resultado renderizado. El contenido que solo aparece tras ejecutar JavaScript puede, por tanto, indexarse; pero depende de que esa ejecución funcione y de que los recursos que necesita sean rastreables.
Aquí una regla de robots.txt causa daño muy lejos de donde se escribió. Bloquear una ruta de scripts o de API impide al rastreador descargar justamente los archivos con los que la página construye su contenido. El HTML se descarga sin problema, renderiza casi vacío y se indexa casi vacío. Ningún estado dirá «bloqueada»: la página en sí nunca lo estuvo.
Indexar es un juicio, no una cola
La lectura errónea más común de toda la cadena es tratar la indexación como una fila de espera: te rastrean, esperas tu turno, te indexan. No funciona así. Tras el renderizado, el buscador decide si la página merece almacenarse, y esa decisión puede ser que no.
Es exactamente lo que Search Console quiere decir con «Rastreada: actualmente sin indexar». Nada está roto, nada bloquea, la descarga salió bien. La página se evaluó y se apartó. Las páginas casi idénticas generadas desde una plantilla —que difieren solo en un nombre o un número sustituido— son el motivo habitual, y reenviarlas no cambia nada, porque no ha cambiado la entrada de esa decisión.
El ranking y las funciones de inteligencia artificial de Google comparten los mismos fundamentos
Para una consulta determinada, la Búsqueda recupera y clasifica material relevante. AI Overviews y AI Mode de Google también pueden usar query fan-out: ejecutan varias búsquedas relacionadas sobre subtemas y fuentes de datos antes de generar una respuesta con enlaces de apoyo.
La consecuencia es simple: la visibilidad en las funciones de búsqueda con IA de Google aún depende de la elegibilidad para la búsqueda ordinaria. Google dice que no hay requisitos técnicos adicionales ni marcas especiales de IA; se debe permitir el rastreo, el contenido importante debe ser indexable y estar disponible en texto, y los controles de vista previa como nosnippet pueden limitar lo que aparece en las funciones de IA.