Saltar al contenido principal
← Todas las guías

Cómo funcionan los buscadores

Entre una página publicada y un resultado de búsqueda hay tres etapas. Casi todos los problemas de SEO pertenecen exactamente a una, y nombrar la correcta evita reparar la equivocada.

Las cuatro etapas, y por qué distinguirlas importa

Un motor de búsqueda hace cuatro cosas distintas con una página, y puede completar una etapa y fallar en la siguiente. El descubrimiento da a conocer la URL. El rastreo la obtiene. La indexación decide si se almacena. El ranking decide, para cada consulta, si se muestra. Las funciones de IA de Google forman parte de la Búsqueda y siguen dependiendo de los mismos fundamentos de rastreo, indexación y elegibilidad, aunque la recuperación pueda ampliarse a búsquedas relacionadas.

Casi toda pregunta que empieza por «por qué no aparece mi página» es en realidad la pregunta de en qué etapa se detuvo. La respuesta cambia por completo lo que haces después, y las etapas fallan de formas que desde fuera se ven iguales: una página ausente se ve idéntica en los resultados tanto si nunca se descubrió, como si se bloqueó al descargarla, se juzgó no digna de guardar, o se guardó y simplemente la superaron.

EtapaQué ocurreCómo falla
DescubrimientoLa URL se conoce, por un enlace o un sitemapNada enlaza la página y ningún sitemap la lista
RastreoLa URL se descarga y se renderiza como en un navegadorrobots.txt retira el permiso, o el servidor da error
IndexaciónEl buscador decide si almacena la páginaEl contenido se juzga duplicado, escaso o no digno de guardar
RankingLas páginas guardadas se puntúan frente a la intenciónLa página está guardada pero existe una respuesta mejor

Descubrimiento: cómo se llega a conocer una URL

Google afirma que la inmensa mayoría de páginas nuevas que encuentra cada día llegan por enlaces. Un rastreador que ya está descargando una de tus páginas extrae las URL de su marcado y las encola. Eso convierte al enlazado interno en el mecanismo primario de descubrimiento de cualquier sitio, no en una optimización que se añade después.

Los sitemaps son la vía secundaria. Importan sobre todo donde el enlazado es más débil: sitios muy grandes, sitios recién creados con pocos enlaces entrantes y sitios cargados de medios sin texto ancla natural. Google es explícito en que listar una URL no garantiza ni el rastreo ni la indexación: es una sugerencia que se ofrece, no una cola que se vaya a despachar.

La consecuencia práctica es que una página a la que nada enlaza depende del más débil de los dos mecanismos. Una entrada de sitemap no lleva contexto: dice que una URL existe, pero nada sobre para qué sirve la página ni cómo se relaciona con el resto. Un enlace lleva ambas cosas, por su ubicación y por su texto ancla.

Rastreo: permiso, capacidad y demanda

El rastreo está acotado por dos cosas que Google nombra por separado. El límite de capacidad de rastreo es cuántas conexiones simultáneas abrirá sin forzar tu servidor, y se adapta a tus tiempos de respuesta y tasas de error. La demanda de rastreo es cuánto quiere descargar realmente, según el tamaño del sitio, la frecuencia de actualización y su valoración de la calidad.

La propia guía de Google dice que la mayoría de sitios no debería pensar en esto. El presupuesto de rastreo importa a partir de sitios por encima del millón de páginas con actualización semanal, sitios por encima de diez mil páginas que cambian a diario, o cualquier sitio con una proporción alta de URL atascadas en «Descubierta: actualmente sin indexar». Por debajo, un rastreo lento casi siempre es síntoma de otra cosa.

Donde sí aplica, las palancas son poco vistosas: consolidar duplicados, devolver un 404 o 410 real para lo definitivamente eliminado en lugar de un soft 404, acortar las cadenas de redirección, mejorar el tiempo de respuesta del servidor y admitir peticiones condicionales para responder barato a lo que no ha cambiado. Fíjate en lo que falta de esa lista: noindex no es una herramienta de presupuesto de rastreo, porque el rastreador tiene que descargar la página para leer la directiva.

Renderizado: la etapa que se olvida

Entre la descarga y la indexación está el renderizado. El buscador ejecuta la página aproximadamente como haría un navegador y después indexa lo que contiene el resultado renderizado. El contenido que solo aparece tras ejecutar JavaScript puede, por tanto, indexarse; pero depende de que esa ejecución funcione y de que los recursos que necesita sean rastreables.

Aquí una regla de robots.txt causa daño muy lejos de donde se escribió. Bloquear una ruta de scripts o de API impide al rastreador descargar justamente los archivos con los que la página construye su contenido. El HTML se descarga sin problema, renderiza casi vacío y se indexa casi vacío. Ningún estado dirá «bloqueada»: la página en sí nunca lo estuvo.

Indexar es un juicio, no una cola

La lectura errónea más común de toda la cadena es tratar la indexación como una fila de espera: te rastrean, esperas tu turno, te indexan. No funciona así. Tras el renderizado, el buscador decide si la página merece almacenarse, y esa decisión puede ser que no.

Es exactamente lo que Search Console quiere decir con «Rastreada: actualmente sin indexar». Nada está roto, nada bloquea, la descarga salió bien. La página se evaluó y se apartó. Las páginas casi idénticas generadas desde una plantilla —que difieren solo en un nombre o un número sustituido— son el motivo habitual, y reenviarlas no cambia nada, porque no ha cambiado la entrada de esa decisión.

El ranking y las funciones de inteligencia artificial de Google comparten los mismos fundamentos

Para una consulta determinada, la Búsqueda recupera y clasifica material relevante. AI Overviews y AI Mode de Google también pueden usar query fan-out: ejecutan varias búsquedas relacionadas sobre subtemas y fuentes de datos antes de generar una respuesta con enlaces de apoyo.

La consecuencia es simple: la visibilidad en las funciones de búsqueda con IA de Google aún depende de la elegibilidad para la búsqueda ordinaria. Google dice que no hay requisitos técnicos adicionales ni marcas especiales de IA; se debe permitir el rastreo, el contenido importante debe ser indexable y estar disponible en texto, y los controles de vista previa como nosnippet pueden limitar lo que aparece en las funciones de IA.

Pruébalo en tu propia web

Preguntas y respuestas

¿Bloquear una página en robots.txt la elimina de Google?

No. robots.txt detiene la descarga, no la indexación. Una URL bloqueada a la que otros enlazan puede indexarse y aparecer sin descripción, porque el rastreador nunca pudo leer el noindex que la habría excluido. Para mantener una página fuera, deja que se rastree y sirve un noindex, o exige autenticación.

¿Cuánto debería tardar la indexación?

No hay ventana garantizada. Una página nueva puede indexarse en horas o quedarse semanas, y Google dice sin rodeos que ser rastreada no promete la inclusión. Si una página lleva semanas sin indexar mientras otras comparables del mismo sitio entraron rápido, trátalo como un juicio sobre la página, no como un retraso.

¿Tengo que preocuparme por el presupuesto de rastreo?

Casi con seguridad no. Los umbrales de Google rondan el millón de páginas con actualización semanal o diez mil páginas que cambian a diario. Por debajo, las páginas que tardan en aparecer suelen estar fallando en la indexación, no esperando capacidad de rastreo.

¿Se puede indexar contenido en JavaScript?

Sí, porque el buscador renderiza las páginas antes de indexarlas. El riesgo no es JavaScript en sí, sino sus dependencias: si robots.txt bloquea los scripts o endpoints que la página necesita, renderiza vacía y se indexa vacía, sin que ningún estado nombre la causa.