Les quatre étapes, et pourquoi les distinguer
Un moteur de recherche effectue quatre opérations distinctes sur une page, et chacune peut réussir alors que la suivante échoue. La découverte fait connaître l'URL. L'exploration la récupère. L'indexation décide si elle doit être stockée. Le classement décide, pour chaque requête, si elle doit être affichée. Les fonctionnalités d'IA de Google font partie de la recherche et reposent toujours sur les mêmes bases d'exploration, d'indexation et d'éligibilité, même si la récupération peut s'étendre à des recherches associées.
Presque toute question commençant par « pourquoi ma page n'apparaît-elle pas » est en réalité la question de l'étape où elle s'est arrêtée. La réponse change complètement la suite, et les étapes échouent de façons qui se ressemblent vues de l'extérieur : une page absente paraît identique dans les résultats, qu'elle n'ait jamais été découverte, qu'elle ait été bloquée au téléchargement, jugée indigne d'être stockée, ou stockée puis simplement devancée.
| Étape | Ce qui se passe | Comment elle échoue |
|---|---|---|
| Découverte | L'URL devient connue, par un lien ou un sitemap | Rien ne pointe vers la page et aucun sitemap ne la liste |
| Crawl | L'URL est récupérée et rendue comme dans un navigateur | robots.txt refuse l'autorisation, ou le serveur renvoie une erreur |
| Indexation | Le moteur décide de stocker la page ou non | Le contenu est jugé dupliqué, mince ou indigne d'être conservé |
| Classement | Les pages stockées sont notées face à l'intention | La page est stockée mais une meilleure réponse existe |
Découverte : comment une URL devient connue
Google indique que l'immense majorité des pages qu'il découvre chaque jour arrivent par des liens. Un robot qui récupère déjà l'une de vos pages en extrait les URL du balisage et les met en file. Le maillage interne est donc le mécanisme de découverte principal d'un site, et non une optimisation ajoutée après coup.
Les sitemaps sont la voie secondaire. Ils comptent surtout là où le maillage est le plus faible : très grands sites, sites tout neufs avec peu de liens entrants, sites chargés de médias sans ancre naturelle. Google est explicite : lister une URL ne garantit ni l'exploration ni l'indexation — c'est une suggestion soumise à examen, pas une file qui sera traitée.
La conséquence pratique : une page vers laquelle rien ne pointe s'en remet au plus faible des deux mécanismes. Une entrée de sitemap ne porte aucun contexte ; elle dit qu'une URL existe, mais rien sur l'objet de la page ni sur ses rapports avec le reste. Un lien porte les deux, par son emplacement et par son ancre.
Crawl : autorisation, capacité et demande
Le crawl est borné par deux choses que Google nomme séparément. La limite de capacité d'exploration est le nombre de connexions simultanées qu'il ouvrira sans peser sur votre serveur ; elle s'adapte à vos temps de réponse et à vos taux d'erreur. La demande d'exploration est ce qu'il souhaite réellement récupérer, selon la taille du site, la fréquence des mises à jour et son appréciation de la qualité.
La recommandation de Google est que la plupart des sites n'aient pas à y penser. Le budget de crawl devient un vrai sujet au-delà d'environ un million de pages mises à jour chaque semaine, au-delà de dix mille pages changeant chaque jour, ou sur tout site dont une grande part des URL stagne en « Détectée, actuellement non indexée ». En dessous, un crawl lent est presque toujours le symptôme d'autre chose.
Là où cela s'applique, les leviers sont peu spectaculaires : regrouper les doublons, renvoyer un vrai 404 ou 410 pour ce qui est définitivement retiré plutôt qu'un soft 404, raccourcir les chaînes de redirection, améliorer le temps de réponse du serveur et gérer les requêtes conditionnelles pour répondre à moindre coût aux pages inchangées. Notez ce qui manque à cette liste : noindex n'est pas un outil de budget de crawl, puisque le robot doit récupérer la page pour lire la directive.
Le rendu : l'étape qu'on oublie
Entre la récupération et l'indexation se place le rendu. Le moteur exécute la page à peu près comme le ferait un navigateur, puis indexe ce que contient le résultat rendu. Un contenu qui n'apparaît qu'après l'exécution de JavaScript peut donc être indexé — à condition que cette exécution aboutisse et que les ressources nécessaires soient explorables.
C'est ici qu'une règle robots.txt fait des dégâts loin de l'endroit où elle a été écrite. Bloquer un chemin de scripts ou d'API empêche le robot de récupérer précisément les fichiers avec lesquels la page construit son contenu. Le HTML se récupère très bien, se rend presque vide et s'indexe presque vide. Aucun statut ne dira « bloquée » : la page elle-même ne l'a jamais été.
L'indexation est un jugement, pas une file d'attente
La lecture la plus fréquemment fausse de toute la chaîne consiste à voir l'indexation comme une file : être crawlé, attendre son tour, être indexé. Ce n'est pas ainsi. Après le rendu, le moteur décide si la page mérite d'être stockée, et cette décision peut être non.
C'est exactement ce que la Search Console signifie par « Explorée, actuellement non indexée ». Rien n'est cassé, rien ne bloque, la récupération a réussi. La page a été évaluée puis écartée. Des pages quasi identiques issues d'un gabarit — ne différant que par un nom ou un nombre substitué — en sont la raison habituelle, et les resoumettre ne change rien, car l'entrée de cette décision n'a pas changé.
Le classement et les fonctionnalités d'IA de Google partagent les mêmes fondements
Pour une requête donnée, la recherche récupère et classe les éléments pertinents. AI Overviews et AI Mode peuvent également utiliser le query fan-out, en lançant plusieurs recherches associées sur des sous-thèmes et des sources de données avant de générer une réponse avec des liens d'appui.
La conséquence est simple : la visibilité dans les fonctionnalités de recherche AI de Google dépend toujours de l'éligibilité à la recherche ordinaire. Google affirme qu'il n'y a pas d'exigences techniques supplémentaires ni de balisage spécial pour l'IA ; l'exploration doit être autorisée, le contenu important doit être indexable et disponible sous forme de texte, et les contrôles d'aperçu tels que nosnippet peuvent limiter ce qui apparaît dans les fonctionnalités d'IA.