De vier fasen, en waarom het onderscheid telt
Een zoekmachine doorloopt vier afzonderlijke stappen met een pagina, en de ene kan slagen terwijl de volgende mislukt. Bij ontdekking wordt de URL bekend. Crawlen haalt de pagina op. Indexering bepaalt of die wordt opgeslagen. Ranking bepaalt per zoekopdracht of de pagina wordt getoond. De AI-functies van Google maken deel uit van Zoeken en blijven op dezelfde basis voor crawlen, indexering en geschiktheid steunen, ook wanneer het ophalen uitwaaiert naar gerelateerde zoekopdrachten.
Bijna elke vraag die begint met „waarom verschijnt mijn pagina niet” is in werkelijkheid de vraag bij welke fase hij is blijven steken. Het antwoord verandert het vervolg volledig, en de fasen falen op manieren die van buiten hetzelfde ogen: een ontbrekende pagina ziet er in de resultaten identiek uit, of hij nu nooit is ontdekt, bij het ophalen is geblokkeerd, niet de moeite van het opslaan waard werd gevonden, of wél is opgeslagen en simpelweg is voorbijgestreefd.
| Fase | Wat er gebeurt | Hoe het misgaat |
|---|---|---|
| Ontdekking | De URL wordt bekend, via een link of een sitemap | Niets linkt naar de pagina en geen sitemap noemt hem |
| Crawlen | De URL wordt opgehaald en gerenderd als in een browser | robots.txt onthoudt toestemming, of de server geeft een fout |
| Indexeren | De zoekmachine beslist over opslaan | De inhoud geldt als duplicaat, dun of niet bewaarwaardig |
| Ranken | Opgeslagen pagina's worden tegen de intentie gescoord | De pagina is opgeslagen maar er bestaat een beter antwoord |
Ontdekking: hoe een URL bekend wordt
Google stelt dat de overgrote meerderheid van de nieuwe pagina's die het dagelijks vindt via links binnenkomt. Een crawler die al een van uw pagina's ophaalt, haalt de URL's uit de markup en zet ze in de wachtrij. Daarmee is interne linking het primaire ontdekkingsmechanisme van elke site, geen optimalisatie die je er achteraf op zet.
Sitemaps zijn de tweede route. Ze tellen het zwaarst waar de linking het zwakst is: zeer grote sites, gloednieuwe sites met weinig inkomende links en sites vol media zonder natuurlijke ankertekst. Google is expliciet dat het opnemen van een URL crawlen noch indexeren garandeert — het is een suggestie ter overweging, geen wachtrij die wordt afgewerkt.
Praktisch betekent dat: een pagina waar niets naar linkt leunt op het zwakste van de twee mechanismen. Een sitemapvermelding draagt geen context; hij zegt dat een URL bestaat, maar niets over waar de pagina voor dient of hoe hij zich tot de rest verhoudt. Een link draagt beide, via zijn plaatsing en zijn ankertekst.
Crawlen: toestemming, capaciteit en vraag
Crawlen wordt begrensd door twee dingen die Google afzonderlijk benoemt. De crawlcapaciteitslimiet is hoeveel gelijktijdige verbindingen het opent zonder uw server te belasten; die past zich aan uw responstijden en foutpercentages aan. De crawlvraag is hoeveel het werkelijk wíl ophalen, gedreven door omvang, updatefrequentie en zijn inschatting van kwaliteit.
Googles eigen richtlijn is dat de meeste sites hier helemaal niet over hoeven na te denken. Crawlbudget wordt pas een echt onderwerp boven ruwweg een miljoen wekelijks bijgewerkte pagina's, boven tienduizend dagelijks wijzigende pagina's, of op elke site waar een groot deel van de URL's vastzit op „Gevonden – momenteel niet geïndexeerd”. Daaronder is traag crawlen vrijwel altijd een symptoom van iets anders.
Waar het wél speelt, zijn de knoppen weinig spectaculair: duplicaten samenvoegen, voor definitief verwijderde pagina's een echte 404 of 410 teruggeven in plaats van een soft 404, redirectketens kort houden, de responstijd van de server verbeteren en conditionele verzoeken ondersteunen zodat ongewijzigde pagina's goedkoop kunnen worden beantwoord. Let op wat ontbreekt in dat rijtje: noindex is geen crawlbudget-instrument, want de crawler moet de pagina ophalen om de instructie te kunnen lezen.
Renderen: de fase die men vergeet
Tussen ophalen en indexeren zit renderen. De zoekmachine voert de pagina ongeveer uit zoals een browser zou doen en indexeert vervolgens wat de gerenderde uitvoer bevat. Inhoud die pas verschijnt nadat JavaScript is uitgevoerd kan dus worden geïndexeerd — maar dat hangt af van het slagen van die uitvoering en van de crawlbaarheid van de benodigde bronnen.
Hier richt een robots.txt-regel schade aan ver van waar hij is geschreven. Een scripts- of API-pad blokkeren belet de crawler juist die bestanden op te halen waarmee de pagina haar inhoud opbouwt. De HTML wordt prima opgehaald, rendert vrijwel leeg en wordt vrijwel leeg geïndexeerd. Geen enkele status zal „geblokkeerd” melden — de pagina zelf was dat nooit.
Indexeren is een oordeel, geen wachtrij
De meest voorkomende misvatting over de hele keten is indexeren zien als in de rij staan: gecrawld worden, wachten op je beurt, geïndexeerd worden. Zo werkt het niet. Na het renderen beslist de zoekmachine of de pagina het opslaan waard is, en dat besluit kan nee luiden.
Precies dat bedoelt Search Console met „Gecrawld – momenteel niet geïndexeerd”. Er is niets kapot, niets blokkeert, het ophalen slaagde. De pagina is beoordeeld en terzijde gelegd. Vrijwel identieke pagina's uit één sjabloon — die alleen verschillen door een ingevulde naam of een getal — zijn de gebruikelijke reden, en opnieuw indienen verandert niets, omdat de invoer van dat besluit niet is veranderd.
Ranking en de AI-functies van Google delen dezelfde basis
Voor een bepaalde zoekopdracht haalt Google Zoeken relevant materiaal op en rangschikt het. AI Overviews en AI Mode kunnen ook query fan-out gebruiken: meerdere gerelateerde zoekopdrachten over subonderwerpen en databronnen worden uitgevoerd voordat een antwoord met ondersteunende links wordt gegenereerd.
Het gevolg is simpel: de zichtbaarheid in de AI Search-functies van Google hangt nog steeds af van de geschiktheid voor gewone zoekopdrachten. Google zegt dat er geen aanvullende technische vereisten of speciale AI-markeringen zijn; crawlen moet worden toegestaan, belangrijke inhoud moet indexeerbaar en beschikbaar zijn in tekst, en preview-besturingselementen zoals nosnippet kunnen beperken wat er in AI-functies verschijnt.