Ga naar de hoofdinhoud
← Alle gidsen

Hoe zoekmachines werken

Tussen een gepubliceerde pagina en een zoekresultaat liggen drie fasen. De meeste SEO-problemen horen bij precies één ervan, en de juiste benoemen scheelt u het verkeerde repareren.

De vier fasen, en waarom het onderscheid telt

Een zoekmachine doorloopt vier afzonderlijke stappen met een pagina, en de ene kan slagen terwijl de volgende mislukt. Bij ontdekking wordt de URL bekend. Crawlen haalt de pagina op. Indexering bepaalt of die wordt opgeslagen. Ranking bepaalt per zoekopdracht of de pagina wordt getoond. De AI-functies van Google maken deel uit van Zoeken en blijven op dezelfde basis voor crawlen, indexering en geschiktheid steunen, ook wanneer het ophalen uitwaaiert naar gerelateerde zoekopdrachten.

Bijna elke vraag die begint met „waarom verschijnt mijn pagina niet” is in werkelijkheid de vraag bij welke fase hij is blijven steken. Het antwoord verandert het vervolg volledig, en de fasen falen op manieren die van buiten hetzelfde ogen: een ontbrekende pagina ziet er in de resultaten identiek uit, of hij nu nooit is ontdekt, bij het ophalen is geblokkeerd, niet de moeite van het opslaan waard werd gevonden, of wél is opgeslagen en simpelweg is voorbijgestreefd.

FaseWat er gebeurtHoe het misgaat
OntdekkingDe URL wordt bekend, via een link of een sitemapNiets linkt naar de pagina en geen sitemap noemt hem
CrawlenDe URL wordt opgehaald en gerenderd als in een browserrobots.txt onthoudt toestemming, of de server geeft een fout
IndexerenDe zoekmachine beslist over opslaanDe inhoud geldt als duplicaat, dun of niet bewaarwaardig
RankenOpgeslagen pagina's worden tegen de intentie gescoordDe pagina is opgeslagen maar er bestaat een beter antwoord

Ontdekking: hoe een URL bekend wordt

Google stelt dat de overgrote meerderheid van de nieuwe pagina's die het dagelijks vindt via links binnenkomt. Een crawler die al een van uw pagina's ophaalt, haalt de URL's uit de markup en zet ze in de wachtrij. Daarmee is interne linking het primaire ontdekkingsmechanisme van elke site, geen optimalisatie die je er achteraf op zet.

Sitemaps zijn de tweede route. Ze tellen het zwaarst waar de linking het zwakst is: zeer grote sites, gloednieuwe sites met weinig inkomende links en sites vol media zonder natuurlijke ankertekst. Google is expliciet dat het opnemen van een URL crawlen noch indexeren garandeert — het is een suggestie ter overweging, geen wachtrij die wordt afgewerkt.

Praktisch betekent dat: een pagina waar niets naar linkt leunt op het zwakste van de twee mechanismen. Een sitemapvermelding draagt geen context; hij zegt dat een URL bestaat, maar niets over waar de pagina voor dient of hoe hij zich tot de rest verhoudt. Een link draagt beide, via zijn plaatsing en zijn ankertekst.

Crawlen: toestemming, capaciteit en vraag

Crawlen wordt begrensd door twee dingen die Google afzonderlijk benoemt. De crawlcapaciteitslimiet is hoeveel gelijktijdige verbindingen het opent zonder uw server te belasten; die past zich aan uw responstijden en foutpercentages aan. De crawlvraag is hoeveel het werkelijk wíl ophalen, gedreven door omvang, updatefrequentie en zijn inschatting van kwaliteit.

Googles eigen richtlijn is dat de meeste sites hier helemaal niet over hoeven na te denken. Crawlbudget wordt pas een echt onderwerp boven ruwweg een miljoen wekelijks bijgewerkte pagina's, boven tienduizend dagelijks wijzigende pagina's, of op elke site waar een groot deel van de URL's vastzit op „Gevonden – momenteel niet geïndexeerd”. Daaronder is traag crawlen vrijwel altijd een symptoom van iets anders.

Waar het wél speelt, zijn de knoppen weinig spectaculair: duplicaten samenvoegen, voor definitief verwijderde pagina's een echte 404 of 410 teruggeven in plaats van een soft 404, redirectketens kort houden, de responstijd van de server verbeteren en conditionele verzoeken ondersteunen zodat ongewijzigde pagina's goedkoop kunnen worden beantwoord. Let op wat ontbreekt in dat rijtje: noindex is geen crawlbudget-instrument, want de crawler moet de pagina ophalen om de instructie te kunnen lezen.

Renderen: de fase die men vergeet

Tussen ophalen en indexeren zit renderen. De zoekmachine voert de pagina ongeveer uit zoals een browser zou doen en indexeert vervolgens wat de gerenderde uitvoer bevat. Inhoud die pas verschijnt nadat JavaScript is uitgevoerd kan dus worden geïndexeerd — maar dat hangt af van het slagen van die uitvoering en van de crawlbaarheid van de benodigde bronnen.

Hier richt een robots.txt-regel schade aan ver van waar hij is geschreven. Een scripts- of API-pad blokkeren belet de crawler juist die bestanden op te halen waarmee de pagina haar inhoud opbouwt. De HTML wordt prima opgehaald, rendert vrijwel leeg en wordt vrijwel leeg geïndexeerd. Geen enkele status zal „geblokkeerd” melden — de pagina zelf was dat nooit.

Indexeren is een oordeel, geen wachtrij

De meest voorkomende misvatting over de hele keten is indexeren zien als in de rij staan: gecrawld worden, wachten op je beurt, geïndexeerd worden. Zo werkt het niet. Na het renderen beslist de zoekmachine of de pagina het opslaan waard is, en dat besluit kan nee luiden.

Precies dat bedoelt Search Console met „Gecrawld – momenteel niet geïndexeerd”. Er is niets kapot, niets blokkeert, het ophalen slaagde. De pagina is beoordeeld en terzijde gelegd. Vrijwel identieke pagina's uit één sjabloon — die alleen verschillen door een ingevulde naam of een getal — zijn de gebruikelijke reden, en opnieuw indienen verandert niets, omdat de invoer van dat besluit niet is veranderd.

Ranking en de AI-functies van Google delen dezelfde basis

Voor een bepaalde zoekopdracht haalt Google Zoeken relevant materiaal op en rangschikt het. AI Overviews en AI Mode kunnen ook query fan-out gebruiken: meerdere gerelateerde zoekopdrachten over subonderwerpen en databronnen worden uitgevoerd voordat een antwoord met ondersteunende links wordt gegenereerd.

Het gevolg is simpel: de zichtbaarheid in de AI Search-functies van Google hangt nog steeds af van de geschiktheid voor gewone zoekopdrachten. Google zegt dat er geen aanvullende technische vereisten of speciale AI-markeringen zijn; crawlen moet worden toegestaan, belangrijke inhoud moet indexeerbaar en beschikbaar zijn in tekst, en preview-besturingselementen zoals nosnippet kunnen beperken wat er in AI-functies verschijnt.

Probeer het op je eigen site

Vragen en antwoorden

Haalt blokkeren in robots.txt een pagina uit Google?

Nee. robots.txt stopt het ophalen, niet het indexeren. Een geblokkeerde URL waar anderen naar linken kan alsnog worden geïndexeerd en zonder omschrijving verschijnen, omdat de crawler de uitsluitende noindex nooit mocht lezen. Wilt u een pagina buiten de resultaten houden, laat hem dan crawlen en serveer een noindex, of vereis authenticatie.

Hoe lang hoort indexeren te duren?

Er is geen gegarandeerd venster. Een nieuwe pagina kan binnen uren geïndexeerd zijn of wekenlang blijven liggen, en Google zegt onomwonden dat gecrawld worden geen opname belooft. Ligt een pagina weken ongeïndexeerd terwijl vergelijkbare pagina's op dezelfde site snel binnenkwamen, behandel dat dan als een oordeel over de pagina, niet als vertraging.

Moet ik me druk maken om crawlbudget?

Vrijwel zeker niet. Googles drempels liggen rond een miljoen wekelijks bijgewerkte pagina's, of tienduizend dagelijks wijzigende pagina's. Daaronder falen traag verschijnende pagina's meestal bij het indexeren, niet in afwachting van crawlcapaciteit.

Kan JavaScript-inhoud worden geïndexeerd?

Ja, want de zoekmachine rendert pagina's voordat zij ze indexeert. Het risico is niet JavaScript zelf maar zijn afhankelijkheden: blokkeert robots.txt de scripts of endpoints die de pagina nodig heeft, dan rendert hij leeg en wordt hij leeg geïndexeerd, zonder dat enige status de oorzaak benoemt.