De fyra stegen, och varför skillnaden spelar roll
En sökmotor går igenom fyra separata steg med en sida, och ett steg kan lyckas medan nästa misslyckas. Upptäckt gör URL:en känd. Genomsökning hämtar sidan. Indexering avgör om den ska lagras. Rankning avgör för varje sökfråga om den ska visas. Googles AI-funktioner är en del av Sök och bygger fortfarande på samma grunder för genomsökning, indexering och behörighet, även när hämtningen breddas till relaterade sökningar.
Nästan varje fråga som börjar med ”varför syns inte min sida” är i själva verket frågan om vilket steg den fastnade i. Svaret ändrar fortsättningen helt, och stegen misslyckas på sätt som utifrån ser likadana ut: en sida som saknas ser identisk ut i resultaten oavsett om den aldrig upptäcktes, blockerades vid hämtningen, bedömdes inte värd att lagra, eller lagrades och helt enkelt blev omsprungen.
| Steg | Vad som händer | Hur det havererar |
|---|---|---|
| Upptäckt | Adressen blir känd, via en länk eller en webbplatskarta | Inget länkar till sidan och ingen webbplatskarta tar upp den |
| Genomsökning | Adressen hämtas och renderas som i en webbläsare | robots.txt nekar tillstånd, eller servern svarar med fel |
| Indexering | Sökmotorn avgör om sidan ska lagras | Innehållet bedöms som dubblett, tunt eller inte värt att spara |
| Rankning | Lagrade sidor poängsätts mot avsikten | Sidan är lagrad men det finns ett bättre svar |
Upptäckt: hur en adress blir känd
Google uppger att den överväldigande majoriteten av de nya sidor den hittar varje dag kommer in via länkar. En robot som redan hämtar en av dina sidor plockar ut adresserna ur dess markup och köar dem. Därmed är den interna länkningen den primära upptäcktsmekanismen på vilken webbplats som helst, inte en optimering man lägger på i efterhand.
Webbplatskartor är den andra vägen. De väger tyngst där länkningen är svagast: mycket stora webbplatser, alldeles nya webbplatser med få inkommande länkar, och webbplatser fulla av media utan naturlig ankartext. Google är tydlig med att en listad adress varken garanterar genomsökning eller indexering — det är ett förslag som erbjuds, inte en kö som kommer att betas av.
Den praktiska följden är att en sida som inget länkar till lutar sig mot den svagare av de två mekanismerna. En post i en webbplatskarta bär ingen kontext: den säger att en adress finns, men inget om vad sidan är till för eller hur den hänger ihop med något annat. En länk bär bådadera, genom sin placering och sin ankartext.
Genomsökning: tillstånd, kapacitet och efterfrågan
Genomsökningen begränsas av två saker som Google namnger var för sig. Kapacitetsgränsen är hur många samtidiga anslutningar den öppnar utan att belasta din server, och den anpassar sig efter dina svarstider och felfrekvenser. Efterfrågan är hur mycket den faktiskt vill hämta, styrd av webbplatsens storlek, uppdateringstakt och dess bedömning av kvalitet.
Googles egen vägledning är att de flesta webbplatser inte behöver tänka på detta alls. Crawlbudget blir ett verkligt ämne först över ungefär en miljon sidor som uppdateras veckovis, över tiotusen sidor som ändras dagligen, eller på varje webbplats där en stor andel adresser fastnat på ”Upptäckt – för närvarande inte indexerad”. Under det är långsam genomsökning nästan alltid ett symtom på något annat.
Där det gäller är spakarna föga glamorösa: slå ihop dubbletter, svara med en riktig 404 eller 410 för det som tagits bort permanent i stället för en mjuk 404, håll omdirigeringskedjor korta, förbättra serverns svarstid och stöd villkorade förfrågningar så att oförändrade sidor kan besvaras billigt. Notera vad som saknas i listan: noindex är inget crawlbudgetverktyg, eftersom roboten måste hämta sidan för att kunna läsa direktivet.
Rendering: steget som glöms bort
Mellan hämtning och indexering ligger renderingen. Sökmotorn kör sidan ungefär som en webbläsare skulle göra och indexerar sedan det som den renderade utdatan innehåller. Innehåll som först dyker upp efter att JavaScript körts kan alltså indexeras — men det hänger på att körningen lyckas och att de resurser den behöver går att genomsöka.
Det är här en regel i robots.txt gör skada långt från där den skrevs. Att blockera en skript- eller API-sökväg hindrar roboten från att hämta just de filer som sidan bygger sitt innehåll av. HTML-koden hämtas utmärkt, renderas nästan tom och indexeras nästan tom. Ingen status kommer att säga ”blockerad” — sidan i sig var det aldrig.
Indexering är en bedömning, inte en kö
Den vanligaste feltolkningen av hela kedjan är att se indexeringen som en kö: bli genomsökt, vänta på din tur, bli indexerad. Så fungerar det inte. Efter renderingen avgör sökmotorn om sidan är värd att lagra, och det beslutet kan bli nej.
Det är precis vad Search Console menar med ”Genomsökt – för närvarande inte indexerad”. Inget är trasigt, inget blockerar, hämtningen gick bra. Sidan bedömdes och lades åt sidan. Nästan identiska sidor genererade ur en mall — som skiljer sig endast genom ett insatt namn eller ett tal — är det vanliga skälet, och att skicka in dem på nytt ändrar ingenting, eftersom underlaget för beslutet inte har ändrats.
Ranking och Googles AI-funktioner delar samma grund
För en given sökfråga hämtar och rangordnar Google Sök relevant material. AI Overviews och AI Mode kan också använda query fan-out och göra flera relaterade sökningar över underämnen och datakällor innan ett svar med stödjande länkar genereras.
Konsekvensen är enkel: synlighet i Googles AI-funktioner i Sök beror fortfarande på den vanliga behörigheten för Google Sök. Google säger att det inte finns några ytterligare tekniska krav eller särskild AI-uppmärkning; genomsökning måste tillåtas, viktigt innehåll ska vara indexerbart och finnas som text, och förhandsgranskningskontroller som nosnippet kan begränsa vad som visas i AI-funktioner.