Hoppa till huvudinnehållet
← Alla guider

Så fungerar sökmotorer

Mellan en publicerad sida och ett sökresultat ligger tre steg. De flesta SEO-problem hör hemma i exakt ett av dem, och att namnge rätt steg besparar dig att laga fel sak.

De fyra stegen, och varför skillnaden spelar roll

En sökmotor går igenom fyra separata steg med en sida, och ett steg kan lyckas medan nästa misslyckas. Upptäckt gör URL:en känd. Genomsökning hämtar sidan. Indexering avgör om den ska lagras. Rankning avgör för varje sökfråga om den ska visas. Googles AI-funktioner är en del av Sök och bygger fortfarande på samma grunder för genomsökning, indexering och behörighet, även när hämtningen breddas till relaterade sökningar.

Nästan varje fråga som börjar med ”varför syns inte min sida” är i själva verket frågan om vilket steg den fastnade i. Svaret ändrar fortsättningen helt, och stegen misslyckas på sätt som utifrån ser likadana ut: en sida som saknas ser identisk ut i resultaten oavsett om den aldrig upptäcktes, blockerades vid hämtningen, bedömdes inte värd att lagra, eller lagrades och helt enkelt blev omsprungen.

StegVad som händerHur det havererar
UpptäcktAdressen blir känd, via en länk eller en webbplatskartaInget länkar till sidan och ingen webbplatskarta tar upp den
GenomsökningAdressen hämtas och renderas som i en webbläsarerobots.txt nekar tillstånd, eller servern svarar med fel
IndexeringSökmotorn avgör om sidan ska lagrasInnehållet bedöms som dubblett, tunt eller inte värt att spara
RankningLagrade sidor poängsätts mot avsiktenSidan är lagrad men det finns ett bättre svar

Upptäckt: hur en adress blir känd

Google uppger att den överväldigande majoriteten av de nya sidor den hittar varje dag kommer in via länkar. En robot som redan hämtar en av dina sidor plockar ut adresserna ur dess markup och köar dem. Därmed är den interna länkningen den primära upptäcktsmekanismen på vilken webbplats som helst, inte en optimering man lägger på i efterhand.

Webbplatskartor är den andra vägen. De väger tyngst där länkningen är svagast: mycket stora webbplatser, alldeles nya webbplatser med få inkommande länkar, och webbplatser fulla av media utan naturlig ankartext. Google är tydlig med att en listad adress varken garanterar genomsökning eller indexering — det är ett förslag som erbjuds, inte en kö som kommer att betas av.

Den praktiska följden är att en sida som inget länkar till lutar sig mot den svagare av de två mekanismerna. En post i en webbplatskarta bär ingen kontext: den säger att en adress finns, men inget om vad sidan är till för eller hur den hänger ihop med något annat. En länk bär bådadera, genom sin placering och sin ankartext.

Genomsökning: tillstånd, kapacitet och efterfrågan

Genomsökningen begränsas av två saker som Google namnger var för sig. Kapacitetsgränsen är hur många samtidiga anslutningar den öppnar utan att belasta din server, och den anpassar sig efter dina svarstider och felfrekvenser. Efterfrågan är hur mycket den faktiskt vill hämta, styrd av webbplatsens storlek, uppdateringstakt och dess bedömning av kvalitet.

Googles egen vägledning är att de flesta webbplatser inte behöver tänka på detta alls. Crawlbudget blir ett verkligt ämne först över ungefär en miljon sidor som uppdateras veckovis, över tiotusen sidor som ändras dagligen, eller på varje webbplats där en stor andel adresser fastnat på ”Upptäckt – för närvarande inte indexerad”. Under det är långsam genomsökning nästan alltid ett symtom på något annat.

Där det gäller är spakarna föga glamorösa: slå ihop dubbletter, svara med en riktig 404 eller 410 för det som tagits bort permanent i stället för en mjuk 404, håll omdirigeringskedjor korta, förbättra serverns svarstid och stöd villkorade förfrågningar så att oförändrade sidor kan besvaras billigt. Notera vad som saknas i listan: noindex är inget crawlbudgetverktyg, eftersom roboten måste hämta sidan för att kunna läsa direktivet.

Rendering: steget som glöms bort

Mellan hämtning och indexering ligger renderingen. Sökmotorn kör sidan ungefär som en webbläsare skulle göra och indexerar sedan det som den renderade utdatan innehåller. Innehåll som först dyker upp efter att JavaScript körts kan alltså indexeras — men det hänger på att körningen lyckas och att de resurser den behöver går att genomsöka.

Det är här en regel i robots.txt gör skada långt från där den skrevs. Att blockera en skript- eller API-sökväg hindrar roboten från att hämta just de filer som sidan bygger sitt innehåll av. HTML-koden hämtas utmärkt, renderas nästan tom och indexeras nästan tom. Ingen status kommer att säga ”blockerad” — sidan i sig var det aldrig.

Indexering är en bedömning, inte en kö

Den vanligaste feltolkningen av hela kedjan är att se indexeringen som en kö: bli genomsökt, vänta på din tur, bli indexerad. Så fungerar det inte. Efter renderingen avgör sökmotorn om sidan är värd att lagra, och det beslutet kan bli nej.

Det är precis vad Search Console menar med ”Genomsökt – för närvarande inte indexerad”. Inget är trasigt, inget blockerar, hämtningen gick bra. Sidan bedömdes och lades åt sidan. Nästan identiska sidor genererade ur en mall — som skiljer sig endast genom ett insatt namn eller ett tal — är det vanliga skälet, och att skicka in dem på nytt ändrar ingenting, eftersom underlaget för beslutet inte har ändrats.

Ranking och Googles AI-funktioner delar samma grund

För en given sökfråga hämtar och rangordnar Google Sök relevant material. AI Overviews och AI Mode kan också använda query fan-out och göra flera relaterade sökningar över underämnen och datakällor innan ett svar med stödjande länkar genereras.

Konsekvensen är enkel: synlighet i Googles AI-funktioner i Sök beror fortfarande på den vanliga behörigheten för Google Sök. Google säger att det inte finns några ytterligare tekniska krav eller särskild AI-uppmärkning; genomsökning måste tillåtas, viktigt innehåll ska vara indexerbart och finnas som text, och förhandsgranskningskontroller som nosnippet kan begränsa vad som visas i AI-funktioner.

Testa på din egen webbplats

Frågor och svar

Tar en blockering i robots.txt bort en sida från Google?

Nej. robots.txt stoppar hämtningen, inte indexeringen. En blockerad adress som andra länkar till kan ändå indexeras och visas utan beskrivning, eftersom roboten aldrig fick läsa den noindex som skulle ha uteslutit den. För att hålla en sida borta: låt den genomsökas och leverera en noindex, eller kräv inloggning.

Hur lång tid bör indexering ta?

Det finns inget garanterat fönster. En ny sida kan indexeras på timmar eller bli liggande i veckor, och Google säger rakt ut att bli genomsökt inte lovar inkludering. Har en sida legat oindexerad i veckor medan jämförbara sidor på samma webbplats gick in snabbt, behandla det som ett omdöme om sidan snarare än en fördröjning.

Behöver jag bry mig om crawlbudget?

Nästan säkert inte. Googles trösklar ligger kring en miljon sidor som uppdateras veckovis, eller tiotusen sidor som ändras dagligen. Under det brukar sidor som dröjer misslyckas i indexeringen snarare än vänta på genomsökningskapacitet.

Kan innehåll i JavaScript indexeras?

Ja, för sökmotorn renderar sidor innan den indexerar dem. Risken är inte JavaScript i sig utan dess beroenden: blockerar robots.txt de skript eller ändpunkter sidan behöver, renderas den tom och indexeras tom, utan att någon status namnger orsaken.