Hoppa till huvudinnehållet
← Alla guider

robots.txt och webbplatskartor

Båda filerna säger något till en robot om dina adresser, och ingen av dem gör det man vanligen antar. Den ena nekar tillstånd att hämta. Den andra erbjuder en lista att överväga.

Tillstånd är inte detsamma som uteslutning

robots.txt nekar tillstånd att hämta en adress, inget mer. Google säger rakt ut att den inte är ett sätt att hålla en sida borta från sökresultaten. De två tankarna blandas ihop ständigt, och sammanblandningen ger ett mycket bestämt och väl synligt fel.

En blockerad adress som andra webbplatser länkar till kan ändå indexeras. Google vet att adressen finns eftersom någon länkat till den; den kan bara inte se vad som står där. Alltså kan adressen visas helt utan beskrivning — det sämsta av två världar, eftersom sidan ligger offentligt i resultaten samtidigt som du inte styr hur den ser ut.

Att läsa och skriva filen

Filen ligger i roten på en värd och gäller bara den värden och det protokollet. Regler grupperas per user-agent, och en robot följer den enda grupp som passar den mest specifikt — inte varje grupp som skulle kunna passa. Inom en grupp avgör hos Google den mer specifika regeln, inte ordningen.

robots.txt
User-agent: *
Disallow: /admin/
Disallow: /*.pdf$
Allow: /admin/public/

User-agent: Googlebot
Disallow: /drafts/

Sitemap: https://example.com/sitemap.xml

Två detaljer i exemplet står för nästan all förvirring. Allow-raden är mer specifik än Disallow ovanför, så /admin/public/ förblir hämtbar. Och så snart en Googlebot-grupp finns följer Googlebot enbart den gruppen — jokergruppen gäller inte längre för den, så här är /admin/ faktiskt hämtbar för Googlebot. Det är nästan aldrig vad författaren menade.

  • Att blockera en sökväg tar inte bort redan indexerade adresser; det stoppar bara framtida hämtningar.
  • Sitemap-direktivet är oberoende av varje user-agentgrupp och får stå var som helst i filen.
  • En 5xx på själva robots.txt kan få en robot att lämna hela värden i fred, så leverera den från något pålitligt.

Där en robots-regel skadar långt bortom sig själv

De dyraste robots.txt-misstagen är inte sidorna du ville blockera. Det är resurserna en sida behöver för att renderas. Sökmotorer renderar sidor innan de indexerar dem, och renderingen hämtar skript, stilmallar och API-svar.

Blockera en skriptsökväg eller en API-rutt och roboten hämtar fortfarande HTML utan problem. Sedan renderar den en nästan tom sida och indexerar en nästan tom sida. Ingen rapport säger att sidan var blockerad, för det var den inte — bara det den behövde.

En webbplatskarta är ett förslag, inte en kö

Webbplatskartor hjälper upptäckten just där länkningen är svagast: stora webbplatser, alldeles nya webbplatser med få inkommande länkar och webbplatser fyllda med media som saknar naturlig länktext. Google säger rakt ut att en listad adress varken garanterar genomsökning eller indexering.

Googles egen vägledning är att en mindre, välänkad webbplats kanske inte behöver någon alls, eftersom roboten hittar allt genom att följa länkar. Det är värt att ta på allvar innan du bygger infrastruktur för webbplatskartor för att lösa ett problem som intern länkning löser bättre.

GränsVärde
Adresser per fil50 000
Okomprimerad storlek per fil50 MB
Över någon av gränsernaDela upp och hänvisa till delarna från ett kartindex

Vilka taggar som läses, ignoreras eller misstros

Det är här merparten av arbetet med webbplatskartor går till spillo. Två av de fyra vanliga taggarna gör ingenting alls, och en tredje kan arbeta emot dig.

TaggVad Google gör med den
locLäses — själva adressen
lastmodAnvänds bara när värdet är konsekvent och verifierbart korrekt
changefreqIgnoreras
priorityIgnoreras

Villkoret kring lastmod är det som biter. Om ditt bygge stämplar varje adress med driftsättningens tidpunkt är varje värde samtidigt felaktigt och lätt att motbevisa: sidan ändrades inte, och sökmotorn kan se det. Så snart den slutar lita på fältet slutar den använda det, vilket lämnar dig sämre ställd än om du inte skickat något lastmod alls. Ange det bara vid verkliga ändringar i huvudinnehållet, och utelämna det hellre än att hitta på det.

sitemap.xml
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/guides/indexing/</loc>
    <lastmod>2026-06-14</lastmod>
  </url>
</urlset>

Att välja rätt verktyg

Nästan varje fråga på området löser sig så snart du skiljer på tre uppgifter som känns lika och inte är det.

MålVerktygVarför
Sluta slösa genomsökning på skräpadresserrobots.txtHindrar hämtningen helt
Hålla en sida borta från resultatennoindex, eller inloggningKräver hämtningen för att direktivet ska kunna läsas
Hjälpa sidor att upptäckasInterna länkar, sedan en webbplatskartaLänkar bär sammanhang, poster i en karta gör det inte

Frågor och svar

Kan jag kombinera disallow och noindex?

Nej, och just den kombinationen är det klassiska felet. Blockerar robots.txt adressen hämtar roboten aldrig sidan och ser aldrig noindex. Tillåt genomsökningen och leverera noindex, eller lägg sidan bakom inloggning.

Behöver jag alls en webbplatskarta?

Inte alltid. Google anger att en mindre, välänkad webbplats hittas genom att följa länkar. Webbplatskartor förtjänar sin plats på stora webbplatser, nystartade webbplatser med få inkommande länkar och mycket media.

Varför syns en sida jag blockerat fortfarande i Google?

För att robots.txt stoppade hämtningen, inte indexeringen. Andra webbplatser länkar till adressen, så Google vet att den finns men ser inte innehållet — därav en post utan beskrivning. Tillåt genomsökningen och leverera noindex för att ta bort den ordentligt.

Bör jag ange priority och changefreq?

Nej. Google ignorerar båda. Arbetet gör mer nytta i ett korrekt lastmod, eller i intern länkning.

Vad händer om robots.txt returnerar ett fel?

En 5xx kan få en robot att lämna värden i fred i stället för att anta att allt är tillåtet. Leverera robots.txt från infrastruktur minst lika pålitlig som webbplatsen själv.