Tillstånd är inte detsamma som uteslutning
robots.txt nekar tillstånd att hämta en adress, inget mer. Google säger rakt ut att den inte är ett sätt att hålla en sida borta från sökresultaten. De två tankarna blandas ihop ständigt, och sammanblandningen ger ett mycket bestämt och väl synligt fel.
En blockerad adress som andra webbplatser länkar till kan ändå indexeras. Google vet att adressen finns eftersom någon länkat till den; den kan bara inte se vad som står där. Alltså kan adressen visas helt utan beskrivning — det sämsta av två världar, eftersom sidan ligger offentligt i resultaten samtidigt som du inte styr hur den ser ut.
Att läsa och skriva filen
Filen ligger i roten på en värd och gäller bara den värden och det protokollet. Regler grupperas per user-agent, och en robot följer den enda grupp som passar den mest specifikt — inte varje grupp som skulle kunna passa. Inom en grupp avgör hos Google den mer specifika regeln, inte ordningen.
User-agent: *
Disallow: /admin/
Disallow: /*.pdf$
Allow: /admin/public/
User-agent: Googlebot
Disallow: /drafts/
Sitemap: https://example.com/sitemap.xml Två detaljer i exemplet står för nästan all förvirring. Allow-raden är mer specifik än Disallow ovanför, så /admin/public/ förblir hämtbar. Och så snart en Googlebot-grupp finns följer Googlebot enbart den gruppen — jokergruppen gäller inte längre för den, så här är /admin/ faktiskt hämtbar för Googlebot. Det är nästan aldrig vad författaren menade.
- Att blockera en sökväg tar inte bort redan indexerade adresser; det stoppar bara framtida hämtningar.
- Sitemap-direktivet är oberoende av varje user-agentgrupp och får stå var som helst i filen.
- En 5xx på själva robots.txt kan få en robot att lämna hela värden i fred, så leverera den från något pålitligt.
Där en robots-regel skadar långt bortom sig själv
De dyraste robots.txt-misstagen är inte sidorna du ville blockera. Det är resurserna en sida behöver för att renderas. Sökmotorer renderar sidor innan de indexerar dem, och renderingen hämtar skript, stilmallar och API-svar.
Blockera en skriptsökväg eller en API-rutt och roboten hämtar fortfarande HTML utan problem. Sedan renderar den en nästan tom sida och indexerar en nästan tom sida. Ingen rapport säger att sidan var blockerad, för det var den inte — bara det den behövde.
En webbplatskarta är ett förslag, inte en kö
Webbplatskartor hjälper upptäckten just där länkningen är svagast: stora webbplatser, alldeles nya webbplatser med få inkommande länkar och webbplatser fyllda med media som saknar naturlig länktext. Google säger rakt ut att en listad adress varken garanterar genomsökning eller indexering.
Googles egen vägledning är att en mindre, välänkad webbplats kanske inte behöver någon alls, eftersom roboten hittar allt genom att följa länkar. Det är värt att ta på allvar innan du bygger infrastruktur för webbplatskartor för att lösa ett problem som intern länkning löser bättre.
| Gräns | Värde |
|---|---|
| Adresser per fil | 50 000 |
| Okomprimerad storlek per fil | 50 MB |
| Över någon av gränserna | Dela upp och hänvisa till delarna från ett kartindex |
Vilka taggar som läses, ignoreras eller misstros
Det är här merparten av arbetet med webbplatskartor går till spillo. Två av de fyra vanliga taggarna gör ingenting alls, och en tredje kan arbeta emot dig.
| Tagg | Vad Google gör med den |
|---|---|
| loc | Läses — själva adressen |
| lastmod | Används bara när värdet är konsekvent och verifierbart korrekt |
| changefreq | Ignoreras |
| priority | Ignoreras |
Villkoret kring lastmod är det som biter. Om ditt bygge stämplar varje adress med driftsättningens tidpunkt är varje värde samtidigt felaktigt och lätt att motbevisa: sidan ändrades inte, och sökmotorn kan se det. Så snart den slutar lita på fältet slutar den använda det, vilket lämnar dig sämre ställd än om du inte skickat något lastmod alls. Ange det bara vid verkliga ändringar i huvudinnehållet, och utelämna det hellre än att hitta på det.
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/guides/indexing/</loc>
<lastmod>2026-06-14</lastmod>
</url>
</urlset> Att välja rätt verktyg
Nästan varje fråga på området löser sig så snart du skiljer på tre uppgifter som känns lika och inte är det.
| Mål | Verktyg | Varför |
|---|---|---|
| Sluta slösa genomsökning på skräpadresser | robots.txt | Hindrar hämtningen helt |
| Hålla en sida borta från resultaten | noindex, eller inloggning | Kräver hämtningen för att direktivet ska kunna läsas |
| Hjälpa sidor att upptäckas | Interna länkar, sedan en webbplatskarta | Länkar bär sammanhang, poster i en karta gör det inte |