Permesso non è sinonimo di esclusione
robots.txt nega il permesso di scaricare un URL, e nient'altro. Google lo dice chiaramente: non è uno strumento per tenere una pagina fuori dalla Ricerca. Le due idee vengono confuse di continuo, e quella confusione produce un guasto preciso e ben visibile.
Un URL bloccato verso cui altri siti puntano può comunque essere indicizzato. Google sa che l'indirizzo esiste perché qualcuno lo ha collegato; semplicemente non può vedere cosa contiene. Così può mostrarlo senza alcuna descrizione — il peggio di entrambi i mondi, perché la pagina è pubblica nei risultati mentre tu non controlli come appare.
Leggere e scrivere il file
Il file sta nella radice di un host e vale solo per quell'host e quel protocollo. Le regole sono raggruppate per user-agent, e un crawler obbedisce al singolo gruppo più specifico che lo riguarda — non a ogni gruppo che potrebbe riguardarlo. All'interno di un gruppo Google risolve i conflitti con la regola più specifica, non con l'ordine.
User-agent: *
Disallow: /admin/
Disallow: /*.pdf$
Allow: /admin/public/
User-agent: Googlebot
Disallow: /drafts/
Sitemap: https://example.com/sitemap.xml Due dettagli di questo esempio concentrano quasi tutta la confusione. La riga Allow è più specifica del Disallow sopra, quindi /admin/public/ resta scaricabile. E non appena esiste un gruppo Googlebot, Googlebot obbedisce solo a quel gruppo — il gruppo jolly non lo riguarda più, perciò qui /admin/ è scaricabile da Googlebot. Non è quasi mai ciò che l'autore intendeva.
- Bloccare un percorso non rimuove gli URL già indicizzati: ferma soltanto le scansioni future.
- La direttiva Sitemap è indipendente da qualsiasi gruppo user-agent e può comparire ovunque nel file.
- Un 5xx sullo stesso robots.txt può portare un crawler a mettere da parte l'intero host, quindi servilo da qualcosa di affidabile.
Dove una regola robots fa danni lontanissimi da sé
Gli errori di robots.txt più costosi non sono le pagine che volevi bloccare. Sono le risorse che una pagina usa per essere renderizzata. I motori renderizzano le pagine prima di indicizzarle, e il rendering scarica script, fogli di stile e risposte API.
Blocca un percorso di script o una rotta API e il crawler continua a scaricare l'HTML senza problemi. Poi renderizza una pagina quasi vuota e indicizza una pagina quasi vuota. Nessun rapporto dirà che la pagina era bloccata, perché la pagina non lo era: lo era solo ciò che le serviva.
Una sitemap è un suggerimento, non una coda
Le sitemap aiutano la scoperta proprio dove il collegamento interno è più debole: siti grandi, siti appena nati con pochi link in entrata e siti pieni di media privi di un testo di ancoraggio naturale. Google afferma senza giri di parole che elencare un URL non garantisce né scansione né indicizzazione.
La stessa guida di Google dice che un sito piccolo e ben collegato potrebbe non averne alcun bisogno, perché il crawler trova tutto seguendo i link. Vale la pena prenderlo sul serio prima di costruire infrastruttura per sitemap allo scopo di risolvere un problema che i link interni risolverebbero meglio.
| Limite | Valore |
|---|---|
| URL per file di sitemap | 50.000 |
| Dimensione non compressa per file | 50 MB |
| Oltre uno dei due | Dividi e referenzia le parti da un indice di sitemap |
Quali tag vengono letti, ignorati o messi in dubbio
È qui che si spreca gran parte del lavoro sulle sitemap. Due dei quattro tag più comuni non fanno assolutamente nulla, e un terzo può giocare contro di te.
| Tag | Cosa ne fa Google |
|---|---|
| loc | Lo legge — è l'URL stesso |
| lastmod | Usato solo se coerente e verificabilmente corretto |
| changefreq | Ignorato |
| priority | Ignorato |
È la condizione su lastmod a mordere. Se la tua build timbra ogni URL con l'orario del rilascio, ogni valore è insieme falso e facile da smentire: la pagina non è cambiata, e il motore può accorgersene. Quando smette di fidarsi del campo smette di usarlo, e questo ti lascia peggio che se non inviassi alcun lastmod. Emettilo solo per modifiche reali al contenuto principale, e omettilo invece di inventarlo.
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/guides/indexing/</loc>
<lastmod>2026-06-14</lastmod>
</url>
</urlset> Scegliere lo strumento giusto
Quasi ogni domanda in questo campo si scioglie appena separi tre compiti che si somigliano e non coincidono.
| Obiettivo | Strumento | Perché |
|---|---|---|
| Smettere di sprecare scansione su URL inutili | robots.txt | Impedisce del tutto il download |
| Tenere una pagina fuori dai risultati | noindex, o autenticazione | Richiede il download perché la direttiva venga letta |
| Far scoprire le pagine | Link interni, poi una sitemap | I link portano contesto, le voci di sitemap no |