Vai al contenuto principale
← Tutte le guide

robots.txt e sitemap

Entrambi i file dicono qualcosa a un crawler sui tuoi URL, e nessuno dei due fa ciò che si dà per scontato. Uno nega il permesso di scaricare. L'altro propone un elenco da valutare.

Permesso non è sinonimo di esclusione

robots.txt nega il permesso di scaricare un URL, e nient'altro. Google lo dice chiaramente: non è uno strumento per tenere una pagina fuori dalla Ricerca. Le due idee vengono confuse di continuo, e quella confusione produce un guasto preciso e ben visibile.

Un URL bloccato verso cui altri siti puntano può comunque essere indicizzato. Google sa che l'indirizzo esiste perché qualcuno lo ha collegato; semplicemente non può vedere cosa contiene. Così può mostrarlo senza alcuna descrizione — il peggio di entrambi i mondi, perché la pagina è pubblica nei risultati mentre tu non controlli come appare.

Leggere e scrivere il file

Il file sta nella radice di un host e vale solo per quell'host e quel protocollo. Le regole sono raggruppate per user-agent, e un crawler obbedisce al singolo gruppo più specifico che lo riguarda — non a ogni gruppo che potrebbe riguardarlo. All'interno di un gruppo Google risolve i conflitti con la regola più specifica, non con l'ordine.

robots.txt
User-agent: *
Disallow: /admin/
Disallow: /*.pdf$
Allow: /admin/public/

User-agent: Googlebot
Disallow: /drafts/

Sitemap: https://example.com/sitemap.xml

Due dettagli di questo esempio concentrano quasi tutta la confusione. La riga Allow è più specifica del Disallow sopra, quindi /admin/public/ resta scaricabile. E non appena esiste un gruppo Googlebot, Googlebot obbedisce solo a quel gruppo — il gruppo jolly non lo riguarda più, perciò qui /admin/ è scaricabile da Googlebot. Non è quasi mai ciò che l'autore intendeva.

  • Bloccare un percorso non rimuove gli URL già indicizzati: ferma soltanto le scansioni future.
  • La direttiva Sitemap è indipendente da qualsiasi gruppo user-agent e può comparire ovunque nel file.
  • Un 5xx sullo stesso robots.txt può portare un crawler a mettere da parte l'intero host, quindi servilo da qualcosa di affidabile.

Dove una regola robots fa danni lontanissimi da sé

Gli errori di robots.txt più costosi non sono le pagine che volevi bloccare. Sono le risorse che una pagina usa per essere renderizzata. I motori renderizzano le pagine prima di indicizzarle, e il rendering scarica script, fogli di stile e risposte API.

Blocca un percorso di script o una rotta API e il crawler continua a scaricare l'HTML senza problemi. Poi renderizza una pagina quasi vuota e indicizza una pagina quasi vuota. Nessun rapporto dirà che la pagina era bloccata, perché la pagina non lo era: lo era solo ciò che le serviva.

Una sitemap è un suggerimento, non una coda

Le sitemap aiutano la scoperta proprio dove il collegamento interno è più debole: siti grandi, siti appena nati con pochi link in entrata e siti pieni di media privi di un testo di ancoraggio naturale. Google afferma senza giri di parole che elencare un URL non garantisce né scansione né indicizzazione.

La stessa guida di Google dice che un sito piccolo e ben collegato potrebbe non averne alcun bisogno, perché il crawler trova tutto seguendo i link. Vale la pena prenderlo sul serio prima di costruire infrastruttura per sitemap allo scopo di risolvere un problema che i link interni risolverebbero meglio.

LimiteValore
URL per file di sitemap50.000
Dimensione non compressa per file50 MB
Oltre uno dei dueDividi e referenzia le parti da un indice di sitemap

Quali tag vengono letti, ignorati o messi in dubbio

È qui che si spreca gran parte del lavoro sulle sitemap. Due dei quattro tag più comuni non fanno assolutamente nulla, e un terzo può giocare contro di te.

TagCosa ne fa Google
locLo legge — è l'URL stesso
lastmodUsato solo se coerente e verificabilmente corretto
changefreqIgnorato
priorityIgnorato

È la condizione su lastmod a mordere. Se la tua build timbra ogni URL con l'orario del rilascio, ogni valore è insieme falso e facile da smentire: la pagina non è cambiata, e il motore può accorgersene. Quando smette di fidarsi del campo smette di usarlo, e questo ti lascia peggio che se non inviassi alcun lastmod. Emettilo solo per modifiche reali al contenuto principale, e omettilo invece di inventarlo.

sitemap.xml
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/guides/indexing/</loc>
    <lastmod>2026-06-14</lastmod>
  </url>
</urlset>

Scegliere lo strumento giusto

Quasi ogni domanda in questo campo si scioglie appena separi tre compiti che si somigliano e non coincidono.

ObiettivoStrumentoPerché
Smettere di sprecare scansione su URL inutilirobots.txtImpedisce del tutto il download
Tenere una pagina fuori dai risultatinoindex, o autenticazioneRichiede il download perché la direttiva venga letta
Far scoprire le pagineLink interni, poi una sitemapI link portano contesto, le voci di sitemap no

Domande e risposte

Posso combinare disallow e noindex?

No, ed è l'errore classico. Se robots.txt blocca l'URL, il crawler non scarica mai la pagina e non vede mai il noindex. Consenti la scansione e servi il noindex, oppure metti la pagina dietro un'autenticazione.

Mi serve davvero una sitemap?

Non sempre. Google indica che un sito piccolo e ben collegato si scopre seguendo i link. Le sitemap si giustificano su siti grandi, siti appena nati con pochi link in entrata e contenuti multimediali abbondanti.

Perché una pagina che ho bloccato compare ancora su Google?

Perché robots.txt ha fermato il download, non l'indicizzazione. Altri siti puntano a quell'URL, quindi Google sa che esiste ma non vede il contenuto: da qui una voce senza descrizione. Consenti la scansione e servi un noindex per rimuoverla come si deve.

Devo impostare priority e changefreq?

No. Google ignora entrambi. Quel lavoro rende di più speso a rendere lastmod accurato, o sui link interni.

Cosa succede se robots.txt restituisce un errore?

Un 5xx può portare un crawler a mettere da parte l'host invece di dare tutto per consentito. Servi robots.txt da un'infrastruttura affidabile almeno quanto il sito stesso.