Le quattro fasi, e perché distinguerle conta
Un motore di ricerca esegue quattro passaggi distinti su una pagina, e uno può riuscire mentre quello successivo fallisce. La scoperta rende nota l'URL. La scansione la recupera. L'indicizzazione decide se memorizzarla. Il ranking decide, per ogni query, se mostrarla. Le funzionalità AI di Google fanno parte della Ricerca e dipendono ancora dalle stesse basi di scansione, indicizzazione e idoneità, anche se il recupero può estendersi a ricerche correlate.
Quasi ogni domanda che comincia con «perché la mia pagina non compare» è in realtà la domanda su quale fase si sia fermata. La risposta cambia completamente il seguito, e le fasi falliscono in modi che da fuori si somigliano: una pagina assente appare identica nei risultati sia che non sia mai stata scoperta, sia che sia stata bloccata al prelievo, giudicata non degna di essere conservata, oppure conservata e semplicemente superata.
| Fase | Cosa succede | Come fallisce |
|---|---|---|
| Scoperta | L'URL diventa noto, tramite un link o una sitemap | Nulla collega la pagina e nessuna sitemap la elenca |
| Scansione | L'URL viene prelevato e reso come in un browser | robots.txt nega il permesso, o il server restituisce errore |
| Indicizzazione | Il motore decide se archiviare la pagina | Il contenuto è giudicato duplicato, scarno o non conservabile |
| Ranking | Le pagine archiviate sono valutate rispetto all'intento | La pagina è archiviata ma esiste una risposta migliore |
Scoperta: come un URL diventa noto
Google afferma che la stragrande maggioranza delle pagine nuove che trova ogni giorno arriva dai link. Un crawler che sta già prelevando una delle tue pagine ne estrae gli URL dal markup e li mette in coda. Questo rende i link interni il meccanismo primario di scoperta di qualsiasi sito, non un'ottimizzazione da applicare dopo.
Le sitemap sono la via secondaria. Contano soprattutto dove i collegamenti sono più deboli: siti molto grandi, siti nuovissimi con pochi link in entrata e siti carichi di media privi di anchor text naturale. Google è esplicito: elencare un URL non garantisce né la scansione né l'indicizzazione — è un suggerimento offerto in esame, non una coda che verrà smaltita.
La conseguenza pratica è che una pagina verso cui nulla punta si affida al più debole dei due meccanismi. Una voce di sitemap non porta contesto: dice che un URL esiste, ma nulla su cosa serva la pagina o su come si leghi al resto. Un link porta entrambe le cose, con la sua collocazione e il suo anchor text.
Scansione: permesso, capacità e domanda
La scansione è limitata da due cose che Google nomina separatamente. Il limite di capacità di scansione è quante connessioni simultanee aprirà senza gravare sul tuo server, e si adatta ai tuoi tempi di risposta e ai tassi di errore. La domanda di scansione è quanto vuole davvero prelevare, in base a dimensione del sito, frequenza di aggiornamento e valutazione della qualità.
La linea guida di Google è che la maggior parte dei siti non debba pensarci affatto. Il crawl budget diventa un tema reale sopra il milione di pagine aggiornate settimanalmente, sopra le diecimila pagine che cambiano ogni giorno, o su qualsiasi sito con una quota alta di URL bloccati su «Rilevata, ma non indicizzata». Sotto quella soglia, una scansione lenta è quasi sempre il sintomo di altro.
Dove si applica, le leve sono poco appariscenti: consolidare i duplicati, restituire un 404 o 410 vero per ciò che è rimosso in via definitiva invece di un soft 404, accorciare le catene di redirect, migliorare il tempo di risposta del server e supportare le richieste condizionali per rispondere a poco prezzo alle pagine immutate. Nota cosa manca da quell'elenco: noindex non è uno strumento di crawl budget, perché il crawler deve prelevare la pagina per leggere la direttiva.
Rendering: la fase che si dimentica
Tra il prelievo e l'indicizzazione sta il rendering. Il motore esegue la pagina più o meno come farebbe un browser, poi indicizza ciò che l'output reso contiene. I contenuti che compaiono solo dopo l'esecuzione di JavaScript possono quindi essere indicizzati — ma dipende dal buon esito di quell'esecuzione e dalla scansionabilità delle risorse necessarie.
È qui che una regola di robots.txt fa danni lontano da dove è stata scritta. Bloccare un percorso di script o di API impedisce al crawler di prelevare proprio i file con cui la pagina costruisce il contenuto. L'HTML si preleva benissimo, si rende quasi vuoto e si indicizza quasi vuoto. Nessuno stato dirà «bloccata»: la pagina in sé non lo è mai stata.
L'indicizzazione è un giudizio, non una coda
La lettura errata più comune dell'intera catena è trattare l'indicizzazione come una fila: farsi scansionare, aspettare il turno, farsi indicizzare. Non funziona così. Dopo il rendering il motore decide se la pagina meriti di essere archiviata, e quella decisione può essere no.
È esattamente ciò che Search Console intende con «Scansionata, ma attualmente non indicizzata». Nulla è rotto, nulla blocca, il prelievo è riuscito. La pagina è stata valutata e messa da parte. Pagine quasi identiche generate da un template — che differiscono solo per un nome o un numero sostituito — ne sono il motivo abituale, e reinviarle non cambia nulla, perché non è cambiato il dato su cui quella decisione si basa.
Il ranking e le funzionalità AI di Google condividono le stesse basi
Per una determinata query, la Ricerca recupera e classifica il materiale pertinente. AI Overviews e AI Mode possono inoltre usare query fan-out, eseguendo più ricerche correlate su sottoargomenti e fonti di dati prima di generare una risposta con link di supporto.
La conseguenza è semplice: la visibilità nelle funzionalità di ricerca AI di Google dipende ancora dalla normale idoneità alla ricerca. Google afferma che non ci sono requisiti tecnici aggiuntivi o markup AI speciale; la scansione deve essere consentita, i contenuti importanti dovrebbero essere indicizzabili e disponibili sotto forma di testo e i controlli di anteprima come nosnippet possono limitare ciò che appare nelle funzionalità AI.