Vai al contenuto principale
← Tutte le guide

Come funzionano i motori di ricerca

Tra una pagina pubblicata e un risultato di ricerca ci sono tre fasi. Quasi ogni problema SEO appartiene esattamente a una, e nominare quella giusta evita di riparare quella sbagliata.

Le quattro fasi, e perché distinguerle conta

Un motore di ricerca esegue quattro passaggi distinti su una pagina, e uno può riuscire mentre quello successivo fallisce. La scoperta rende nota l'URL. La scansione la recupera. L'indicizzazione decide se memorizzarla. Il ranking decide, per ogni query, se mostrarla. Le funzionalità AI di Google fanno parte della Ricerca e dipendono ancora dalle stesse basi di scansione, indicizzazione e idoneità, anche se il recupero può estendersi a ricerche correlate.

Quasi ogni domanda che comincia con «perché la mia pagina non compare» è in realtà la domanda su quale fase si sia fermata. La risposta cambia completamente il seguito, e le fasi falliscono in modi che da fuori si somigliano: una pagina assente appare identica nei risultati sia che non sia mai stata scoperta, sia che sia stata bloccata al prelievo, giudicata non degna di essere conservata, oppure conservata e semplicemente superata.

FaseCosa succedeCome fallisce
ScopertaL'URL diventa noto, tramite un link o una sitemapNulla collega la pagina e nessuna sitemap la elenca
ScansioneL'URL viene prelevato e reso come in un browserrobots.txt nega il permesso, o il server restituisce errore
IndicizzazioneIl motore decide se archiviare la paginaIl contenuto è giudicato duplicato, scarno o non conservabile
RankingLe pagine archiviate sono valutate rispetto all'intentoLa pagina è archiviata ma esiste una risposta migliore

Scoperta: come un URL diventa noto

Google afferma che la stragrande maggioranza delle pagine nuove che trova ogni giorno arriva dai link. Un crawler che sta già prelevando una delle tue pagine ne estrae gli URL dal markup e li mette in coda. Questo rende i link interni il meccanismo primario di scoperta di qualsiasi sito, non un'ottimizzazione da applicare dopo.

Le sitemap sono la via secondaria. Contano soprattutto dove i collegamenti sono più deboli: siti molto grandi, siti nuovissimi con pochi link in entrata e siti carichi di media privi di anchor text naturale. Google è esplicito: elencare un URL non garantisce né la scansione né l'indicizzazione — è un suggerimento offerto in esame, non una coda che verrà smaltita.

La conseguenza pratica è che una pagina verso cui nulla punta si affida al più debole dei due meccanismi. Una voce di sitemap non porta contesto: dice che un URL esiste, ma nulla su cosa serva la pagina o su come si leghi al resto. Un link porta entrambe le cose, con la sua collocazione e il suo anchor text.

Scansione: permesso, capacità e domanda

La scansione è limitata da due cose che Google nomina separatamente. Il limite di capacità di scansione è quante connessioni simultanee aprirà senza gravare sul tuo server, e si adatta ai tuoi tempi di risposta e ai tassi di errore. La domanda di scansione è quanto vuole davvero prelevare, in base a dimensione del sito, frequenza di aggiornamento e valutazione della qualità.

La linea guida di Google è che la maggior parte dei siti non debba pensarci affatto. Il crawl budget diventa un tema reale sopra il milione di pagine aggiornate settimanalmente, sopra le diecimila pagine che cambiano ogni giorno, o su qualsiasi sito con una quota alta di URL bloccati su «Rilevata, ma non indicizzata». Sotto quella soglia, una scansione lenta è quasi sempre il sintomo di altro.

Dove si applica, le leve sono poco appariscenti: consolidare i duplicati, restituire un 404 o 410 vero per ciò che è rimosso in via definitiva invece di un soft 404, accorciare le catene di redirect, migliorare il tempo di risposta del server e supportare le richieste condizionali per rispondere a poco prezzo alle pagine immutate. Nota cosa manca da quell'elenco: noindex non è uno strumento di crawl budget, perché il crawler deve prelevare la pagina per leggere la direttiva.

Rendering: la fase che si dimentica

Tra il prelievo e l'indicizzazione sta il rendering. Il motore esegue la pagina più o meno come farebbe un browser, poi indicizza ciò che l'output reso contiene. I contenuti che compaiono solo dopo l'esecuzione di JavaScript possono quindi essere indicizzati — ma dipende dal buon esito di quell'esecuzione e dalla scansionabilità delle risorse necessarie.

È qui che una regola di robots.txt fa danni lontano da dove è stata scritta. Bloccare un percorso di script o di API impedisce al crawler di prelevare proprio i file con cui la pagina costruisce il contenuto. L'HTML si preleva benissimo, si rende quasi vuoto e si indicizza quasi vuoto. Nessuno stato dirà «bloccata»: la pagina in sé non lo è mai stata.

L'indicizzazione è un giudizio, non una coda

La lettura errata più comune dell'intera catena è trattare l'indicizzazione come una fila: farsi scansionare, aspettare il turno, farsi indicizzare. Non funziona così. Dopo il rendering il motore decide se la pagina meriti di essere archiviata, e quella decisione può essere no.

È esattamente ciò che Search Console intende con «Scansionata, ma attualmente non indicizzata». Nulla è rotto, nulla blocca, il prelievo è riuscito. La pagina è stata valutata e messa da parte. Pagine quasi identiche generate da un template — che differiscono solo per un nome o un numero sostituito — ne sono il motivo abituale, e reinviarle non cambia nulla, perché non è cambiato il dato su cui quella decisione si basa.

Il ranking e le funzionalità AI di Google condividono le stesse basi

Per una determinata query, la Ricerca recupera e classifica il materiale pertinente. AI Overviews e AI Mode possono inoltre usare query fan-out, eseguendo più ricerche correlate su sottoargomenti e fonti di dati prima di generare una risposta con link di supporto.

La conseguenza è semplice: la visibilità nelle funzionalità di ricerca AI di Google dipende ancora dalla normale idoneità alla ricerca. Google afferma che non ci sono requisiti tecnici aggiuntivi o markup AI speciale; la scansione deve essere consentita, i contenuti importanti dovrebbero essere indicizzabili e disponibili sotto forma di testo e i controlli di anteprima come nosnippet possono limitare ciò che appare nelle funzionalità AI.

Provalo sul tuo sito

Domande e risposte

Bloccare una pagina in robots.txt la rimuove da Google?

No. robots.txt ferma il prelievo, non l'indicizzazione. Un URL bloccato verso cui altri siti puntano può essere indicizzato e mostrato senza descrizione, perché il crawler non ha mai potuto leggere il noindex che l'avrebbe escluso. Per tenere una pagina fuori, lascia che venga scansionata e servi un noindex, oppure richiedi autenticazione.

Quanto dovrebbe durare l'indicizzazione?

Non c'è una finestra garantita. Una pagina nuova può essere indicizzata in ore o restare ferma per settimane, e Google dice chiaramente che essere scansionati non promette l'inclusione. Se una pagina resta non indicizzata per settimane mentre pagine simili dello stesso sito sono entrate in fretta, trattalo come un giudizio sulla pagina, non come un ritardo.

Devo preoccuparmi del crawl budget?

Quasi certamente no. Le soglie di Google si aggirano sul milione di pagine aggiornate a settimana o diecimila pagine che cambiano ogni giorno. Sotto quelle cifre, le pagine lente a comparire di solito falliscono in indicizzazione, non attendono capacità di scansione.

I contenuti in JavaScript possono essere indicizzati?

Sì, perché il motore rende le pagine prima di indicizzarle. Il rischio non è JavaScript in sé ma le sue dipendenze: se robots.txt blocca gli script o gli endpoint che servono alla pagina, questa si rende vuota e viene indicizzata vuota, senza che alcuno stato ne nomini la causa.