Come verificare se una pagina è indicizzata su Google
Per verificare se una pagina è indicizzata su Google, incolla il suo URL nello strumento Controllo URL di Search Console, oppure fai una ricerca site: per avere una risposta approssimativa. Se la pagina non è indicizzata non può posizionarsi né ricevere traffico organico, per quanto sia fatta bene, e a chi la visita sembra comunque del tutto normale.
Qui sotto trovi quattro metodi, dal più rapido al più completo, i motivi più comuni per cui una pagina esce dall'indice e il perché un controllo fatto il mese scorso potrebbe non essere più valido.
Scansionata, indicizzata e posizionata sono tre stati diversi
Queste parole vengono usate come sinonimi, e quando leggi Search Console la cosa crea confusione.
Scansionata significa che Googlebot ha recuperato la pagina. Indicizzata significa che Google l'ha elaborata e l'ha memorizzata come idonea a comparire nei risultati. Posizionata significa che compare davvero nelle ricerche. Ogni passaggio dipende da quello precedente, ma nessuno garantisce il successivo. Una pagina può essere scansionata e non venire mai indicizzata, e una pagina indicizzata può posizionarsi in nona pagina.
Quando ti chiedi se una pagina è indicizzata, stai chiedendo del passaggio centrale. Se la risposta è no, il lavoro sui contenuti e sui link di quella pagina non serve finché non risolvi il problema di indicizzazione.
Metodo 1: l'operatore site:
Cerca su Google site: seguito dall'URL, per esempio site:example.com/prezzi/. Se compare un risultato, la pagina è quasi certamente indicizzata. Se non compare nulla, probabilmente non lo è.
È un test da cinque secondi e niente di più. L'operatore non mostra l'indice completo, a volte omette pagine che sono indicizzate e non ti dice nulla sul perché una pagina manca. Usalo per una verifica al volo, non per una diagnosi.
Metodo 2: il Controllo URL in Search Console
Per un singolo URL è la risposta più affidabile. Apri la proprietà in Google Search Console, incolla l'URL completo nella barra di controllo in alto e leggi l'esito: "L'URL è su Google" oppure "L'URL non è su Google".
La parte utile sono i dettagli sotto. Nella sezione sull'indicizzazione della pagina vedi se la scansione era consentita, se l'indicizzazione era consentita, la data dell'ultima scansione, il canonico dichiarato dall'utente e quello selezionato da Google. Se la pagina è esclusa, il motivo viene indicato, per esempio:
- Esclusa in base al tag "noindex"
- Bloccata da robots.txt
- Pagina alternativa con tag canonical appropriato
- Scansionata, ma attualmente non indicizzata
- Rilevata, ma attualmente non indicizzata
"Testa URL live" recupera la pagina così com'è in questo momento, ed è utile dopo una correzione, perché il report principale mostra la versione dell'ultima scansione di Google. Una volta risolto il problema, "Richiedi indicizzazione" chiede a Google di ripassare, anche se non garantisce l'inclusione. Il limite è che funziona un URL alla volta, e solo sulle proprietà che hai verificato.
Metodo 3: il report Pagine
Per un sito intero vai in Search Console su Indicizzazione, poi Pagine. Il grafico divide gli URL conosciuti tra indicizzati e non indicizzati, e la tabella sotto raggruppa quelli non indicizzati per motivo. Clicca su un motivo per vedere degli URL di esempio.
È qui che emergono gli schemi. Un singolo URL "Esclusa in base al tag 'noindex'" può essere voluto. Trecento URL comparsi nella stessa settimana indicano un template. Sempre qui ti accorgi se un'intera sezione è ferma su "Rilevata, ma attualmente non indicizzata". Il punto debole sono i tempi: i dati si aggiornano secondo il calendario di Google e in genere arrivano con qualche giorno di ritardo. Se trovi una riga su cui intervenire, la nostra guida per correggere gli errori di copertura dell'indice in GSC passa in rassegna ogni stato.
Metodo 4: un crawler per i segnali di blocco
Screaming Frog, Sitebulb e crawler simili non possono dirti cosa ha indicizzato Google. Possono però dirti se ogni pagina può essere indicizzata, perché riportano il tag meta robots, l'header HTTP X-Robots-Tag, il canonical e l'eventuale blocco nel robots.txt. Su un sito con migliaia di pagine è spesso il modo più veloce per trovare la causa dietro un gruppo di esclusioni.
Il limite è che va lanciato a mano, e mostra la situazione del giorno in cui fai la scansione.
Perché una pagina non viene indicizzata
Il primo motivo da escludere è una direttiva noindex. Può trovarsi nell'HTML come <meta name="robots" content="noindex"> oppure arrivare come header di risposta X-Robots-Tag: noindex, che nel sorgente della pagina non si vede. Il tag noindex, spiegato copre entrambi i casi.
Un Disallow nel robots.txt impedisce a Google di recuperare la pagina. Può sembrare strano, ma una pagina bloccata può comunque essere indicizzata senza contenuto se altri siti la linkano, quindi il blocco non è un modo affidabile per rimuovere un URL. Trovi i dettagli in come verificare il tuo robots.txt.
Un canonical che punta a un altro URL dice a Google che questa pagina è una copia, e quindi viene indicizzato l'altro URL.
La scoperta è il problema meno visibile: nessuna pagina ci linka e l'URL non è nella sitemap XML, quindi Google non l'ha trovata o non l'ha considerata prioritaria. Infine "Scansionata, ma attualmente non indicizzata" significa che Google ha recuperato la pagina e ha deciso di non tenerla, spesso perché gli sembra povera o troppo simile a un'altra.
I primi tre sono problemi di configurazione che di solito si sistemano in pochi minuti. Gli ultimi due richiedono lavoro sui contenuti e sui link interni.
Perché verificare una volta se la pagina è indicizzata non basta
Una verifica dell'indicizzazione ti dice com'era la situazione il giorno in cui l'hai fatta. Dopo, l'aggiornamento di un plugin può aggiungere un noindex, una migrazione può copiare in produzione il robots.txt di staging con Disallow: /, oppure una modifica al CMS può far puntare i canonical all'host sbagliato. La pagina era indicizzata quando hai controllato e adesso non lo è più, e Search Console lo mostra solo dopo che Google ha riscansionato e il report si è aggiornato.
Su un sito che segui da vicino, ripetere i controlli ogni tanto è fattibile. Su un portfolio di siti clienti dove i deploy li fanno altre persone, no. Deltio controlla ogni giorno le pagine presenti in ogni sitemap, legge il tag e l'header noindex, il canonical e il robots.txt, rileva gli URL rimossi dalla sitemap e, quando qualcosa cambia rispetto al controllo precedente, manda un alert su Slack o via email con il nome del sito e le pagine coinvolte. Ti segnala che una pagina ha smesso di essere indicizzabile, non cosa ha già fatto Google, quindi per confermare l'esito il posto giusto resta il Controllo URL. In alert sulle modifiche SEO spieghiamo quali modifiche vale la pena ricevere come alert.
Se vuoi che questi controlli girino sui tuoi siti, puoi attivare la prova gratuita di 14 giorni.
Domande frequenti
- Quanto tempo ci mette Google a indicizzare una pagina nuova?
- Non c'è un tempo fisso. Sui siti che Google scansiona spesso una pagina può essere indicizzata in un giorno o due, mentre i siti nuovi o aggiornati di rado possono aspettare settimane. Linkare la pagina da una pagina già indicizzata e inserirla nella sitemap XML aiuta Google a trovarla prima.
- "Richiedi indicizzazione" nel Controllo URL garantisce che la pagina venga indicizzata?
- No. Aggiunge l'URL alla coda di scansione di Google con una certa priorità, ma la decisione di indicizzarlo resta a Google. Se la pagina ha un noindex, è bloccata o viene giudicata di scarso valore, la richiesta non cambia il risultato. Esiste anche un limite giornaliero di richieste per proprietà.
- Una pagina bloccata dal robots.txt può comparire comunque su Google?
- Sì. Se altre pagine la linkano, Google può indicizzare l'URL senza scansionarlo, di solito mostrandolo senza descrizione. Per tenere una pagina fuori dai risultati consenti la scansione e usa un tag noindex o l'header X-Robots-Tag, perché Google deve recuperare la pagina per vedere il noindex.
- Come verifico l'indicizzazione di un PDF o di un'immagine invece di una pagina HTML?
- Il Controllo URL funziona con qualsiasi URL della proprietà verificata, PDF compresi. Questi file non possono contenere un tag meta robots, quindi la loro indicizzazione si gestisce con l'header HTTP X-Robots-Tag: se un PDF risulta escluso o incluso quando non te lo aspetti, controlla gli header di risposta.
- Cosa significa "Rilevata, ma attualmente non indicizzata"?
- Google sa che l'URL esiste, di solito grazie a una sitemap o a un link, ma non l'ha ancora scansionato. Sui siti grandi indica spesso un problema di priorità di scansione, quindi migliorare i link interni verso quelle pagine e togliere dalla sitemap gli URL di scarso valore aiuta più che inviare di nuovo la sitemap.