Il Tag Noindex Spiegato: Cosa Fa e Quando Usarlo
Un tag noindex è un'istruzione che dice ai motori di ricerca di tenere una pagina fuori dai risultati. Può trovarsi nell'HTML come meta tag robots oppure essere inviato come header HTTP, e viene spesso confuso con nofollow e con il Disallow del robots.txt, che servono a cose diverse.
Usato di proposito, è uno degli strumenti più pratici della SEO tecnica. Finito per sbaglio su una pagina che porta traffico, la toglie da Google senza nessun messaggio di errore e senza cambiamenti visibili sulla pagina.
Cosa fa il tag noindex, e cosa non fa
Quando Googlebot scansiona una pagina e trova noindex, la pagina viene esclusa dall'indice. Da quel momento non compare più per nessuna query, per quanto buoni siano i suoi contenuti o i suoi backlink.
I limiti contano altrettanto. noindex non impedisce la scansione: anzi, Googlebot deve scaricare la pagina proprio per leggere l'istruzione. Non cancella la pagina, non cambia nulla per i visitatori e non ha effetti diretti sulle altre pagine del sito.
C'è un effetto collaterale sul lungo periodo. Google ha spiegato che una pagina lasciata in noindex a lungo finisce per essere scansionata meno spesso e i suoi link vengono trattati come se fossero nofollow. Un noindex tenuto per mesi su una pagina hub o su una categoria può quindi indebolire i link interni verso le pagine che stanno sotto.
Il meta tag e l'header X-Robots-Tag
Il meta tag robots va nell'<head>:
<meta name="robots" content="noindex">
name="robots" vale per tutti i crawler che lo rispettano, mentre name="googlebot" si rivolge solo a Google. Le direttive si combinano con una virgola, come in content="noindex, follow", che tiene la pagina fuori dai risultati ma lascia ai crawler la possibilità di seguirne i link (con il limite di lungo periodo visto sopra).
La stessa istruzione può essere inviata come header della risposta HTTP:
X-Robots-Tag: noindex
L'header esiste perché non tutti i file hanno un <head>. È l'unico modo per mettere in noindex un PDF, un'immagine o un file di testo. Su Apache una regola .htaccess come questa lo applica a tutti i PDF del sito:
<Files ~ "\.pdf$">
Header set X-Robots-Tag "noindex"
</Files>
Su Nginx ottieni lo stesso risultato con add_header X-Robots-Tag "noindex"; dentro un blocco location.
L'header è anche il posto dove si nascondono i noindex indesiderati. Non compare mai nel sorgente della pagina, quindi una pagina può sembrare pulita in "Visualizza sorgente" mentre il server dice a Google di escluderla. Lo vedi solo negli header di risposta, nella scheda Network degli strumenti per sviluppatori del browser oppure con curl -sI sull'URL.
Noindex, nofollow e Disallow a confronto
| Istruzione | Dove si trova | Cosa controlla | Effetto |
|---|---|---|---|
noindex |
Meta tag o header HTTP | Indicizzazione | Tiene la pagina fuori dai risultati di ricerca |
nofollow |
Meta tag o attributo rel del link |
Link | Dice ai motori di non seguire i link e di non trasmettere valore attraverso di essi |
Disallow |
robots.txt | Scansione | Chiede ai motori di non scaricare affatto l'URL |
La confusione che costa cara è quella tra noindex e Disallow. Una regola Disallow impedisce a Google di scaricare l'URL, e quindi Google non potrà mai vedere un noindex su quella pagina. L'URL può restare indicizzato, di solito senza descrizione, perché Google lo conosce comunque grazie ai link. Per togliere una pagina dai risultati lasciala scansionabile e usa noindex. Solo quando è uscita dall'indice puoi aggiungere un Disallow, se vuoi anche impedirne la scansione.
Una riga noindex dentro il robots.txt non è mai stata una regola ufficiale, e Google ha smesso del tutto di rispettarla a settembre 2019.
Se una pagina deve sparire da Google in fretta, lo strumento Rimozioni di Search Console la nasconde dai risultati per circa sei mesi. È una misura temporanea: a rendere definitiva la rimozione sono il noindex o l'eliminazione della pagina.
Le pagine che dovrebbero avere il noindex
- Pagine di ringraziamento e di conferma ordine
- Risultati della ricerca interna, che possono generare un numero quasi illimitato di URL con poco contenuto
- Ambienti di staging e sviluppo, possibilmente anche protetti da password
- Pagine di login, account e carrello
- Varianti con poco contenuto che devono esistere per gli utenti, come le versioni stampabili
Per i duplicati che hanno una versione principale evidente, spesso è meglio un tag canonical, che consolida i segnali sull'URL principale invece di scartare semplicemente il duplicato.
Come un noindex finisce sulla pagina sbagliata
Quasi sempre con una modifica che nessuno ha collegato alla SEO. Una configurazione o un database di staging vengono copiati in produzione e si portano dietro il noindex. Su WordPress la casella "Scoraggia i motori di ricerca dall'effettuare l'indicizzazione di questo sito" in Impostazioni > Lettura resta spuntata dopo il lancio. Un aggiornamento o un reset delle impostazioni di un plugin SEO manda in noindex un intero tipo di contenuto. Uno sviluppatore aggiunge una regola sugli header per nascondere una sezione in costruzione e se ne dimentica al lancio.
La pagina continua a caricarsi normalmente, quindi dal lato del cliente nessuno nota niente. Google riscansiona, legge la direttiva ed esclude l'URL, e il grafico del traffico lo mostra settimane dopo. Togliere il tag richiede pochi minuti; il danno lo fa il tempo che passa prima di accorgersene. La parte pratica, cioè come trovarlo, è in come intercettare un noindex in produzione.
Controllare e monitorare il noindex
Per un singolo URL, lo strumento Controllo URL di Search Console è la verifica più affidabile. Ti dice se l'indicizzazione è consentita e se l'eventuale blocco arriva dal meta tag robots o dall'header X-Robots-Tag. Il report Indicizzazione delle pagine elenca tutti gli URL trovati da Google sotto "Esclusa in base al tag 'noindex'", e conviene leggerlo dopo ogni rilascio importante per verificare che contenga solo le pagine che volevi escludere.
Entrambi dipendono dal fatto che qualcuno decida di guardare, ed entrambi riflettono l'ultima scansione di Google e non la pagina com'è oggi. Sui siti dei clienti Deltio segue l'altra strada. Controlla ogni giorno le pagine presenti in ciascuna sitemap, legge il noindex sia dal meta tag sia dall'header, e ti avvisa su Slack ed email quando una pagina che al controllo precedente era indicizzabile non lo è più. Allo stesso modo confronta le modifiche al robots.txt, i canonical cambiati e gli URL che escono dalla sitemap. Se vuoi alert limitati a questi eventi, leggi gli alert sui cambiamenti SEO, oppure prova Deltio gratis per 14 giorni.
Domande frequenti
- Come metto in noindex una singola pagina su WordPress?
- Con Yoast SEO apri la pagina nell'editor, vai nella sezione Avanzate del pannello Yoast e rispondi No alla domanda che chiede se consentire ai motori di ricerca di mostrare il contenuto nei risultati. Con Rank Math apri la scheda Avanzate del suo pannello e spunta No Index sotto Robots Meta. In entrambi i casi il meta tag robots viene aggiunto solo a quella pagina.
- Una pagina può avere sia un noindex sia un canonical verso un altro URL?
- Può, ma è meglio evitarlo. Il canonical dice che la pagina è un duplicato di un altro URL su cui consolidare i segnali; il noindex dice di escludere la pagina. I due segnali sono in conflitto, quindi scegli quello che corrisponde a ciò che vuoi ottenere.
- Bing rispetta il tag noindex?
- Sì. Bing supporta sia il meta tag robots sia l'header X-Robots-Tag, e puoi rivolgerti solo a lui con name="bingbot" nel meta tag.
- Posso far uscire una pagina dai risultati in automatico a una certa data?
- Google supporta la direttiva unavailable_after, per esempio <meta name="robots" content="unavailable_after: 2026-12-31">, oppure lo stesso valore in un header X-Robots-Tag. Dopo quella data la pagina smette di comparire nei risultati, il che è utile per eventi e offerte a tempo.
- Una pagina in noindex deve restare nella sitemap XML?
- No. Una sitemap dovrebbe elencare solo gli URL che vuoi indicizzati. Tenerci un URL in noindex manda un segnale contraddittorio e affolla il report Indicizzazione delle pagine in Search Console.