La balise Noindex expliquée : ce qu'elle fait et quand l'utiliser
Une balise noindex est une instruction qui demande aux moteurs de recherche de ne pas afficher une page dans leurs résultats. Elle peut se trouver dans le HTML sous forme de balise meta robots ou être envoyée dans un en-tête HTTP, et on la confond souvent avec nofollow et avec un Disallow dans le robots.txt, qui ont d'autres rôles.
Utilisée volontairement, c'est l'un des outils les plus pratiques du SEO technique. Placée par accident sur une page qui génère du trafic, elle retire cette page de Google sans message d'erreur ni changement visible sur la page elle-même.
Ce que fait une balise noindex, et ce qu'elle ne fait pas
Quand Googlebot explore une page et y trouve noindex, la page est retirée de l'index. À partir de là, elle n'apparaît plus pour aucune requête, quelle que soit la qualité de son contenu ou de ses backlinks.
Ses limites comptent tout autant. noindex n'empêche pas l'exploration : Googlebot doit récupérer la page pour pouvoir lire l'instruction. La balise ne supprime pas la page, ne change rien pour les visiteurs et n'a pas d'effet direct sur les autres pages du site.
Il existe un effet secondaire à long terme. Google a indiqué qu'une page laissée longtemps en noindex finit par être moins explorée et que ses liens sont alors traités comme s'ils étaient en nofollow. Un noindex installé durablement sur une page hub ou une catégorie peut donc affaiblir les liens internes vers les pages situées en dessous.
La balise meta et l'en-tête X-Robots-Tag
La balise meta robots se place dans le <head> :
<meta name="robots" content="noindex">
name="robots" s'applique à tous les robots qui la respectent, tandis que name="googlebot" ne vise que Google. Les directives peuvent être combinées avec une virgule, comme dans content="noindex, follow", qui garde la page hors des résultats tout en laissant les robots suivre ses liens (sous réserve de l'effet à long terme décrit plus haut).
La même instruction peut être envoyée dans un en-tête de réponse HTTP :
X-Robots-Tag: noindex
Cet en-tête existe parce que tous les fichiers n'ont pas de <head>. C'est le seul moyen de passer en noindex un PDF, une image ou un fichier texte. Sur Apache, une règle .htaccess comme celle-ci l'applique à tous les PDF du site :
<Files ~ "\.pdf$">
Header set X-Robots-Tag "noindex"
</Files>
Sur Nginx, add_header X-Robots-Tag "noindex"; dans un bloc location produit le même effet.
C'est aussi dans l'en-tête que se cachent les noindex indésirables. Il n'apparaît jamais dans le code source : une page peut sembler propre quand on affiche sa source alors que le serveur demande à Google de la retirer. Vous ne le verrez que dans les en-têtes de réponse, soit dans l'onglet Réseau des outils de développement du navigateur, soit avec curl -sI sur l'URL.
Noindex, nofollow et Disallow : trois instructions différentes
| Instruction | Où elle se trouve | Ce qu'elle contrôle | Effet |
|---|---|---|---|
noindex |
Balise meta ou en-tête HTTP | L'indexation | Garde la page hors des résultats de recherche |
nofollow |
Balise meta ou attribut rel d'un lien |
Les liens | Demande aux moteurs de ne pas suivre les liens ni de transmettre de valeur par leur intermédiaire |
Disallow |
robots.txt | L'exploration | Demande aux moteurs de ne pas récupérer l'URL du tout |
La confusion qui coûte cher est celle entre noindex et Disallow. Une règle Disallow empêche Google de récupérer l'URL, ce qui signifie qu'il ne pourra jamais voir un noindex sur cette page. L'URL peut rester indexée, généralement affichée sans description, parce que Google la connaît grâce aux liens. Pour retirer une page des résultats, laissez-la explorable et utilisez noindex. C'est seulement une fois la page sortie de l'index que vous pouvez ajouter un Disallow, si vous voulez aussi empêcher son exploration.
Une ligne noindex dans le robots.txt n'a jamais été une règle officielle, et Google a complètement cessé d'en tenir compte en septembre 2019.
Si une page doit disparaître vite de Google, l'outil « Suppressions » de la Search Console la masque dans les résultats pendant environ six mois. C'est temporaire. C'est le noindex, ou la suppression de la page, qui rend le retrait durable.
Les pages qui devraient porter un noindex
- Les pages de remerciement et de confirmation de commande
- Les résultats de recherche interne, qui peuvent générer un nombre quasi illimité d'URL sans contenu
- Les environnements de préproduction et de développement, idéalement protégés aussi par un mot de passe
- Les pages de connexion, de compte client et de panier
- Les variantes pauvres qui doivent exister pour les utilisateurs, comme les versions imprimables
Pour les doublons qui ont une version principale évidente, une balise canonical est souvent le meilleur choix, car elle regroupe les signaux sur l'URL principale au lieu de simplement écarter le doublon.
Comment un noindex se retrouve sur la mauvaise page
Presque toujours à cause d'un changement que personne n'a relié au SEO. Une configuration ou une base de données de préproduction est copiée en production et emporte son noindex avec elle. Sur WordPress, la case « Demander aux moteurs de recherche de ne pas indexer ce site », dans Réglages > Lecture, reste cochée après le lancement. Une mise à jour ou une réinitialisation d'extension SEO passe tout un type de contenu en noindex. Un développeur ajoute une règle d'en-tête pour masquer une section en construction et l'oublie au lancement.
La page continue de se charger normalement, et personne côté client ne remarque quoi que ce soit. Google réexplore la page, lit la directive et retire l'URL, et le graphique de trafic le montre des semaines plus tard. Retirer la balise prend quelques minutes. C'est le temps mis à s'en apercevoir qui fait les dégâts. Le côté pratique de la détection est traité dans comment détecter un noindex en production.
Vérifier et surveiller les balises noindex
Pour une URL isolée, l'outil Inspection de l'URL de la Search Console est la vérification la plus fiable. Il indique si l'indexation est autorisée et si un blocage vient de la balise meta robots ou de l'en-tête X-Robots-Tag. Le rapport « Indexation des pages » liste toutes les URL trouvées par Google sous « Exclue par la balise noindex » ; il vaut la peine de le consulter après chaque mise en production importante pour confirmer que la liste ne contient que les pages que vous vouliez exclure.
Les deux dépendent de quelqu'un qui décide d'aller voir, et les deux reflètent la dernière exploration de Google plutôt que la page telle qu'elle est aujourd'hui. Sur les sites clients, Deltio prend l'autre chemin. Il vérifie chaque jour les pages de chaque sitemap, lit le noindex à la fois dans la balise meta et dans l'en-tête, et envoie une alerte Slack et e-mail quand une page indexable lors du contrôle précédent ne l'est plus. Les changements du robots.txt, les changements de canonical et les URL qui quittent le sitemap sont comparés de la même façon. Si vous voulez des alertes limitées à ces événements, voyez les alertes de changement SEO, ou essayez Deltio gratuitement pendant 14 jours.
Questions fréquentes
- Comment passer une seule page en noindex sur WordPress ?
- Avec Yoast SEO, ouvrez la page dans l'éditeur, allez dans la section Avancé du panneau Yoast et réglez « Autoriser les moteurs de recherche à afficher ce contenu dans les résultats de recherche ? » sur Non. Avec Rank Math, ouvrez l'onglet Avancé de son panneau et cochez No Index sous Robots Meta. Dans les deux cas, la balise meta robots n'est ajoutée qu'à cette page.
- Une page peut-elle avoir à la fois un noindex et une canonical qui pointe vers une autre URL ?
- C'est possible, mais mieux vaut l'éviter. Une canonical indique que la page est un doublon d'une autre URL sur laquelle les signaux doivent être regroupés ; un noindex demande de retirer la page. Les deux envoient des signaux contradictoires : choisissez celui qui correspond à votre intention.
- Bing respecte-t-il la balise noindex ?
- Oui. Bing prend en charge la balise meta robots comme l'en-tête X-Robots-Tag, et vous pouvez le cibler spécifiquement avec name="bingbot" dans la balise meta.
- Peut-on faire disparaître automatiquement une page des résultats à une date donnée ?
- Google prend en charge la directive unavailable_after, par exemple <meta name="robots" content="unavailable_after: 2026-12-31">, ou la même valeur dans un en-tête X-Robots-Tag. Après cette date, la page n'apparaît plus dans les résultats, ce qui est utile pour des événements ou des offres limitées dans le temps.
- Une page en noindex doit-elle rester dans le sitemap XML ?
- Non. Un sitemap ne doit lister que les URL que vous voulez voir indexées. Y laisser une URL en noindex envoie un signal contradictoire et encombre le rapport Indexation des pages de la Search Console.