Comment vérifier si une page est indexée sur Google
Pour vérifier si une page est indexée sur Google, collez son URL dans l'outil Inspection de l'URL de la Search Console, ou lancez une recherche site: pour obtenir une réponse rapide et approximative. Une page non indexée ne peut ni se positionner ni recevoir de trafic organique, quelle que soit sa qualité, et elle paraît pourtant parfaitement normale à qui la visite.
Voici quatre façons de vérifier, de la plus rapide à la plus complète, puis les raisons habituelles pour lesquelles une page sort de l'index, et pourquoi une vérification faite le mois dernier n'est peut-être plus vraie aujourd'hui.
Explorée, indexée, positionnée : trois états différents
On emploie souvent ces mots l'un pour l'autre, ce qui crée de la confusion à la lecture de la Search Console.
Explorée signifie que Googlebot a récupéré la page. Indexée signifie que Google l'a traitée et enregistrée comme éligible aux résultats. Positionnée signifie qu'elle apparaît réellement sur des recherches. Chaque étape dépend de la précédente, mais aucune ne garantit la suivante. Une page peut être explorée sans jamais être indexée, et une page indexée peut se positionner en neuvième page.
Quand vous demandez si une page est indexée, vous vous interrogez sur l'étape du milieu. Si la réponse est non, le travail de contenu et de liens sur cette page ne servira à rien tant que le problème d'indexation n'est pas réglé.
Méthode 1 : l'opérateur site:
Recherchez sur Google site: suivi de l'URL, par exemple site:example.com/tarifs/. Si un résultat s'affiche, la page est presque certainement indexée. Si rien ne s'affiche, elle ne l'est probablement pas.
C'est un test de cinq secondes, rien de plus. L'opérateur ne donne pas une vue complète de l'index, il omet parfois des pages indexées et ne dit rien de la raison pour laquelle une page manque. Servez-vous-en comme d'un contrôle rapide, pas comme d'un diagnostic.
Méthode 2 : l'Inspection de l'URL dans la Search Console
Pour une URL isolée, c'est la réponse qui fait foi. Ouvrez la propriété dans Google Search Console, collez l'URL complète dans la barre d'inspection en haut de l'écran et lisez le verdict : « L'URL est sur Google » ou « L'URL n'est pas sur Google ».
L'intérêt est dans le détail affiché en dessous. Dans la section Indexation de la page, vous voyez si l'exploration était autorisée, si l'indexation était autorisée, la date de la dernière exploration, l'URL canonique déclarée par l'utilisateur et celle sélectionnée par Google. Si la page est exclue, la raison est nommée, par exemple :
- Exclue par la balise « noindex »
- Bloquée par le fichier robots.txt
- Autre page avec balise canonique correcte
- Explorée, actuellement non indexée
- Détectée, actuellement non indexée
« Tester l'URL en ligne » récupère la page telle qu'elle est à cet instant, ce qui sert après une correction, puisque le rapport principal montre la version du dernier passage de Google. Une fois le problème résolu, « Demander une indexation » demande à Google de réexplorer la page, sans garantir son inclusion. La limite de l'outil est qu'il traite une URL à la fois, et uniquement sur les propriétés que vous avez validées.
Méthode 3 : le rapport Pages
Pour un site entier, allez dans Indexation, puis Pages, dans la Search Console. Le graphique répartit les URL connues entre indexées et non indexées, et le tableau en dessous regroupe les URL non indexées par motif. Cliquez sur un motif pour voir des exemples d'URL.
C'est là que les tendances apparaissent. Une URL isolée marquée « Exclue par la balise “noindex” » peut être voulue. Trois cents URL qui apparaissent la même semaine désignent plutôt un template. C'est aussi dans ce rapport que vous remarquerez une section entière bloquée en « Détectée, actuellement non indexée ». Son défaut est le délai : les données se mettent à jour au rythme de Google, avec en général plusieurs jours de retard. Si une ligne demande du travail, notre guide pour corriger les erreurs de couverture d'index dans GSC passe chaque statut en revue.
Méthode 4 : un crawler pour les signaux bloquants
Screaming Frog, Sitebulb et les crawlers du même type ne peuvent pas vous dire ce que Google a indexé. Ils peuvent en revanche vous dire si chaque page a le droit de l'être, en remontant la balise meta robots, l'en-tête HTTP X-Robots-Tag, le canonical, et l'éventuel blocage de l'URL par le robots.txt. Sur un site de plusieurs milliers de pages, c'est souvent le moyen le plus rapide de trouver la cause d'un lot d'exclusions.
L'inconvénient, c'est qu'il faut le lancer à la main. Il montre l'état du site le jour du crawl.
Les raisons courantes d'une page non indexée
Une directive noindex est la première chose à écarter. Elle peut se trouver dans le HTML sous la forme <meta name="robots" content="noindex"> ou arriver par un en-tête de réponse X-Robots-Tag: noindex, invisible dans le code source de la page. La balise noindex expliquée couvre les deux cas.
Un Disallow dans le robots.txt empêche Google de récupérer la page. Curieusement, une page bloquée peut tout de même être indexée sans son contenu si d'autres sites pointent vers elle, et le blocage n'est donc pas un moyen fiable de retirer une URL. Voir comment vérifier votre robots.txt.
Un canonical qui pointe vers une autre URL indique à Google que cette page est une copie, et c'est l'autre URL qui est indexée.
La découverte est le problème le moins visible. Aucun lien ne mène à la page et elle ne figure pas dans le sitemap XML, si bien que Google ne l'a pas trouvée ou ne l'a pas jugée prioritaire. Enfin, « Explorée, actuellement non indexée » signifie que Google a récupéré la page et a décidé de ne pas la garder, souvent parce qu'elle paraît pauvre ou trop proche d'une autre page.
Les trois premières causes relèvent de la configuration et se corrigent en général en quelques minutes. Les deux dernières demandent un travail sur le contenu et le maillage.
Vérifier si une page est indexée une fois ne suffit pas
Une vérification d'indexation vous donne l'état du jour où vous l'avez faite. Ensuite, une mise à jour d'extension peut ajouter un noindex, une migration peut copier en production le robots.txt de préproduction avec Disallow: /, ou une modification du CMS peut faire pointer les canonicals vers le mauvais hôte. La page était indexée quand vous avez regardé et ne l'est plus, et la Search Console ne le montre qu'une fois que Google est repassé et que le rapport s'est mis à jour.
Sur un site que vous suivez de près, refaire ces vérifications de temps en temps reste jouable. Sur un portefeuille de sites clients où d'autres personnes déploient, ça ne l'est plus. Deltio contrôle chaque jour les pages de chaque sitemap, lit la balise et l'en-tête noindex, le canonical et le robots.txt, repère les URL retirées du sitemap, et envoie une alerte sur Slack ou par email qui nomme le site et les pages touchées dès que quelque chose change par rapport au contrôle précédent. Il signale qu'une page n'est plus indexable, pas ce que Google en a déjà fait : l'Inspection de l'URL reste l'endroit où confirmer le résultat. Les alertes de changement SEO détaillent les changements qui méritent une alerte.
Si vous voulez faire tourner ces contrôles sur vos propres sites, vous pouvez démarrer un essai de 14 jours.
Questions fréquentes
- Combien de temps faut-il à Google pour indexer une nouvelle page ?
- Il n'y a pas de délai fixe. Sur les sites que Google explore souvent, une page peut être indexée en un ou deux jours, alors que les sites récents ou rarement mis à jour peuvent attendre des semaines. Placer un lien vers la page depuis une page déjà indexée et l'ajouter au sitemap XML aident tous deux Google à la trouver plus vite.
- « Demander une indexation » dans l'Inspection de l'URL garantit-il que la page sera indexée ?
- Non. La demande ajoute l'URL à la file d'exploration de Google avec une certaine priorité, mais Google décide toujours de l'indexer ou non. Si la page porte un noindex, est bloquée ou est jugée de faible valeur, la demande ne changera rien. Le nombre de demandes est en outre limité chaque jour pour chaque propriété.
- Une page bloquée par le robots.txt peut-elle quand même apparaître dans Google ?
- Oui. Si d'autres pages pointent vers elle, Google peut indexer l'URL sans l'explorer, en l'affichant généralement sans description. Pour garder une page hors des résultats, autorisez l'exploration et utilisez plutôt une balise noindex ou un en-tête X-Robots-Tag, car Google doit récupérer la page pour voir le noindex.
- Comment vérifier l'indexation d'un PDF ou d'une image plutôt que d'une page HTML ?
- L'Inspection de l'URL fonctionne pour toute URL de votre propriété validée, PDF compris. Ces fichiers ne pouvant pas porter de balise meta robots, leur indexation se contrôle avec l'en-tête HTTP X-Robots-Tag. Vérifiez donc les en-têtes de réponse si un PDF est exclu ou inclus contre toute attente.
- Que signifie « Détectée, actuellement non indexée » ?
- Google sait que l'URL existe, en général grâce à un sitemap ou à un lien, mais ne l'a pas encore explorée. Sur les grands sites, c'est souvent une question de priorité d'exploration : renforcer les liens internes vers ces pages et retirer du sitemap les URL de faible valeur aide en général davantage que de soumettre à nouveau les pages.