← Retour au blog

Contenu dupliqué: comment le vérifier et faire tenir la correction

Contenu dupliqué: comment le vérifier et faire tenir la correction

Pour vérifier le contenu dupliqué d'un site, on combine en pratique un crawl et un passage dans la Search Console : vous cherchez la même page accessible depuis plusieurs URL. Les coupables habituels sont les paramètres, les versions http et https, www et sans www, la pagination, les versions imprimables et les domaines de préproduction jamais bloqués.

Google ne pénalise pas le contenu dupliqué. Il choisit une URL dans chaque groupe de copies, indexe celle-là et y rattache les autres. Cela fonctionne très bien jusqu'au jour où il choisit la mauvaise, par exemple une variante ?sort=price au lieu de l'URL propre de la catégorie, ou le sous-domaine de préproduction au lieu de la production.

Sur les sites clients, la duplication relève rarement de la rédaction. Un CMS, une plateforme e-commerce, un système de filtres ou une migration a créé plusieurs adresses pour une même page, et personne n'a indiqué aux moteurs laquelle garder.

Ce qui compte vraiment comme contenu dupliqué

Le problème traité ici est technique : un même contenu servi sur plusieurs URL. Les blocs de texte réutilisés, une politique de retour standard ou des descriptions produit courtes qui se ressemblent au sein d'une gamme sont un autre sujet, et posent rarement des problèmes d'indexation.

Quand Google trouve des URL quasi identiques, il les consolide. L'une devient la version canonique, les autres apparaissent dans la Search Console comme pages alternatives ou en double, et les signaux de positionnement sont fusionnés. Le coût est indirect. Vous perdez le contrôle de l'URL qui s'affiche dans les résultats, les liens qui pointent vers différentes variantes se répartissent, et le temps d'exploration part dans les copies plutôt que dans les nouvelles pages.

D'où viennent les copies sur un site type

Les variantes d'URL sont la source la plus élémentaire. http://example.com/shoes, https://example.com/shoes, https://www.example.com/shoes et https://www.example.com/shoes/ peuvent toutes renvoyer la même page avec un 200 si les redirections ne sont pas configurées de façon cohérente. Sur beaucoup de serveurs, la casse compte aussi, si bien que /Shoes et /shoes peuvent être deux URL distinctes.

Les paramètres d'URL forment la couche suivante. Balises UTM, identifiants de session, valeurs ?sort= et ?page= sur les pages catégorie : chacun crée une nouvelle adresse. Sur les sites e-commerce, la navigation à facettes est le cas d'école, puisque chaque combinaison de filtres de couleur, de taille et de prix peut produire une URL indexable.

Viennent ensuite les hôtes alternatifs complets, comme un site de préproduction sur staging.example.com resté ouvert ou un ancien domaine qui sert encore du contenu après un changement de marque. Les articles syndiqués et les versions imprimables publiées sur leur propre URL complètent la liste.

Vérifier le contenu dupliqué avec un crawler et la Search Console

Commencez par un crawler comme Screaming Frog ou Sitebulb. Triez par title dupliqués, par meta descriptions dupliquées, et par pages dont le canonical pointe ailleurs que vers elles-mêmes. Vous faites ressortir l'essentiel de la duplication technique en une seule passe.

Ouvrez ensuite le rapport Pages, dans la rubrique Indexation de Google Search Console. Deux statuts vous disent ce que Google a décidé :

« Autre page avec balise canonique correcte » figure aussi dans ce rapport, mais ce statut est normalement sans gravité : il indique que votre canonical a été respecté.

Pour un contenu copié sur d'autres domaines, recherchez une phrase caractéristique entre guillemets. Et pour confirmer ce que Google retient pour une adresse précise, l'outil Inspection de l'URL affiche à la fois l'URL canonique déclarée par l'utilisateur et celle sélectionnée par Google. Nous présentons cet outil dans comment vérifier si une page est indexée.

Corriger la duplication

Donnez à chaque page indexable un canonical auto-référent, écrit en URL absolue, avec une seule balise <link rel="canonical"> dans le <head>. Quand un doublon n'a aucune raison d'exister, comme un ancien domaine ou la variante www non retenue, utilisez une redirection 301 plutôt qu'un canonical.

Faites concorder les signaux. Le canonical, l'entrée du sitemap, les liens internes et les éventuelles annotations hreflang doivent tous désigner la même version. Google traite le canonical comme une indication, et une indication contredite par le sitemap et par tous les liens internes est souvent ignorée. C'est exactement ainsi qu'on se retrouve avec le deuxième statut Search Console cité plus haut.

Réservez le noindex aux pages qui doivent rester accessibles sans se positionner, comme les résultats de recherche interne ou les combinaisons de filtres pauvres. Ne combinez pas sur une même page un noindex et un canonical pointant vers une autre URL : les deux instructions se contredisent.

Pourquoi la correction ne tient pas

Le canonical tient en une ligne dans le head du template, et une mise en production peut donc le casser sans que personne ne le voie. Un refactor le supprime d'un template. Une mise à jour d'extension se met à produire un chemin relatif. Une section se retrouve avec deux balises canonical parce que le thème et une extension SEO en écrivent chacun une. Un build de préproduction fait pointer tous les canonicals vers le domaine de test et part en production. Dans les quatre cas, la page s'affiche à l'identique dans le navigateur.

Un audit du contenu dupliqué reste donc exact à peu près jusqu'au déploiement suivant. La version plus large de ce problème est traitée dans notre guide sur le monitoring des changements de code.

Surveiller les canonicals avec Deltio

Deltio ne compare pas le texte des pages et ne vous dira donc pas que deux articles se ressemblent à 80 %. Pour cela, il vous faut toujours un crawler ou un outil de similarité. Ce qu'il surveille, c'est le canonical lui-même. Chaque jour, il lit le canonical des pages du sitemap, le compare au contrôle précédent et envoie une alerte sur Slack ou par email quand il change. Les title, meta descriptions et H1 sont contrôlés de la même manière, ce qui a son importance, car des title dupliqués sont souvent le premier signe visible d'une duplication. Les changements d'URL dans le sitemap remontent aussi, de sorte qu'un filtre qui se met à ajouter des adresses au sitemap ne passe pas inaperçu. L'article sur le canonical tag checker explique comment vérifier une page à la main.

Le cycle étant quotidien, un canonical cassé est repéré le lendemain plutôt qu'en quelques minutes. Pour ce type de problème, c'est en général assez tôt pour corriger avant que Google ait réexploré une grande partie du site.

Questions fréquentes

Une balise canonical peut-elle pointer vers une URL d'un autre domaine ?
Oui. Les canonicals inter-domaines sont valides et constituent la solution habituelle pour les contenus syndiqués : le site qui republie ajoute un canonical vers l'article d'origine. Google le traite toujours comme une indication, et cela fonctionne donc mieux quand la copie est quasi identique.
Les paramètres UTM créent-ils du contenu dupliqué ?
Ils créent des URL supplémentaires, mais Google sait en général ignorer les paramètres de tracking courants, surtout quand la page porte un canonical auto-référent vers l'URL propre. En pratique, la solution consiste à bannir les liens UTM de la navigation interne, pour qu'ils n'apparaissent que via les campagnes externes.
Les pages paginées doivent-elles avoir un canonical vers la page 1 ?
En général non. La page 2 d'une catégorie liste d'autres produits que la page 1, et chaque URL paginée doit donc normalement avoir un canonical auto-référent. Les faire toutes pointer vers la page 1 peut empêcher la découverte des produits situés sur les pages plus profondes.
Est-ce un problème si Google choisit une autre URL canonique que celle que j'ai définie ?
C'est le signe que quelque chose contredit votre balise : liens internes, sitemap, redirections ou hreflang qui pointent vers l'autre version. Passez cette URL dans l'outil Inspection de l'URL, comparez l'URL canonique déclarée par l'utilisateur et celle sélectionnée par Google, puis alignez les autres signaux sur la version que vous préférez.
Combien coûte Deltio ?
Starter couvre jusqu'à 50 sites pour 29 € par mois, ou 24 € par mois en facturation annuelle. Professional (jusqu'à 200 sites) coûte 59 € par mois, ou 49 € en annuel, et Enterprise (jusqu'à 500 sites) 139 € par mois, ou 116 € en annuel. Tous les forfaits comprennent un essai gratuit de 14 jours.