Duplicate Content: richtig prüfen und dauerhaft behoben halten
Duplicate Content prüfen heißt in der Praxis: einen Crawl laufen lassen und in die Search Console schauen, um dieselbe Seite unter mehr als einer URL zu finden. Die üblichen Verursacher sind Parameter, http- und https-Versionen, www und die Domain ohne www, Pagination, Druckansichten und Staging-Domains, die nie gesperrt wurden.
Google bestraft Duplicate Content nicht. Aus jeder Gruppe von Kopien wählt es eine URL, indexiert diese und ordnet ihr die übrigen zu. Das funktioniert, bis Google die falsche wählt, etwa eine ?sort=price-Variante statt der sauberen Kategorie-URL oder die Staging-Subdomain statt der Live-Website.
Auf Kundenwebsites ist Duplicate Content selten ein Textproblem. Ein CMS, eine Shop-Plattform, ein Filtersystem oder eine Migration hat mehrere Adressen für eine Seite erzeugt, und niemand hat den Suchmaschinen gesagt, welche davon bleiben soll.
Was tatsächlich als Duplicate Content zählt
In diesem Beitrag geht es um das technische Problem: ein Inhalt, der unter mehreren URLs ausgeliefert wird. Wiederverwendete Textbausteine, eine Standard-Widerrufsbelehrung oder kurze Produkttexte, die sich innerhalb eines Sortiments ähneln, sind etwas anderes und machen bei der Indexierung selten Ärger.
Findet Google nahezu identische URLs, konsolidiert es sie. Eine wird zur kanonischen URL, die anderen erscheinen in der Search Console als Alternative oder Duplikat, und die Ranking-Signale werden zusammengeführt. Der Schaden ist indirekt. Du verlierst die Kontrolle darüber, welche URL in den Suchergebnissen steht, Links auf verschiedene Varianten verteilen sich, und Crawling-Zeit fließt in Kopien statt in neue Seiten.
Woher die Kopien auf einer typischen Website kommen
URL-Varianten sind die einfachste Quelle. http://example.com/schuhe, https://example.com/schuhe, https://www.example.com/schuhe und https://www.example.com/schuhe/ können alle dieselbe Seite mit Status 200 liefern, wenn die Weiterleitungen nicht einheitlich eingerichtet sind. Auf vielen Servern spielt auch die Groß- und Kleinschreibung eine Rolle, sodass /Schuhe und /schuhe zwei verschiedene URLs sein können.
Query-Parameter sind die nächste Ebene. UTM-Parameter, Session-IDs sowie ?sort=- und ?page=-Werte auf Kategorieseiten erzeugen jeweils eine neue Adresse. In Online-Shops ist die Facettennavigation der klassische Fall, bei dem jede Kombination aus Farb-, Größen- und Preisfilter eine indexierbare URL hervorbringen kann.
Dazu kommen komplette Zweit-Hosts: eine Staging-Website unter staging.example.com, die offen geblieben ist, oder eine alte Domain, die nach einem Rebranding weiter Inhalte ausliefert. Syndizierte Artikel und Druckversionen unter eigener URL vervollständigen die Liste.
Duplicate Content finden mit Crawler und Search Console
Fang mit einem Crawler wie Screaming Frog oder Sitebulb an. Sortiere nach doppelten Titles, doppelten Meta Descriptions und nach Seiten, deren Canonical nicht auf sie selbst zeigt. Damit kommt der größte Teil der technischen Duplikate in einem Durchgang ans Licht.
Um zu sehen, wie Google selbst entschieden hat, öffnest du in der Google Search Console unter „Indexierung“ den Bericht „Seiten“. Zwei Status sind hier aufschlussreich:
- „Duplikat – vom Nutzer nicht als kanonisch festgelegt“ bedeutet, dass Google Kopien gefunden und selbst eine Version gewählt hat, weil du keine Präferenz angegeben hast.
- „Duplikat – Google hat eine andere kanonische Seite als der Nutzer ausgewählt“ bedeutet, dass du eine Version angegeben hast und Google sich darüber hinweggesetzt hat, meist weil andere Signale widersprachen.
Dort steht auch „Alternative Seite mit richtigem kanonischen Tag“. Dieser Status ist normalerweise in Ordnung, denn er bedeutet, dass dein Canonical respektiert wurde.
Für Inhalte, die auf andere Domains kopiert wurden, suchst du bei Google nach einem markanten Satz in Anführungszeichen. Und wenn du für eine bestimmte Adresse bestätigen willst, was Google gespeichert hat, zeigt die URL-Prüfung sowohl die vom Nutzer angegebene als auch die von Google ausgewählte kanonische URL. Das Tool erklären wir im Beitrag So prüfst du, ob eine Seite indexiert ist.
Duplicate Content beheben
Gib jeder indexierbaren Seite ein selbstreferenzierendes Canonical als absolute URL, mit genau einem <link rel="canonical"> im <head>. Wo ein Duplikat überhaupt keinen Grund hat zu existieren, etwa bei einer alten Domain oder der nicht bevorzugten www-Variante, setzt du statt eines Canonicals eine 301-Weiterleitung.
Sorg dafür, dass die Signale übereinstimmen. Canonical, Sitemap-Eintrag, interne Links und etwaige hreflang-Angaben sollten alle auf dieselbe Version verweisen. Google behandelt das Canonical als Hinweis, und ein Hinweis, dem die Sitemap und sämtliche internen Links widersprechen, wird oft ignoriert. Genau so landest du beim zweiten Search-Console-Status von oben.
Nutze noindex nur für Seiten, die erreichbar bleiben müssen, aber nicht ranken sollen, zum Beispiel interne Suchergebnisse oder dünne Filterkombinationen. Kombiniere auf derselben Seite kein noindex mit einem Canonical auf eine andere URL, weil sich die beiden Anweisungen widersprechen.
Warum die Korrektur nicht von Dauer ist
Das Canonical ist eine einzige Zeile im Head des Templates, und deshalb kann ein Release es leicht kaputt machen, ohne dass es jemand bemerkt. Ein Refactoring entfernt es aus einem Template. Ein Plugin-Update gibt plötzlich einen relativen Pfad aus. Ein Bereich hat auf einmal zwei Canonical-Tags, weil das Theme und ein SEO-Plugin beide eines schreiben. Ein Staging-Build lässt alle Canonicals auf den Staging-Host zeigen und wird live gestellt. In allen vier Fällen sieht die Seite im Browser genauso aus wie vorher.
Ein Duplicate-Content-Audit stimmt also ungefähr bis zum nächsten Deploy. Die allgemeinere Form dieses Problems behandeln wir im Beitrag zum Website Code Change Monitoring.
Canonicals mit Deltio überwachen
Deltio vergleicht keine Seitentexte und meldet dir deshalb nicht, dass zwei Artikel zu 80 % ähnlich sind. Dafür brauchst du weiterhin einen Crawler oder ein Ähnlichkeitstool. Was Deltio überwacht, ist das Canonical selbst. In einem täglichen Zyklus liest es das Canonical auf den Seiten aus der Sitemap, vergleicht es mit der vorherigen Prüfung und schickt einen Alert per Slack oder E-Mail, wenn sich eines ändert. Titles, Meta Descriptions und H1 werden auf dieselbe Weise geprüft, was wichtig ist, weil doppelte Titles oft das erste sichtbare Anzeichen von Duplikaten sind. Auch Änderungen an den Sitemap-URLs werden gemeldet, sodass ein Filter auffällt, der plötzlich neue Adressen in die Sitemap schreibt. Wie du eine einzelne Seite von Hand prüfst, erklärt der Beitrag zum Canonical-Tag-Checker.
Weil der Zyklus täglich läuft, fällt ein kaputtes Canonical am nächsten Tag auf und nicht innerhalb von Minuten. Für diese Art von Problem reicht das meist, um es zu beheben, bevor Google einen größeren Teil der Website neu gecrawlt hat.
Häufige Fragen
- Kann ein Canonical-Tag auf eine URL einer anderen Domain zeigen?
- Ja. Domainübergreifende Canonicals sind zulässig und die übliche Lösung bei syndizierten Inhalten: Die Website, die den Artikel erneut veröffentlicht, setzt ein Canonical auf das Original. Google behandelt es trotzdem als Hinweis, deshalb funktioniert es am besten, wenn die Kopie nahezu identisch ist.
- Erzeugen UTM-Parameter Duplicate Content?
- Sie erzeugen zusätzliche URLs, aber Google ignoriert gängige Tracking-Parameter in der Regel gut, vor allem wenn die Seite ein selbstreferenzierendes Canonical auf die saubere URL trägt. In der Praxis hilft es am meisten, UTM-Links aus der internen Navigation herauszuhalten, damit sie nur über externe Kampagnen auftauchen.
- Sollten paginierte Seiten ein Canonical auf Seite 1 haben?
- Meist nicht. Seite 2 einer Kategorie listet andere Produkte als Seite 1, daher sollte jede paginierte URL normalerweise ein selbstreferenzierendes Canonical haben. Zeigen alle auf Seite 1, kann das verhindern, dass Google die Produkte auf den hinteren Seiten entdeckt.
- Ist es ein Problem, wenn Google ein anderes Canonical wählt als das, das ich gesetzt habe?
- Es ist ein Zeichen, dass etwas deinem Tag widerspricht, etwa interne Links, die Sitemap, Weiterleitungen oder hreflang-Angaben, die auf die andere Version zeigen. Prüf die URL in der URL-Prüfung, vergleiche die vom Nutzer angegebene mit der von Google ausgewählten kanonischen URL und richte die übrigen Signale auf deine bevorzugte Version aus.
- Was kostet Deltio?
- Starter deckt bis zu 50 Websites ab und kostet 29 € pro Monat oder 24 € pro Monat bei jährlicher Abrechnung. Professional (bis zu 200 Websites) kostet 59 € bzw. 49 € pro Monat, Enterprise (bis zu 500 Websites) 139 € bzw. 116 € pro Monat. Alle Pläne lassen sich 14 Tage kostenlos testen.