So erkennst du ein Noindex, bevor es deine Rankings killt
Um ein Noindex in der Produktion zu erkennen, prüfst du bei den wichtigen Seiten sowohl das HTML als auch die HTTP-Header und richtest etwas ein, das beides von einem Tag zum nächsten vergleicht. Ein verirrtes noindex erzeugt nämlich keinen Fehler: Die Seite lädt, der Checkout funktioniert, und Google entfernt die URL beim nächsten Crawlen aus dem Index.
Der Tag hat berechtigte Einsatzorte, etwa Danke-Seiten, interne Suchergebnisse und Staging-Umgebungen. Teuer wird es, wenn er auf einer Seite landet, die ranken soll, und dort wochenlang bleibt, bevor jemand hinsieht.
Woher ein Noindex in der Produktion meistens kommt
Die meisten sind Staging-Einstellungen, die mitgewandert sind. Staging-Umgebungen hält man mit einem Robots-Meta-Tag oder einem Header aus Google heraus, und ein Deploy, der Konfiguration, Umgebungsvariablen oder einen Datenbank-Dump kopiert, nimmt diese Einstellung mit. Bei WordPress ist der übliche Verdächtige die Checkbox „Suchmaschinen davon abhalten, diese Website zu indexieren“ unter Einstellungen > Lesen, die auf Staging angehakt war und zusammen mit der Datenbank in der Produktion wiederhergestellt wurde.
Danach kommen SEO-Plugins. In Yoast und Rank Math kannst du in den Einstellungen einen ganzen Inhaltstyp oder eine ganze Taxonomie auf noindex setzen. In Yoast ist das der Schalter, der festlegt, ob der jeweilige Inhaltstyp in den Suchergebnissen angezeigt wird. Ein einziger Klick oder ein Zurücksetzen der Einstellungen betrifft also Hunderte URLs auf einmal.
Und dann gibt es Header. X-Robots-Tag: noindex lässt sich mit einer add_header-Direktive in Nginx, einer Regel in der .htaccess bei Apache oder über die CDN-Konfiguration setzen, und nichts davon taucht im Quelltext der Seite auf. Ein Entwickler, der einen neuen Bereich während des Aufbaus versteckt und die Regel beim Launch vergisst, erzeugt genau diese Art von unsichtbarem Noindex.
Eine einzelne Seite von Hand auf Noindex prüfen
Wenn du eine bestimmte URL im Verdacht hast, geh diese Schritte der Reihe nach durch. Jeder findet etwas, das der vorherige übersehen kann.
- Header abrufen:
curl -sI https://example.com/page/ | grep -i x-robots-tag. Jede Zeile mitnoindexbedeutet, dass der Header gesetzt ist, egal was im HTML steht. - Das ausgelieferte HTML durchsuchen:
curl -s https://example.com/page/ | grep -i 'name="robots"'. Achte auch aufname="googlebot", das nur für Google gilt. - Wenn die Website mit JavaScript rendert, öffne in der Search Console die URL-Prüfung, klick auf „Live-URL testen“ und dann auf „Getestete Seite anzeigen“, um das HTML zu sehen, das Google bekommt. Google weist in seiner Dokumentation darauf hin, dass Googlebot das Rendering überspringen kann, wenn das ursprüngliche HTML
noindexenthält. Ein Skript, das den Tag danach entfernt, hilft also nicht. - Im selben Prüfergebnis zeigt „Indexierung zulässig?“, ob die Sperre aus dem Robots-Meta-Tag oder aus dem HTTP-Header
X-Robots-Tagstammt. - Für einen Durchgang über die ganze Website crawlst du sie mit Screaming Frog und nutzt im Tab „Directives“ den Filter „Noindex“.
Der Bericht zur Seitenindexierung in der Search Console fasst URLs außerdem unter „Durch ‚noindex‘-Tag ausgeschlossen“ zusammen. Er ist maßgeblich, wird aber erst aktualisiert, nachdem Google neu gecrawlt hat, und beschreibt deshalb eher die letzte Woche als den heutigen Stand.
Das Problem schon beim Deploy abfangen
Wenn du die Deployment-Pipeline kontrollierst, kostet ein Check nach jedem Produktions-Release sehr wenig. Ein CI-Schritt, der die beiden curl-Befehle von oben gegen die Startseite und ein paar zentrale Templates laufen lässt und den Job abbricht, sobald einer davon noindex findet, stoppt das häufigste Staging-Leck.
Eine Plugin-Einstellung, die an einem Dienstagnachmittag in wp-admin geändert wird, oder eine Header-Regel im CDN-Dashboard erwischt er allerdings nicht. Beides läuft nicht durch die Pipeline.
Monitoring für die Änderungen, die niemand deployt
Manuelle Prüfungen beantworten die Frage „Ist diese Seite gerade auf noindex?“. Monitoring beantwortet die Frage „Ist seit gestern irgendeine Seite auf noindex gegangen?“, und genau die zählt bei Kundenseiten, auf denen Änderungen von Menschen und Systemen kommen, die du nicht kontrollierst.
Deltio liest in einem täglichen Zyklus die Seiten aus der Sitemap jeder Website und hält den noindex-Status aus Meta-Tag und X-Robots-Tag-Header fest. Ist eine Seite, die bei der vorherigen Prüfung indexierbar war, bei der aktuellen auf noindex, schickt Deltio für diese Website einen Alert per Slack und E-Mail, in dem die betroffenen URLs stehen. Weil die Prüfung täglich läuft, erfährst du es innerhalb eines Tages statt innerhalb von Minuten, in den meisten Fällen also immer noch, bevor Google die Seite neu gecrawlt und entfernt hat. Derselbe Vergleich deckt Änderungen an der robots.txt, geänderte Canonicals und URLs ab, die aus der Sitemap verschwinden. Hintergrund zum Tag selbst findest du in Der Noindex-Tag erklärt.
Auf deinen eigenen Kundenseiten kannst du das in der 14-tägigen kostenlosen Testphase ausprobieren.
Häufige Fragen
- Wie lange dauert es, bis Google eine Seite nach einem neuen noindex entfernt?
- Das noindex wirkt erst, wenn Google die URL neu crawlt, es hängt also von der Crawl-Frequenz ab. Eine Startseite oder eine viel besuchte Kategorieseite kann innerhalb weniger Tage verschwinden, eine selten gecrawlte Seite bleibt womöglich wochenlang im Index. In genau dieser Verzögerung ist das Beheben noch billig.
- Kommen die Rankings zurück, wenn ich das noindex entferne?
- In der Regel ja, sobald Google die Seite neu crawlt. Um das bei wichtigen URLs zu beschleunigen, nutze „Indexierung beantragen“ in der URL-Prüfung und stell sicher, dass sie in der Sitemap stehen. Je länger eine Seite aus dem Index war, desto unsicherer ist, dass sie auf dieselbe Position zurückkehrt.
- Kann die robots.txt ein noindex vor Google verstecken?
- Ja. Ist eine URL per Disallow gesperrt, ruft Googlebot sie nie ab und liest deshalb auch das noindex nie. Die URL kann sogar indexiert bleiben, meist ohne Beschreibung, weil Google über Links von ihr weiß. Eine Seite, die aus dem Index soll, muss crawlbar bleiben.
- Funktioniert eine noindex-Regel in der robots.txt?
- Nein. Google hat noindex-Zeilen in der robots.txt nie offiziell unterstützt und beachtet sie seit September 2019 überhaupt nicht mehr. Nutze stattdessen das Robots-Meta-Tag oder den X-Robots-Tag-Header.
- Prüft Deltio auch Seiten, die nicht in der Sitemap stehen?
- Die tägliche Prüfung arbeitet mit den URLs, die in der Sitemap der jeweiligen Website stehen. Fehlen wichtige Seiten in der Sitemap, sind sie nicht Teil dieses Vergleichs, und diese Lücke solltest du aus SEO-Gründen ohnehin schließen.