Erlaubnis ist nicht dasselbe wie Ausschluss
robots.txt verweigert die Erlaubnis, eine URL abzurufen — und sonst nichts. Google sagt unmissverständlich, dass die Datei kein Mittel ist, um eine Seite aus der Suche herauszuhalten. Die beiden Vorstellungen werden ständig vermischt, und diese Vermischung erzeugt einen ganz bestimmten, gut sichtbaren Fehler.
Eine gesperrte URL, auf die andere Websites verlinken, kann trotzdem indexiert werden. Google weiß, dass die Adresse existiert, weil jemand darauf verlinkt hat; die Suchmaschine sieht nur nicht, was darauf steht. Also erscheint die URL unter Umständen ganz ohne Beschreibung — das Schlechteste aus beiden Welten, denn die Seite steht öffentlich in den Ergebnissen, während Sie keinerlei Kontrolle über ihre Darstellung haben.
Die Datei lesen und schreiben
Die Datei liegt im Wurzelverzeichnis eines Hosts und gilt nur für diesen Host und dieses Protokoll. Regeln sind nach User-Agent gruppiert, und ein Crawler befolgt die eine Gruppe, die am genauesten auf ihn passt — nicht jede Gruppe, auf die er passen könnte. Innerhalb einer Gruppe entscheidet bei Google die spezifischere Regel, nicht die Reihenfolge.
User-agent: *
Disallow: /admin/
Disallow: /*.pdf$
Allow: /admin/public/
User-agent: Googlebot
Disallow: /drafts/
Sitemap: https://example.com/sitemap.xml Zwei Details in diesem Beispiel sorgen für den Großteil der Verwirrung. Die Allow-Zeile ist spezifischer als das Disallow darüber, deshalb bleibt /admin/public/ abrufbar. Und sobald eine Googlebot-Gruppe existiert, befolgt Googlebot ausschließlich diese Gruppe — die Sternchen-Gruppe gilt für ihn nicht mehr, /admin/ ist für Googlebot hier also abrufbar. Das ist fast nie das, was gemeint war.
- Einen Pfad zu sperren entfernt keine bereits indexierten URLs, es unterbindet nur künftige Abrufe.
- Die Sitemap-Angabe ist von jeder User-Agent-Gruppe unabhängig und darf an beliebiger Stelle der Datei stehen.
- Ein 5xx auf der robots.txt selbst kann einen Crawler dazu bringen, den ganzen Host zurückzustellen — liefern Sie sie von etwas Verlässlichem aus.
Wo eine robots-Regel weit entfernt von sich selbst Schaden anrichtet
Die teuersten robots.txt-Fehler sind nicht die Seiten, die Sie sperren wollten. Es sind die Ressourcen, die eine Seite zum Rendern braucht. Suchmaschinen rendern Seiten, bevor sie sie indexieren, und beim Rendern werden Skripte, Stylesheets und API-Antworten nachgeladen.
Sperren Sie einen Skriptpfad oder eine API-Route, ruft der Crawler das HTML weiterhin einwandfrei ab. Er rendert dann eine nahezu leere Seite und indexiert eine nahezu leere Seite. Kein Statusbericht wird melden, dass die Seite gesperrt war — denn die Seite war es nicht, nur das, was sie brauchte.
Eine Sitemap ist ein Vorschlag, keine Warteschlange
Sitemaps helfen der Auffindbarkeit genau dort, wo Verlinkung am schwächsten ist: bei großen Sites, brandneuen Sites mit wenigen eingehenden Links und medienlastigen Sites, deren Inhalte keinen natürlichen Ankertext haben. Google sagt ausdrücklich, dass die Aufnahme einer URL weder Crawling noch Indexierung garantiert.
Googles eigene Leitlinie lautet, dass eine kleinere, gut verlinkte Site womöglich gar keine braucht, weil der Crawler alles über Links findet. Das sollte man ernst nehmen, bevor man Sitemap-Infrastruktur baut, um ein Problem zu lösen, das interne Verlinkung besser löst.
| Grenzwert | Wert |
|---|---|
| URLs pro Sitemap-Datei | 50.000 |
| Unkomprimierte Größe pro Datei | 50 MB |
| Darüber hinaus | Aufteilen und die Teile über einen Sitemap-Index referenzieren |
Welche Angaben gelesen, ignoriert oder misstraut werden
Hier wird der meiste Sitemap-Aufwand verschwendet. Zwei der vier gängigen Angaben bewirken überhaupt nichts, und eine dritte kann aktiv gegen Sie arbeiten.
| Angabe | Was Google damit macht |
|---|---|
| loc | Wird gelesen — die URL selbst |
| lastmod | Nur genutzt, wenn es durchgängig und überprüfbar stimmt |
| changefreq | Wird ignoriert |
| priority | Wird ignoriert |
Die Bedingung bei lastmod ist die, die weh tut. Stempelt Ihr Build jede URL mit dem Deploy-Zeitpunkt, ist jeder Wert zugleich falsch und leicht zu widerlegen — die Seite hat sich nicht geändert, und die Suchmaschine kann das erkennen. Sobald sie dem Feld nicht mehr traut, nutzt sie es nicht mehr, und damit stehen Sie schlechter da, als hätten Sie gar kein lastmod gesendet. Geben Sie es nur bei echten Änderungen am Hauptinhalt aus und lassen Sie es lieber weg, als es zu erfinden.
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/guides/indexing/</loc>
<lastmod>2026-06-14</lastmod>
</url>
</urlset> Das richtige Werkzeug wählen
Fast jede Frage in diesem Bereich klärt sich, sobald man drei Aufgaben trennt, die sich ähnlich anfühlen und es nicht sind.
| Ziel | Werkzeug | Warum |
|---|---|---|
| Crawl-Aufwand für Müll-URLs sparen | robots.txt | Verhindert den Abruf vollständig |
| Eine Seite aus den Ergebnissen halten | noindex oder Anmeldepflicht | Setzt den Abruf voraus, damit die Anweisung gelesen wird |
| Seiten auffindbar machen | Interne Links, dann eine Sitemap | Links tragen Kontext, Sitemap-Einträge nicht |