Zum Hauptinhalt springen
← Alle Guides

robots.txt und Sitemaps

Beide Dateien sagen einem Crawler etwas über Ihre URLs, und keine tut, was man gemeinhin annimmt. Die eine verweigert die Erlaubnis zum Abruf. Die andere bietet eine Liste zur Prüfung an.

Erlaubnis ist nicht dasselbe wie Ausschluss

robots.txt verweigert die Erlaubnis, eine URL abzurufen — und sonst nichts. Google sagt unmissverständlich, dass die Datei kein Mittel ist, um eine Seite aus der Suche herauszuhalten. Die beiden Vorstellungen werden ständig vermischt, und diese Vermischung erzeugt einen ganz bestimmten, gut sichtbaren Fehler.

Eine gesperrte URL, auf die andere Websites verlinken, kann trotzdem indexiert werden. Google weiß, dass die Adresse existiert, weil jemand darauf verlinkt hat; die Suchmaschine sieht nur nicht, was darauf steht. Also erscheint die URL unter Umständen ganz ohne Beschreibung — das Schlechteste aus beiden Welten, denn die Seite steht öffentlich in den Ergebnissen, während Sie keinerlei Kontrolle über ihre Darstellung haben.

Die Datei lesen und schreiben

Die Datei liegt im Wurzelverzeichnis eines Hosts und gilt nur für diesen Host und dieses Protokoll. Regeln sind nach User-Agent gruppiert, und ein Crawler befolgt die eine Gruppe, die am genauesten auf ihn passt — nicht jede Gruppe, auf die er passen könnte. Innerhalb einer Gruppe entscheidet bei Google die spezifischere Regel, nicht die Reihenfolge.

robots.txt
User-agent: *
Disallow: /admin/
Disallow: /*.pdf$
Allow: /admin/public/

User-agent: Googlebot
Disallow: /drafts/

Sitemap: https://example.com/sitemap.xml

Zwei Details in diesem Beispiel sorgen für den Großteil der Verwirrung. Die Allow-Zeile ist spezifischer als das Disallow darüber, deshalb bleibt /admin/public/ abrufbar. Und sobald eine Googlebot-Gruppe existiert, befolgt Googlebot ausschließlich diese Gruppe — die Sternchen-Gruppe gilt für ihn nicht mehr, /admin/ ist für Googlebot hier also abrufbar. Das ist fast nie das, was gemeint war.

  • Einen Pfad zu sperren entfernt keine bereits indexierten URLs, es unterbindet nur künftige Abrufe.
  • Die Sitemap-Angabe ist von jeder User-Agent-Gruppe unabhängig und darf an beliebiger Stelle der Datei stehen.
  • Ein 5xx auf der robots.txt selbst kann einen Crawler dazu bringen, den ganzen Host zurückzustellen — liefern Sie sie von etwas Verlässlichem aus.

Wo eine robots-Regel weit entfernt von sich selbst Schaden anrichtet

Die teuersten robots.txt-Fehler sind nicht die Seiten, die Sie sperren wollten. Es sind die Ressourcen, die eine Seite zum Rendern braucht. Suchmaschinen rendern Seiten, bevor sie sie indexieren, und beim Rendern werden Skripte, Stylesheets und API-Antworten nachgeladen.

Sperren Sie einen Skriptpfad oder eine API-Route, ruft der Crawler das HTML weiterhin einwandfrei ab. Er rendert dann eine nahezu leere Seite und indexiert eine nahezu leere Seite. Kein Statusbericht wird melden, dass die Seite gesperrt war — denn die Seite war es nicht, nur das, was sie brauchte.

Eine Sitemap ist ein Vorschlag, keine Warteschlange

Sitemaps helfen der Auffindbarkeit genau dort, wo Verlinkung am schwächsten ist: bei großen Sites, brandneuen Sites mit wenigen eingehenden Links und medienlastigen Sites, deren Inhalte keinen natürlichen Ankertext haben. Google sagt ausdrücklich, dass die Aufnahme einer URL weder Crawling noch Indexierung garantiert.

Googles eigene Leitlinie lautet, dass eine kleinere, gut verlinkte Site womöglich gar keine braucht, weil der Crawler alles über Links findet. Das sollte man ernst nehmen, bevor man Sitemap-Infrastruktur baut, um ein Problem zu lösen, das interne Verlinkung besser löst.

GrenzwertWert
URLs pro Sitemap-Datei50.000
Unkomprimierte Größe pro Datei50 MB
Darüber hinausAufteilen und die Teile über einen Sitemap-Index referenzieren

Welche Angaben gelesen, ignoriert oder misstraut werden

Hier wird der meiste Sitemap-Aufwand verschwendet. Zwei der vier gängigen Angaben bewirken überhaupt nichts, und eine dritte kann aktiv gegen Sie arbeiten.

AngabeWas Google damit macht
locWird gelesen — die URL selbst
lastmodNur genutzt, wenn es durchgängig und überprüfbar stimmt
changefreqWird ignoriert
priorityWird ignoriert

Die Bedingung bei lastmod ist die, die weh tut. Stempelt Ihr Build jede URL mit dem Deploy-Zeitpunkt, ist jeder Wert zugleich falsch und leicht zu widerlegen — die Seite hat sich nicht geändert, und die Suchmaschine kann das erkennen. Sobald sie dem Feld nicht mehr traut, nutzt sie es nicht mehr, und damit stehen Sie schlechter da, als hätten Sie gar kein lastmod gesendet. Geben Sie es nur bei echten Änderungen am Hauptinhalt aus und lassen Sie es lieber weg, als es zu erfinden.

sitemap.xml
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/guides/indexing/</loc>
    <lastmod>2026-06-14</lastmod>
  </url>
</urlset>

Das richtige Werkzeug wählen

Fast jede Frage in diesem Bereich klärt sich, sobald man drei Aufgaben trennt, die sich ähnlich anfühlen und es nicht sind.

ZielWerkzeugWarum
Crawl-Aufwand für Müll-URLs sparenrobots.txtVerhindert den Abruf vollständig
Eine Seite aus den Ergebnissen haltennoindex oder AnmeldepflichtSetzt den Abruf voraus, damit die Anweisung gelesen wird
Seiten auffindbar machenInterne Links, dann eine SitemapLinks tragen Kontext, Sitemap-Einträge nicht

Fragen und Antworten

Kann ich disallow und noindex kombinieren?

Nein, und genau das ist der klassische Fehler. Sperrt robots.txt die URL, ruft der Crawler die Seite nie ab und sieht das noindex nie. Erlauben Sie den Crawl und liefern Sie das noindex aus, oder stellen Sie die Seite hinter eine Anmeldung.

Brauche ich überhaupt eine Sitemap?

Nicht immer. Googles Leitlinie: Eine kleinere, gut verlinkte Site wird über Links gefunden. Sitemaps lohnen sich bei großen Sites, ganz neuen Sites mit wenigen eingehenden Links und viel Medieninhalt.

Warum erscheint eine gesperrte Seite trotzdem bei Google?

Weil robots.txt den Abruf gestoppt hat, nicht die Indexierung. Andere Sites verlinken auf die URL, Google weiß also von ihr, sieht aber den Inhalt nicht — daher der Eintrag ohne Beschreibung. Erlauben Sie den Crawl und liefern Sie ein noindex aus, um sie sauber zu entfernen.

Soll ich priority und changefreq setzen?

Nein. Google ignoriert beides. Der Aufwand ist besser in ein korrektes lastmod oder in interne Verlinkung investiert.

Was passiert, wenn robots.txt einen Fehler liefert?

Ein 5xx kann einen Crawler dazu bringen, den Host zurückzustellen, statt alles als erlaubt anzunehmen. Liefern Sie robots.txt von einer Infrastruktur aus, die mindestens so verlässlich ist wie die Site selbst.