Zum Hauptinhalt springen
← Alle Guides

Wie Suchmaschinen arbeiten

Zwischen einer veröffentlichten Seite und einem Suchergebnis liegen drei Stufen. Die meisten SEO-Probleme gehören zu genau einer davon, und die richtige zu benennen erspart die falsche Reparatur.

Die vier Stufen — und warum die Unterscheidung zählt

Eine Suchmaschine durchläuft mit Ihrer Seite vier getrennte Schritte, und jeder kann erfolgreich sein, während der nächste scheitert. Die Entdeckung macht die URL bekannt. Beim Crawling wird sie abgerufen. Bei der Indexierung entscheidet die Suchmaschine, ob sie gespeichert wird. Beim Ranking entscheidet sie je Suchanfrage, ob sie angezeigt wird. Googles KI-Funktionen sind Teil der Suche und beruhen weiterhin auf denselben Grundlagen für Crawling, Indexierung und Eignung, auch wenn der Abruf auf verwandte Suchanfragen aufgefächert werden kann.

Fast jede Frage, die mit „Warum taucht meine Seite nicht auf“ beginnt, ist in Wahrheit die Frage, auf welcher Stufe sie stehen geblieben ist. Die Antwort ändert das weitere Vorgehen vollständig, und die Stufen scheitern auf Weisen, die von außen gleich aussehen: Eine fehlende Seite sieht in den Ergebnissen identisch aus, ob sie nie entdeckt, beim Abruf blockiert, als nicht speicherwürdig eingestuft oder schlicht überholt wurde.

StufeWas passiertWie sie scheitert
EntdeckungDie URL wird bekannt, über einen Link oder eine SitemapNichts verlinkt die Seite, und keine Sitemap führt sie
CrawlingDie URL wird abgerufen und wie im Browser gerendertrobots.txt verweigert die Erlaubnis, oder der Server antwortet mit Fehler
IndexierungDie Suchmaschine entscheidet über das SpeichernDer Inhalt gilt als Duplikat, zu dünn oder nicht speicherwürdig
RankingGespeicherte Seiten werden gegen die Intention bewertetDie Seite ist gespeichert, aber es gibt eine bessere Antwort

Entdeckung: Wie eine URL bekannt wird

Google gibt an, dass die überwiegende Mehrheit der täglich neu gefundenen Seiten über Links hereinkommt. Ein Crawler, der bereits eine Ihrer Seiten abruft, liest die URLs in deren Markup aus und stellt sie in die Warteschlange. Damit ist die interne Verlinkung der primäre Entdeckungsmechanismus jeder Website — keine Optimierung, die man hinterher aufsetzt.

Sitemaps sind der zweite Weg. Sie zählen dort am meisten, wo die Verlinkung am schwächsten ist: sehr große Sites, brandneue Sites mit wenigen eingehenden Links und medienlastige Sites, deren Inhalte keinen natürlichen Ankertext haben. Google sagt ausdrücklich, dass die Aufnahme einer URL in eine Sitemap weder Crawling noch Indexierung garantiert — es ist ein Vorschlag zur Prüfung, keine Warteschlange, die abgearbeitet wird.

Praktisch heißt das: Eine Seite, auf die nichts verlinkt, verlässt sich auf den schwächeren der beiden Mechanismen. Ein Sitemap-Eintrag trägt keinen Kontext; er sagt, dass eine URL existiert, aber nichts darüber, wofür die Seite da ist oder wie sie zu allem anderen steht. Ein Link trägt beides — über seine Platzierung und seinen Ankertext.

Crawling: Erlaubnis, Kapazität und Nachfrage

Das Crawling wird von zwei Dingen begrenzt, die Google getrennt benennt. Das Crawl-Kapazitätslimit ist die Zahl gleichzeitiger Verbindungen, die es öffnet, ohne Ihren Server zu belasten — es passt sich Ihren Antwortzeiten und Fehlerraten an. Die Crawl-Nachfrage ist, wie viel es tatsächlich abrufen will: getrieben von Umfang, Änderungsfrequenz und seiner Einschätzung der Qualität.

Googles eigene Leitlinie lautet, dass die meisten Sites darüber gar nicht nachdenken sollten. Crawl-Budget wird erst bei Sites über etwa einer Million wöchentlich aktualisierter Seiten zum Thema, bei Sites über zehntausend täglich wechselnden Seiten oder bei jeder Site, bei der ein großer Anteil der URLs auf „Gefunden – zurzeit nicht indexiert“ feststeckt. Darunter ist langsames Crawling fast immer ein Symptom von etwas anderem.

Wo es zutrifft, sind die Hebel unspektakulär: Duplikate zusammenführen, für endgültig entfernte Seiten einen echten 404 oder 410 liefern statt eines Soft-404, Weiterleitungsketten kurz halten, die Antwortzeit des Servers verbessern und bedingte Anfragen unterstützen, damit unveränderte Seiten billig beantwortet werden. Beachten Sie, was auf dieser Liste fehlt: noindex ist kein Crawl-Budget-Werkzeug, denn der Crawler muss die Seite abrufen, um die Anweisung überhaupt zu lesen.

Rendering: die Stufe, die gern vergessen wird

Zwischen Abruf und Indexierung liegt das Rendering. Die Suchmaschine führt die Seite ungefähr so aus wie ein Browser und indexiert dann, was das gerenderte Ergebnis enthält. Inhalte, die erst nach dem Ausführen von JavaScript erscheinen, können also indexiert werden — aber nur, wenn diese Ausführung gelingt und die benötigten Ressourcen crawlbar sind.

Hier richtet eine robots.txt-Regel Schaden weit entfernt von ihrer Fundstelle an. Sperrt man einen Skript- oder API-Pfad, kann der Crawler genau die Dateien nicht laden, aus denen die Seite ihren Inhalt baut. Das HTML wird problemlos abgerufen, rendert nahezu leer und wird nahezu leer indexiert. Kein Status wird „blockiert“ melden — die Seite selbst war nie blockiert.

Indexierung ist eine Bewertung, keine Warteschlange

Das häufigste Missverständnis der gesamten Kette ist, die Indexierung als Anstehen zu begreifen: gecrawlt werden, warten, indexiert werden. So funktioniert es nicht. Nach dem Rendering entscheidet die Suchmaschine, ob die Seite speicherwürdig ist — und diese Entscheidung kann Nein lauten.

Genau das meint die Search Console mit „Gecrawlt – zurzeit nicht indexiert“. Nichts ist kaputt, nichts blockiert, der Abruf war erfolgreich. Die Seite wurde bewertet und beiseitegelegt. Aus einer Vorlage erzeugte, nahezu identische Seiten — die sich nur durch einen eingesetzten Namen oder eine Zahl unterscheiden — sind der übliche Grund, und erneutes Einreichen ändert nichts, weil sich die Grundlage der Entscheidung nicht geändert hat.

Das Ranking und die KI-Funktionen von Google basieren auf denselben Grundlagen

Für eine bestimmte Suchanfrage ruft die Suche relevantes Material ab und ordnet es. Googles KI-Übersichten und der KI-Modus können außerdem Query-Fan-out nutzen und mehrere verwandte Suchen zu Unterthemen und Datenquellen ausführen, bevor eine Antwort mit unterstützenden Links entsteht.

Die Konsequenz ist einfach: Sichtbarkeit in Googles KI-Suchfunktionen setzt weiterhin die gewöhnliche Eignung für die Google-Suche voraus. Laut Google gibt es keine zusätzlichen technischen Anforderungen und kein spezielles KI-Markup; Crawling muss erlaubt sein, wichtige Inhalte sollten indexierbar und als Text verfügbar sein, und Vorschaukontrollen wie nosnippet können begrenzen, was in KI-Funktionen erscheint.

Auf der eigenen Website testen

Fragen und Antworten

Entfernt eine Sperre in robots.txt eine Seite aus Google?

Nein. robots.txt verhindert den Abruf, nicht die Indexierung. Eine gesperrte URL, auf die andere Seiten verlinken, kann indexiert und ohne Beschreibung gelistet werden, weil der Crawler das ausschließende noindex nie lesen durfte. Damit eine Seite nicht erscheint, lassen Sie sie crawlen und liefern eine noindex-Anweisung — oder verlangen eine Anmeldung.

Wie lange dauert die Indexierung?

Es gibt kein garantiertes Zeitfenster. Eine neue Seite kann in Stunden indexiert oder wochenlang liegen gelassen werden; gecrawlt zu werden ist laut Google keine Zusage für die Aufnahme. Liegt eine Seite Wochen unindexiert, während vergleichbare Seiten derselben Site schnell aufgenommen wurden, werten Sie das als Urteil über die Seite, nicht als Verzögerung.

Muss ich mich um das Crawl-Budget kümmern?

Mit hoher Wahrscheinlichkeit nicht. Googles Schwellen liegen bei rund einer Million wöchentlich aktualisierter Seiten oder zehntausend täglich wechselnden Seiten. Darunter scheitern langsam erscheinende Seiten meist an der Indexierung, nicht an der Crawl-Kapazität.

Können JavaScript-Inhalte indexiert werden?

Ja, denn die Suchmaschine rendert Seiten vor der Indexierung. Das Risiko ist nicht JavaScript selbst, sondern seine Abhängigkeiten: Sperrt robots.txt die Skripte oder Endpunkte, die die Seite braucht, rendert sie leer und wird leer indexiert — ohne dass irgendein Status die Ursache benennt.