Man trifft regelmäßig auf Websites, deren Menü eine Vielzahl von Rubriken anzeigt, aber das Auffinden einer bestimmten Seite gestaltet sich wie ein Hindernislauf. Bevor man überhaupt von einer Neugestaltung oder SEO spricht, ist die Ausgangsfrage viel einfacher: Wie liest man die Struktur einer bestehenden Website, um zu verstehen, was sie enthält, was fehlt und welche Probleme sowohl Besucher als auch Crawling-Roboter haben.
robots.txt und XML-Sitemap: die beiden ersten Reflexe der Erkundung
Wenn man die Struktur einer Website verstehen möchte, beginnt man nicht mit dem Klicken im Menü. Man öffnet zwei Dateien, die zugänglich sind, indem man /robots.txt und /sitemap.xml an die Stamm-URL anhängt.
Die robots.txt gibt an, welche Abschnitte für Suchroboter gesperrt sind. Ein ganzes Verzeichnis, das verborgen ist (zum Beispiel /staging/ oder /archive/), weist oft auf aufgegebene Inhalte oder eine unvollendete Migration hin. Die XML-Sitemap listet hingegen die Seiten auf, die der Website-Besitzer als indexierbar betrachtet. Der Vergleich der Sitemap mit dem Navigationsmenü zeigt die Abweichungen auf: verwaiste Seiten, die im Menü fehlen, alte URLs, die noch deklariert sind, leere Kategorien.
Man kann die Website Actu Web im Detail besuchen, um ein konkretes Beispiel für eine nach thematischen Rubriken strukturierte Sitemap zu sehen, was eine schnelle Lesbarkeit der redaktionellen Organisation ermöglicht.
Dieser Schritt dauert nur wenige Minuten und liefert eine grobe Kartierung des Inhalts, bevor eine tiefere Analyse erfolgt.

Erkundung durch KI-Roboter: GPTBot, ClaudeBot und die neuen Zugangsregeln
Seit 2023 protokollieren Serverprotokolle Besuche von Robotern, die es vor einigen Jahren noch nicht gab: GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot, Applebot und OAI-SearchBot. Diese Agenten versuchen nicht, Seiten für eine klassische Suchmaschine zu indexieren. Sie sammeln Inhalte, um Sprachmodelle zu trainieren oder konversationelle Antworten zu generieren.
Diese Roboter von klassischen Crawlern wie Googlebot zu unterscheiden, ist zu einer eigenständigen Aufgabe geworden. Die Filteroptionen erfolgen über die robots.txt (spezifische User-Agent-Richtlinien), aber auch über CDN-Regeln, WAF oder IP-Einschränkungen für eine granularere Kontrolle.
Die Datei llms.txt, eine Struktur-Schicht außerhalb von HTML
Seit 2025 empfehlen mehrere Leitfäden, eine Datei llms.txt im Stammverzeichnis der Website zu platzieren. Diese Datei listet die priorisierten URLs und die Zugangsrichtlinien für jeden KI-Agenten auf. Einige fügen Zusammenfassungen des Inhalts nach Abschnitt hinzu.
Das Ziel ist es, eine gezielte Erkundung durch Sprachmodelle zu erleichtern, während die XML-Sitemap auf traditionelle Suchmaschinen ausgerichtet bleibt. Man wechselt von einer Logik “Indexierung für Google” zu einer Logik der “Multi-Agenten-Sichtbarkeit“, die auch die konversationelle Suche abdeckt.
Die Rückmeldungen zur tatsächlichen Annahme dieser Datei durch die verschiedenen Agenten variieren, aber das Prinzip, den Zugang je nach Art des Roboters zu segmentieren, setzt sich allmählich als gute Praxis durch.
Websites als Single Page Application: die Falle des unsichtbaren Inhalts
Eine Website, die als SPA (React, Vue, Angular) erstellt wurde, lädt ihren gesamten Inhalt über JavaScript auf der Client-Seite. Visuell scheint die Navigation flüssig zu sein. Für einen Crawling-Roboter kann das Ergebnis eine nahezu leere Seite sein, wenn das Server-Rendering (SSR oder Vor-Rendering) nicht konfiguriert ist.
Ohne Server-Rendering bleibt der Großteil des Inhalts einer SPA für Crawler unsichtbar. Googlebot führt JavaScript aus, jedoch mit Verzögerungen und Einschränkungen. Die KI-Roboter hingegen verfügen nicht alle über diese Fähigkeit.
Bei der Analyse der Struktur einer SPA-Website müssen drei konkrete Punkte überprüft werden:
- Enthält der Quellcode (Strg+U im Browser) den sichtbaren Text auf dem Bildschirm oder nur leere Tags und JavaScript-Aufrufe?
- Generieren die internen URLs auf der Serverseite separate Seiten oder läuft alles über einen einzigen Einstiegspunkt mit Fragmenten (#)?
- Referenziert die XML-Sitemap alle Routen der Anwendung, einschließlich der dynamischen Unterseiten?
Wenn der Quellcode leer ist und die Sitemap die internen Routen nicht abdeckt, hat die Website ein Erkundungsproblem, das sowohl das klassische SEO als auch die Sichtbarkeit bei KI-Agenten betrifft.

Mobile Navigation und Klicktiefe: die tatsächliche Zugänglichkeit des Inhalts messen
Am Desktop ermöglicht ein zweistufiges Dropdown-Menü den Zugriff auf mehrere Dutzend Seiten mit einem Klick. Auf Mobilgeräten verwandelt sich dasselbe Menü in ein Akkordeon oder ein Hamburger-Menü, und jede Ebene fügt eine Touch-Interaktion hinzu. Die wahrgenommene Klicktiefe auf Mobilgeräten ist oft doppelt so hoch wie die am Desktop.
Um die Struktur aus der Sicht des Benutzers zu bewerten, zählt man die Anzahl der Taps, die erforderlich sind, um die am häufigsten besuchten Seiten zu erreichen. Über drei Taps von der Startseite steigt die Abbruchrate erheblich an. Das ist auch ein Signal für Suchmaschinen: Eine Seite, die fünf Ebenen tief vergraben ist, erhält weniger Crawl-Budget.
Interne Verlinkung und kontextuelle Links
Das Hauptmenü reicht nicht aus, um alle Seiten zugänglich zu machen. Die Links, die im Text der Artikel oder Produktblätter integriert sind, bilden die kontextuelle interne Verlinkung. Dieses Netzwerk interner Links erfüllt zwei Funktionen:
- Es leitet den Besucher zu ergänzenden Inhalten, ohne erneut über das Menü gehen zu müssen, was die tatsächliche Navigationstiefe verringert
- Es verteilt die SEO-Autorität zwischen den Seiten und signalisiert den Robotern, welche Seiten thematisch miteinander verbunden sind
- Es bietet den KI-Agenten zusätzliche Erkundungswege zu Inhalten, die nicht immer in der Sitemap aufgeführt sind
Die Analyse der internen Verlinkung einer Website entspricht der Kartierung ihrer tatsächlichen Verbindungen, nicht nur ihrer theoretischen Struktur.
Eine moderne Website auditieren: Wo konkret anfangen?
Wir fassen die praktische Reihenfolge zusammen: Öffnen Sie die robots.txt, um Blockaden zu erkennen, lesen Sie die XML-Sitemap, um die deklarierten Seiten aufzulisten, überprüfen Sie das Vorhandensein einer llms.txt-Datei, testen Sie das Server-Rendering auf einigen Schlüsselseiten und zählen Sie die Klicktiefe auf Mobilgeräten. Diese fünf Überprüfungen decken die Aspekte ab, die die meisten Audits vernachlässigen, insbesondere den Zugang der KI-Roboter zu den Inhalten und das tatsächliche Verhalten von Websites in JavaScript.
Die Erkundung einer Website beschränkt sich nicht mehr auf ihre sichtbare Navigation. Die Struktur, die zählt, ist die, die die Roboter, ob klassisch oder konversationell, tatsächlich lesen können.



