llms.txt
Ein praktischer Leitfaden zur optionalen llms.txt-Konvention: Format, Quellenpflege, Umsetzung, Validierung, Abgrenzung zu robots.txt und Sitemaps, Google-Hinweise, Lighthouse und aktuelle Grenzen.
- #LLM SEO
- #KI-SEO
- #SEO-Glossar
- #Technisches SEO
Einfach erklärt
llms.txt ist eine vorgeschlagene, optionale Markdown-Datei unter /llms.txt, die Agenten zur Laufzeit eine kuratierte Orientierung zu einer Website und ihren verbindlichen öffentlichen Quellen gibt.
Wichtigste Erkenntnisse
- llms.txt ist eine informelle optionale Konvention und weder Google-Search-Anforderung noch belegter Rankingfaktor
- Die Datei weist Agenten auf öffentliche Quellen hin, steuert aber weder Crawling, Datenschutz, Training, Indexierung noch Zitate
- Eine nützliche llms.txt sollte aus kanonischen Inhalten erzeugt, bewusst kuratiert, validiert und verbindlich gepflegt werden
Im Detail
Kurzdefinition
llms.txt ist eine vorgeschlagene, optionale Markdown-Datei unter /llms.txt. Sie soll einem Agenten zur Laufzeit eine kompakte Karte der Website geben, das Projekt einordnen und auf eine kuratierte Auswahl verbindlicher öffentlicher Quellen verweisen.
Es handelt sich um einen informellen Vorschlag und nicht um einen formalen Webstandard. Die Datei erteilt keine Crawl-Erlaubnis, nimmt Inhalte nicht vom Modelltraining aus, bringt keine URLs in einen Suchindex, ist kein Google-Rankingfaktor und garantiert nicht, dass ein Antwortsystem sie liest, zitiert oder befolgt.
Welches Problem der Vorschlag lösen soll
Eine Dokumentations- oder Wissenswebsite kann Hunderte nützliche Seiten enthalten, eingebettet in Navigation, Skripte, Layout, Filter, Changelogs, Archive und doppelte Routen. Ein Agent mit begrenztem Kontext braucht möglicherweise einen kürzeren Weg zur kanonischen Einführung, aktuellen Dokumentation, primären Definitionen und wichtigen Richtlinien.
llms.txt schlägt für diesen Moment eine menschenlesbare Quellenkarte vor. Sie kann sinngemäß sagen: Das ist das Projekt, diese öffentlichen Quellen erklären es, und diese optionalen Ressourcen dürfen bei knappem Kontext ausgelassen werden.
Die Orientierung macht eine Quelle nicht automatisch verbindlich. Ein Link in der Datei verleiht einer schwachen Seite keine Glaubwürdigkeit. Die verlinkte Seite muss weiterhin aktuell, zugänglich, präzise und belegt sein.
Status der Konvention
Jeremy Howard hat den Vorschlag im September 2024 veröffentlicht, die Seite wurde seitdem überarbeitet. Er beschreibt ein Markdown-Format und regt zusätzlich an, saubere Markdown-Fassungen einzelner Seiten unter derselben URL mit angehängtem .md anzubieten. Er legt nicht fest, wie jedes Modell, jeder Agent, jedes Suchprodukt oder jeder Browser die Datei verarbeiten muss. Verbreitung und Verhalten bleiben produktspezifisch.
Chrome Lighthouse beschreibt llms.txt in den Hinweisen zu Agentic Browsing als aufkommende Konvention. Der Test behandelt eine fehlende Datei als nicht anwendbar, weil sie optional ist. Ein Serverfehler wird dagegen gemeldet, denn eine defekte bereitgestellte Route unterscheidet sich von der bewussten Entscheidung, keine Datei zu veröffentlichen.
Dieser Lighthouse-Test macht llms.txt nicht zu einer Anforderung von Google Search. Bereitschaft für Browser-Agenten und Ranking in Google Search sind unterschiedliche Kontexte.
Das vorgeschlagene Format
Der Vorschlag nutzt Markdown, weil Menschen es leicht prüfen und Software es gut verarbeiten kann. Nur ein Element ist erforderlich: eine H1-Überschrift mit Projekt- oder Websitenamen. Die übrigen Elemente sind optional und folgen in dieser Reihenfolge:
- ein Blockzitat mit einer kurzen Projektbeschreibung;
- zusätzliche Hinweise oder Kontext ohne Überschrift;
- H2-Abschnitte mit Markdown-Linklisten;
- ein H2-Abschnitt namens
Optionalfür Ressourcen, die bei knappem Kontext entfallen können.
Jeder Listeneintrag kann einen Link und nach einem Doppelpunkt eine kurze Beschreibung enthalten. Die Beschreibung sollte erklären, warum die Quelle wichtig ist, statt nur den Seitentitel zu wiederholen.
markdown# Beispielprojekt
> Eine knappe Beschreibung von Projekt, Zielgruppe und Quellenumfang.
Für Produktverhalten gilt die aktuelle Dokumentation. Preis- und Richtlinienseiten nennen ihren eigenen Gültigkeitszeitpunkt.
## Dokumentation
- [Erste Schritte](https://example.com/docs/start): Aktueller Einrichtungsweg und unterstützte Voraussetzungen.
- [API-Referenz](https://example.com/docs/api): Verbindliche Endpunkt- und Schemadokumentation.
## Richtlinien
- [Sicherheit](https://example.com/security): Veröffentlichter Sicherheitsumfang und Meldeweg.
## Optional
- [Changelog](https://example.com/changelog): Datierte Produktänderungen und Migrationshinweise.
Der Vorschlag erwähnt außerdem eine optionale llms-full.txt mit einer umfangreicheren Markdown-Zusammenstellung. Diese größere Datei erhöht Pflege- und Kontextaufwand. Sie sollte nicht allein deshalb entstehen, weil der Dateiname im Vorschlag vorkommt.
Was llms.txt nicht ist
Keine robots.txt
robots.txt formuliert Crawl-Regeln für benannte User-Agents und Pfade. llms.txt enthält Beschreibungen und Links. Eine dort aufgeführte URL hebt weder Sperren noch Anmeldung, Firewall, Paywall, noindex oder Anbieterrichtlinien auf.
Umgekehrt hält das Weglassen einer Seite aus llms.txt weder Crawler noch einen vom Nutzer beauftragten Agenten davon ab, sie auf anderem Weg zu finden. Verwende für Zugriff, Datenschutz, Indexierung und Bot-Regeln echte technische Kontrollen.
Keine Sitemap
Eine XML-Sitemap unterstützt Suchmaschinen bei der Entdeckung kanonischer URLs in größerem Umfang. Sie kann viele URLs und technische Metadaten enthalten. llms.txt soll dagegen auswählen und erklären.
Eine Sitemap beantwortet: „Welche URLs soll eine Suchmaschine kennen?“ Eine kuratierte llms.txt beantwortet: „Welche öffentlichen Quellen erklären dieses Projekt am besten?“ Eine Website kann je nach Bedarf beide, eine oder keine dieser Dateien nutzen.
Kein Ausschluss vom Training
Crawler-Regeln sind anbieterspezifisch. OpenAI dokumentiert etwa OAI-SearchBot für ChatGPT Search und GPTBot für Inhalte, die möglicherweise im Training verwendet werden. Beide Kontrollen sind voneinander getrennt. Anthropic nennt ebenfalls getrennte Bots: ClaudeBot für Inhalte, die ins Training einfließen können, Claude-SearchBot für die Suchqualität und Claude-User für Abrufe, die ein Nutzer auslöst.
Eine llms.txt ersetzt diese Regeln nicht. Sie kann auch kein Wissen entfernen, das bereits in einem veröffentlichten Modell vorhanden ist.
Keine Datenschutz- oder Sicherheitsgrenze
Liste niemals private, interne, rechtlich beschränkte, vertrauliche, tokenisierte, Staging-, Vorschau- oder Kundendaten-URLs auf. Die Datei ist öffentlich. Ein Hinweis, ein Agent solle einen Link nicht nutzen, ist keine Zugriffskontrolle.
Keine Zitat- oder Rankinggarantie
Eine Anwendung kann die Datei ignorieren, lesen und trotzdem eine andere Quelle wählen oder das verlinkte Material ohne sichtbares Zitat verwenden. Es gibt keine belastbare öffentliche Formel, die aus der Aufnahme in llms.txt eine Sichtbarkeitswahrscheinlichkeit berechnet.
Was Google sagt
Laut Googles Hinweisen zu AI Overviews und AI Mode gelten die üblichen Grundlagen der Suche. Websitebetreiber brauchen keine neuen maschinenlesbaren Dateien, speziellen KI-Textdateien oder besonderen strukturierten Daten, um in diesen Funktionen zu erscheinen. Unterstützende Seiten müssen weiterhin indexiert, für Snippets geeignet, zugänglich und mit den Search-Richtlinien vereinbar sein.
llms.txt ist daher keine Voraussetzung für Google Search, AI Overviews oder AI Mode. Ein Agentic-Browsing-Test in Lighthouse macht eine fehlende Datei weder zum Rankingfaktor noch zum Site-Audit-Fehler.
Wann die Datei nützlich sein kann
Am plausibelsten ist die Konvention, wenn ein stabiler öffentlicher Wissensraum mehr nützliche Quellen enthält, als ein Agent sinnvoll auf einmal prüfen kann. Beispiele sind:
- Entwicklerdokumentation mit versionierten Leitfäden und API-Referenzen;
- Produkte mit mehreren gepflegten Feature-, Richtlinien- und Integrationsseiten;
- große Glossare oder Forschungsbibliotheken mit kanonischen Definitionen;
- Help Center mit verbindlichen Wegen zur Problemlösung;
- Standards, Hochschulen, Behörden oder Open-Source-Projekte mit klarer Quellenverantwortung;
- mehrsprachige Websites, die die verbindliche Ressource je Sprache kennzeichnen können.
Der mögliche Nutzen ist operativ: Eine geprüfte Karte macht Quellenprioritäten leichter erkennbar. Eine Anwendung muss sich dennoch entscheiden, die Datei zu verwenden.
Wann sie besser fehlt
Veröffentliche llms.txt nicht nur wegen einer Checkliste. Verzichte darauf, wenn:
- kein Anwendungs- oder Nutzerbedarf den Pflegeaufwand rechtfertigt;
- das Team weder verantwortliche Person noch Prüfzyklus benennen kann;
- Produkt-, Preis-, Richtlinien- oder Dokumentationsquellen einander widersprechen;
- die Liste nicht öffentliche Routen offenlegen würde;
- die Datei zu einem automatischen Export mit Hunderten URLs würde;
- das Projekt eine Google-Ranking- oder Zitatgarantie erwartet.
Ein sauberer 404-Status ist für eine optionale Datei zulässig. Eine veraltete Datei mit eingestellten Funktionen oder alten Richtlinien kann schädlicher sein als gar keine, weil sie eine bequeme Karte falscher Fakten veröffentlicht.
Aus der verbindlichen Quelle erzeugen
Bei einer Website mit strukturierten Inhalten sollte die Datei aus denselben kanonischen Datensätzen entstehen, die Navigation, Dokumentation, Produktmetadaten, Sprachversionen und öffentlichen Status bestimmen. Nutze eine kleine ausdrückliche Positivliste von Ressourcengruppen, statt jede veröffentlichte Route zu exportieren.
Ein pflegbarer Prozess definiert:
- wer Beschreibungen und Quellenpriorität freigibt;
- welche Content-Status zulässig sind, etwa ausschließlich öffentlich und produktiv;
- wie kanonische und sprachspezifische URLs gewählt werden;
- welche Seitentypen mit wie vielen Links vorkommen dürfen;
- wann eingestellte, weitergeleitete oder wesentlich veränderte Seiten entfernt werden;
- wie Änderungen vor dem Deployment geprüft werden;
- welcher zeit- oder ereignisgesteuerte Ablauf die Datei neu erzeugt.
Eine manuelle Datei ist für eine kleine stabile Website vertretbar. Bei einem großen Produkt erzeugt manuelle Duplizierung leicht Abweichungen.
Regeln für die redaktionelle Auswahl
Wähle Links, weil sie eine eigenständige wichtige Frage beantworten. Bevorzuge die aktuelle Primärquelle gegenüber einer Zusammenfassung, die sie nur wiederholt. Halte Beschreibungen sachlich und kurz. Veränderliche Informationen erhalten ihren Gültigkeitszeitpunkt auf der verlinkten Seite, statt volatile Details in die Quellenkarte zu kopieren.
Vermeide:
- fünf Seiten mit derselben Antwort;
- Kampagnen-URLs, Trackingparameter, Suchergebnisse, Filter oder Paginierung;
- rohe Verzeichnisse mit 500 Links;
- unbelegte Marketing-Superlative;
- Beschreibungen, die der verlinkten Seite widersprechen;
- veraltete Sprachversionen oder weitergeleitete Pfade;
- einen Link zur Startseite, wenn eine präzise Quelle vorhanden ist.
Der Abschnitt Optional eignet sich für nachgeordnete Beispiele, Archive und Changelogs. Er sollte kein Ablageort für alles werden, was die eigentliche Auswahlentscheidung nicht bestanden hat.
Technische Validierung
Prüfe nach dem Deployment die öffentliche Route und nicht nur die Quelldatei:
- rufe den genauen Root-Pfad
/llms.txtohne Anmeldung ab; - erwarte eine erfolgreiche HTTP-Antwort und UTF-8-Text;
- liefere lesbaren Klartext oder Markdown mit einem sinnvollen Content-Type aus;
- prüfe H1, Abschnittsreihenfolge, Linksyntax und absolute öffentliche URLs;
- lehne private Hosts, Localhost, Vorschau-Deployments, Tracking-URLs, Fragmente und doppelte Canonicals ab;
- folge jedem ausgewählten Link und markiere Serverfehler, Soft 404, blockierte Seiten oder unerwartete Weiterleitungen;
- vergleiche Beschreibungen mit aktuellen Seitentiteln und Quellenfakten;
- wiederhole die Prüfung nach relevanten Content- oder Routing-Releases.
Leite Nutzung nicht aus einem einzelnen Abruf im Serverlog ab. Ein Bot kann die Datei laden, ohne sie in einer Antwort zu verwenden. Caches oder Proxy-Anfragen können die anfragende Stelle zudem verschleiern.
Wo Crawl Foundry hilft
Die Prüfungen von Crawl Foundry setzen neben der Datei an, bei der Frage des Zugriffs. Der kostenlose AI Crawler Checker prüft, ob Such- und KI-Crawler eine öffentliche Seite abrufen, indexieren und auslesen können. Der kostenlose AI robots.txt Checker zeigt, welche KI-Crawler jede Regel einer robots.txt tatsächlich erlaubt oder sperrt.
Wenn du eine llms.txt veröffentlichen willst, ist die Vorarbeit normale SEO-Evidenz: Welche Seiten tragen deine wichtigen Themen, und liefern diese URLs 200, sind sie indexierbar und intern verlinkt? Dabei helfen die Keyword-Datenbank und der Site Audit. Keine dieser Prüfungen zeigt, ob ein Agent die llms.txt liest, und Crawl Foundry verspricht durch die Datei weder Zitate noch Rankings.
Häufige Fehlwege
- Einen Vorschlag als Standard oder von jedem LLM unterstütztes Protokoll bezeichnen.
- Abwesenheit als technischen SEO-Fehler darstellen.
- Quellenorientierung mit Bot-Erlaubnis verwechseln.
- Behaupten, die Datei widerspreche dem Training.
- Private oder Staging-URLs veröffentlichen.
- Einen vollständigen Sitemap-ähnlichen URL-Export erzeugen.
- Veränderliche Preise und Produktversprechen ohne verantwortliche Pflegeperson kopieren.
- Links und Beschreibungen nach einer Migration veralten lassen.
- Einen Lighthouse-Test als Beleg für Google-Search-Wirkung verwenden.
- Eine Zitatänderung ohne kontrollierte Evidenz auf
llms.txtzurückführen.
FAQ
Ist llms.txt für Google SEO erforderlich?
Nein. Google verlangt für AI Overviews oder AI Mode keine neue KI-Textdatei. Die üblichen Anforderungen der Suche bleiben maßgeblich.
Ersetzt llms.txt robots.txt oder eine Sitemap?
Nein. robots.txt formuliert Crawl-Regeln, eine Sitemap unterstützt die URL-Entdeckung. llms.txt ist eine optionale kuratierte Orientierungsdatei.
Bedeutet ein 404-Status einen SEO-Fehler?
Nein. Die Datei ist optional. Die aktuellen Hinweise zu Lighthouse Agentic Browsing behandeln eine fehlende Datei als nicht anwendbar. Ein Serverfehler ist dagegen ein anderes Umsetzungsproblem.
Blockiert llms.txt Training oder garantiert ein Zitat?
Nein. Anbieter regeln Trainingsnutzung und Suchcrawler getrennt. Zitate bleiben eine Entscheidung des jeweiligen Retrieval- und Antwortsystems.
Sollte jede Dokumentationswebsite eine Datei veröffentlichen?
Nur wenn sie eine nützliche kuratierte Quellenmenge und eine glaubwürdige Pflegeverantwortung besitzt. Der Anwendungsfall entscheidet, nicht ein pauschaler Readiness-Wert.
Verwandte Begriffe
- KI-SEO
- KI-Sichtbarkeit
- Generative Engine Optimization
- Answer Engine Optimization
- robots.txt
- XML-Sitemap
- AI Overviews
- Google KI-Modus
Quellen und weiterführende Informationen
Warum es für SEO wichtig ist
Teams müssen eine potenziell nützliche Orientierungsdatei von Zugriffskontrollen und belegten Search-Anforderungen unterscheiden. Sonst erzeugt ein optionales Experiment veraltete Fakten, falsche Erwartungen und unnötige Technikarbeit.
Häufige Fragen
Was ist llms.txt?
llms.txt ist eine vorgeschlagene, optionale Markdown-Datei unter /llms.txt, die Agenten zur Laufzeit eine kuratierte Orientierung zu einer Website und ihren verbindlichen öffentlichen Quellen gibt.
Warum ist llms.txt für SEO wichtig?
Teams müssen eine potenziell nützliche Orientierungsdatei von Zugriffskontrollen und belegten Search-Anforderungen unterscheiden. Sonst erzeugt ein optionales Experiment veraltete Fakten, falsche Erwartungen und unnötige Technikarbeit.
Geprüft von
Crawl Foundry Team
Editorial TeamThe Crawl Foundry editorial team.
Eine gemeinsame Evidenzbasis für dein Content-Team
Crawl Foundry gibt Redaktion, Strategie und Leitung eine gemeinsame Keyword-Datenbank mit Listen, Tags, SERP-Kontext und Status. Ob du eine llms.txt veröffentlichst, bleibt deine Entscheidung.