Seit ungefähr zwei Jahren kursiert llms.txt als “das neue robots.txt für KI”. Stimmt so nicht. Die beiden Dateien lösen unterschiedliche Probleme, und wer sie verwechselt, verschwendet entweder Zeit auf die falsche Datei oder lässt eine echte Chance liegen: dass deine Seite von KI-Suchmaschinen ordentlich zusammengefasst wird, statt schlecht.
Dieser Beitrag klärt, was llms.txt tatsächlich ist, was es nicht ist, wie du eine schreibst, und was KI-Clients Stand Juli 2026 wirklich damit machen.
Was ist llms.txt?
llms.txt ist eine Markdown-Datei im Root deiner Domain, die deine Seite für Sprachmodelle zusammenfasst. Kein Zugriffs-Regelwerk, sondern ein Content-Dokument. Sie zeigt einem LLM, welche Seiten es lesen sollte, wenn es verstehen will, was du machst.
Vorgeschlagen hat sie Jeremy Howard von Answer.AI im September 2024, dokumentiert unter llmstxt.org. Der Hintergrund: Wenn ein LLM eine Antwort auf deiner Seite verankern will, hat es ein begrenztes Kontextfenster und ein paar Sekunden Zeit. Es kann nicht deine ganze Sitemap lesen, jeden verlinkten Artikel abrufen und dabei JavaScript-Navigation parsen. Also greift es zur falschen Seite, übersieht deine Preise oder fasst veraltete Marketing-Texte zusammen.
llms.txt ist deine Gelegenheit, das vorwegzunehmen: hier die kanonische Zusammenfassung, hier der Einzeiler, hier die URLs, die für die Fragen zählen, die Menschen tatsächlich stellen.
Die Datei liegt unter https://deinedomain.de/llms.txt — gleiche Konvention wie robots.txt oder sitemap.xml.
Was llms.txt NICHT ist
Der Abschnitt, wegen dem dieser Artikel existiert. Drei Verwechslungen, die in den meisten “llms.txt erklärt”-Artikeln vorkommen:
Verwechslung 1: Es ist robots.txt für KI. Nein. robots.txt steuert Zugriff — welche Pfade ein Bot fetchen darf und welche nicht. llms.txt steuert gar nichts. Es ist ein Content-Artefakt, kein Policy-Artefakt. Die beiden ergänzen sich, sie ersetzen sich nicht.
Verwechslung 2: Ohne llms.txt findet dich keine KI. Auch falsch. KI-Suchmaschinen (Perplexity, ChatGPT Search, Google AI Overviews) crawlen normales HTML und folgen denselben Signalen wie klassische Suchmaschinen: Heading-Struktur, schema.org, sitemap.xml, interne Verlinkung. llms.txt ist ein zusätzliches Signal, kein Ersatz. Eine Seite ohne llms.txt funktioniert trotzdem.
Verwechslung 3: Es ist ein verbindlicher Standard. Nein, es ist ein Vorschlag auf llmstxt.org, Adoption ist freiwillig. Manche größere Seiten liefern eine aus (Anthropic, Vercel, Cursor), die meisten nicht. Für dich heißt das: das Feld ist nicht gesättigt, früh dabei zu sein zählt noch etwas.
Aufbau: so sieht eine llms.txt aus
Das Format ist bewusst minimal. Eine gültige llms.txt:
# Projektname
> Ein-Satz-Beschreibung, was du machst.
Optionaler Absatz mit mehr Detail.
## Abschnitt
- [Seitentitel](url): eine Zeile Beschreibung
- [Andere Seite](url): eine Zeile Beschreibung
## Optional
- Weniger wichtige Links hier.
Markdown-Überschriften, Bullet-Links mit Beschreibung, optionale Prosa. Kein YAML-Frontmatter, kein JSON.
Zwei Details, die man kennen sollte: ## Optional ist eine reservierte Überschrift — LLMs sollen diese Abschnitte zuerst fallen lassen, wenn der Kontext knapp wird. Und eine Begleitdatei llms-full.txt kann den kompletten Inhalt der verlinkten Seiten ausgeschrieben enthalten, damit das LLM sie nicht extra abrufen muss. Für die meisten Seiten reicht llms.txt allein.
So sieht unsere eigene aus — gekürzt und hier ins Deutsche übersetzt, das Original unter /llms.txt ist englisch:
# mcp-analytics
> Web-Analytics, die du über Claude oder jeden MCP-Client abfragst. Kein
> Dashboard, keine Charts, nur Antworten. Kostenlos bis 100.000 Hits/Monat,
> EU-gehostet in Deutschland, cookie-banner-frei im Strict-Modus.
mcp-analytics ist privacy-first Web-Analytics mit dem Model Context
Protocol (MCP) als primärer Schnittstelle. Statt ein Dashboard zu öffnen,
verbinden sich Nutzer über Claude Desktop, ChatGPT, Cursor oder jeden
anderen MCP-Client und stellen Fragen in normaler Sprache.
## Produkt
- [Startseite](https://mcp-analytics.com/): Preise, Signup, Positionierung.
- [Docs](https://mcp-analytics.com/docs): Setup-Anleitung.
## MCP-Tool-Katalog
- [Alle Tools](https://mcp-analytics.com/mcp/tools): 23 aufrufbare
Funktionen mit Argumenten und Beispiel-Prompts.
## Optional
- Architektur: Rails 8 + Go-Ingest + ClickHouse, ein kleiner EU-VPS.
Drei bewusste Entscheidungen: Der Blockquote-Satz ist die Stelle, die ein LLM am ehesten wörtlich zitiert — mehr Aufwand hier lohnt sich mehr als an jeder anderen Textstelle der Domain. Die Abschnitts-Namen (“Produkt”, “MCP-Tool-Katalog”) sind so formuliert, wie ein Nutzer denkt, nicht wie wir intern kategorisieren. Und die Architektur-Zeile liegt unter Optional, weil sie zwar ganz interessant, aber für 95 % der Fragen irrelevant ist.
Wer liest llms.txt wirklich? (Stand Juli 2026)
Das ist die Frage, die entscheidet, ob sich der Aufwand lohnt, und hier lohnt sich Ehrlichkeit mehr als Enthusiasmus.
Die großen Crawler, die für Training oder klassische KI-Suche zuständig sind — GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended — fragen llms.txt, soweit von außen erkennbar, überwiegend nicht ab. Sie crawlen direkt HTML, wie sie es immer getan haben. Kein großes KI-Labor (OpenAI, Anthropic, Google, Meta) hat sich öffentlich dazu verpflichtet, llms.txt zu lesen oder auszuwerten. Es kursieren Adoptionszahlen im niedrigen Prozentbereich und Fetch-Raten aus einzelnen Log-Analysen — die Methodik dahinter ist von außen nicht nachprüfbar, deshalb nennen wir hier bewusst keine konkrete Zahl. Die Richtung stimmt trotzdem: llms.txt ist heute kein Signal, auf das sich die großen Suchcrawler verlassen.
Anders sieht es bei einzelnen Clients aus, die eine Seite live während einer Konversation lesen: Cursor holt llms.txt nicht von selbst — du kannst die Datei aber manuell als @Docs-Quelle hinzufügen, wofür ihr Format gut passt; als offizielle llms.txt-Integration dokumentiert ist das nicht. Claudes Web-Tool holt llms.txt opportunistisch ab, wenn die URL angefragt wird, nicht durchgängig dokumentiert, aber beobachtet. Für ChatGPT Search kursieren Berichte, die Datei werde beim Indexieren abgerufen — das verträgt sich schlecht mit den Log-Analysen aus dem letzten Absatz (OAI-SearchBot fragt sie überwiegend nicht ab), also behandeln wir das als unbestätigt. Zu Perplexity kursiert in SEO-Blogs die Behauptung, das Unternehmen habe llms.txt selbst als “ein Signal unter mehreren” bezeichnet — eine Primärquelle dafür haben wir nicht gefunden, und Log-Analysen Dritter zeigen, dass PerplexityBot die Datei praktisch nie abruft. Bis Perplexity sich selbst äußert: unbelegt. Bei Phind, You.com oder DuckDuckGo AI ist unklar, ob überhaupt gelesen wird; sicherer ist die Annahme, dass sie auf normales HTML/Sitemap-Parsing zurückfallen. Google AI Overviews hat sich öffentlich nicht dazu geäußert — es nutzt den bestehenden Such-Index plus Knowledge Graph.
Ein wiederkehrendes Muster, unabhängig davon, wie belastbar der Beleg im Einzelfall ist: Entwickler-Tools und Coding-Agents (IDE-Integrationen, MCP-Clients) scheinen llms.txt-artige Dateien in der Praxis eher abzurufen als klassische KI-Suchcrawler. Nachvollziehbar, weil Doku-Seiten für Coding-Assistenten gebaut werden — aber keine Vendor-Bestätigung dafür gefunden, eher Beobachtung als Spezifikation.
Fazit für die eigene Praxis: der Ertrag heute ist klein, aber nicht null, und die Kosten sind ein einziges Markdown-File. Kein Grund, es auszulassen — aber auch kein Grund, llms.txt als Wachstumshebel zu verkaufen, den es Stand jetzt nicht ist.
llms.txt für deine Seite schreiben
Machbar in unter einer Stunde.
1. Die fünf Fragen sammeln, die Nutzer einem LLM über dich stellen würden. Typisch für ein SaaS: Was macht X? Was kostet X? Ist X besser als Y? Wie richte ich X ein? Zu jeder Frage: welche eine kanonische Seite beantwortet sie am besten?
2. Zuerst den Blockquote-Satz schreiben. Er landet in Zitaten häufiger als jeder andere Text deiner Seite. Test: in einen neuen Chat einfügen, “erklär in eigenen Worten, was das ist” fragen, prüfen ob die Paraphrase passt.
3. Die kanonischen Seiten in drei bis fünf Abschnitte gruppieren. Gute Labels: “Produkt”, “Preise”, “Docs”, “Vergleiche”. Schlechte Labels, zu generisch zum Einordnen: “Sonstiges”, “Links”.
4. Jede Zeile im Format [Titel](url): eine Zeile Beschreibung. Nicht den Titel in der Beschreibung wiederholen. Gut: [Preise](url): kostenlos bis 100k Hits, €19/Monat, keine Jahresbindung. Schlecht: [Preise](url): Die Preisseite.
5. Tangentiales unter ## Optional ablegen. Architektur-Doku, Changelog, Blog des Gründers — nett, aber verzichtbar.
6. Ablegen unter public/llms.txt. Bei Rails, Next.js, Astro ist das der Static-Ordner; bei Hugo static/llms.txt, bei Jekyll direkt ins Projekt-Root (Jekyll kopiert Root-Dateien unverändert in die fertige Site). Prüfen mit curl https://deinedomain.de/llms.txt, dass sie ohne Login abrufbar ist und ein 200er zurückkommt.
7. Optional in robots.txt referenzieren. Nicht Teil der Spec, hilft aber manchen Crawlern, sie schneller zu finden. Ein Kommentar reicht, llms.txt in die Sitemap aufzunehmen schadet auch nicht.
Häufige Fehler, die im ersten Moment unauffällig sind: die Datei hinter Login oder Geo-Block versteckt (Crawler fetchen ohne Session); Links, die auf 404- oder noindex-Seiten zeigen (jede URL einzeln prüfen); llms-full.txt mit hundert Seiten Marketing-Text vollstopfen (LLMs haben Kontext-Budgets, überlange Dateien werden abgeschnitten); in der dritten Person über sich selbst schreiben (“Firma X ist führender Anbieter…” liest sich wie eine Pressemitteilung und wird auch so paraphrasiert).
Einordnung: llms.txt, robots.txt und klassisches SEO
llms.txt ist eines von drei Signalen, die beeinflussen, ob dich ein LLM zitiert:
- Klassische SEO-Signale. Title, Meta-Description, Heading-Struktur, interne Verlinkung, schema.org. Dominieren weiterhin — KI-Suche baut auf normaler Suche auf, nicht daneben.
llms.txt. Das Hub-Dokument aus diesem Artikel.robots.txt-Freigabe für KI-Crawler. Wenn duGPTBot,ClaudeBotoderPerplexityBotperDisallow: /blockst, bist du in diesen Engines unsichtbar. Ein häufiger Fehler: 2024 aus Protest gegen KI-Training ein “Block AI Crawler”-Plugin installiert und vergessen, es wieder zu entfernen, als man später in ChatGPTs Antworten auftauchen wollte.
Wenn du nur eine Sache machst: robots.txt für die relevanten Crawler öffnen. Wenn du zwei machst: robots.txt plus llms.txt. Zusammen eine halbe Stunde Aufwand, hält dauerhaft.
Mehr zum Zusammenspiel von KI-Clients und deiner Infrastruktur findest du in unserer MCP-Server-Anleitung — dort geht es um die andere Seite: nicht wie du von KI gelesen wirst, sondern wie du KI-Clients selbst Daten bereitstellst.
Und dann: messen
Eine llms.txt zu schreiben ist der einfache Teil. Zu wissen, ob sich dadurch etwas ändert, ist der Teil, den Standard-Analytics nicht beantworten kann — Google Analytics filtert bekannte Bots pauschal raus und zeigt dir nirgends, welche KI-Crawler bei dir waren oder wie oft.
Wenn du das trotzdem sehen willst: unsere traffic_class_breakdown- und top_user_agents-Tools zeigen dir in Claude direkt, wie viel ai_search-Traffic (PerplexityBot, OAI-SearchBot) und ai_user_action-Traffic (Claude-User, ChatGPT-User — echte Nutzer, die live über eine KI browsen) bei dir ankommt. Eine Frage wie “wie viel meines Traffics kam letzten Monat von KI-Crawlern?” reicht als Prompt. Aggregiert über mehrere Seiten hinweg soll der AI-Crawler-Index das Gleiche zeigen — die Zahlen dort sind Stand heute illustrativ; echt werden sie, sobald mindestens 50 Sites Daten beitragen (steht so auch auf der Seite selbst).