Ratgeber · KI-Sichtbarkeit

llms.txt, Schema.org und KI-Crawler: die technische Seite der KI-Sichtbarkeit

Damit eine KI Ihren Betrieb nennen kann, muss sie Ihre Website lesen dürfen und verstehen können. Drei technische Bausteine entscheiden darüber: die Zugangsregeln für Crawler, die Datei llms.txt und strukturierte Daten nach Schema.org. Ich erkläre alle drei ohne Fachchinesisch, mit einem Beispiel zum Kopieren.

Welche KI-Crawler es gibt und was sie tun

KI-Anbieter besuchen Websites mit eigenen Crawlern, ähnlich wie der Googlebot. Nach den Anbieter-Dokumentationen (Stand September 2026) sind für einen deutschen Betrieb vor allem diese relevant: GPTBot (OpenAI, sammelt Trainingsdaten) und OAI-SearchBot (OpenAI, für die Websuche in ChatGPT), PerplexityBot (Perplexity), ClaudeBot (Anthropic) und Google-Extended (Google, steuert nur die Nutzung für das Training von Gemini). Die KI-Übersichten und der KI-Modus von Google nutzen dagegen den normalen Googlebot; wer den aussperrt, verschwindet aus der gesamten Google-Suche.

Wichtig ist die Unterscheidung zwischen Training und Suche. Wenn Sie nicht möchten, dass Ihre Texte in das Training eines Modells einfließen, können Sie GPTBot und Google-Extended sperren, ohne die Sichtbarkeit in der Suche zu verlieren. Wer aber OAI-SearchBot oder PerplexityBot sperrt, wird in den Antworten dieser Systeme nicht mehr als Quelle auftauchen. Für einen Betrieb, der genannt werden will, ist das Sperren der Such-Crawler kontraproduktiv.

robots.txt: wen Sie hereinlassen

Die Datei robots.txt im Hauptverzeichnis Ihrer Website regelt, welche Crawler welche Bereiche lesen dürfen. Für einen lokalen Betrieb, der in KI-Antworten genannt werden möchte, ist die einfachste Regel die beste: alles erlauben, was öffentlich ist, und nur interne Bereiche ausschließen. Eine typische Fassung:

User-agent: *
Allow: /
Disallow: /intern/

Sitemap: https://www.beispiel-praxis.de/sitemap.xml

Wer das Training einschränken, die Suche aber erlauben will, ergänzt gezielt: User-agent: GPTBot mit Disallow: /, lässt aber OAI-SearchBot unangetastet. Prüfen Sie nach jeder Änderung, ob die Datei unter ihre-domain.de/robots.txt erreichbar ist. Viele Baukasten-Systeme und Firewalls blockieren KI-Crawler ohne Ankündigung; ein Blick in die Server-Logs oder ein Test mit dem jeweiligen User-Agent zeigt, ob die Seite wirklich erreichbar ist.

llms.txt: was es ist und was es nicht ist

llms.txt ist ein Vorschlag aus dem Jahr 2024: eine Textdatei im Hauptverzeichnis, die Sprachmodellen in Kurzform erklärt, worum es auf der Website geht und welche Seiten wichtig sind. Aufgebaut wie eine einfache Markdown-Datei: eine Überschrift mit dem Namen, ein Absatz Beschreibung, dann Listen mit Links und einer Zeile Erklärung je Link.

Ehrlich einordnen muss man: Ob und wie stark die großen Anbieter die Datei tatsächlich auswerten, ist nicht bestätigt; Google hat sich dazu zurückhaltend geäußert. Sie ersetzt weder gute Inhalte noch strukturierte Daten. Sie kostet aber wenig, schadet nicht und zwingt Sie zu etwas Nützlichem: in wenigen Sätzen aufzuschreiben, was Ihr Betrieb ist, für wen und wo. Diese Kurzfassung ist oft besser als das, was auf der Startseite steht.

llms.txt erstellen: Beispiel

So könnte die Datei für eine Zahnarztpraxis aussehen (Name und Adressen sind erfunden):

# Musterpraxis Dr. Beispiel

> Zahnarztpraxis in Leverkusen-Opladen. Schwerpunkte: Angstpatienten, Implantate, Prophylaxe. Termine online und telefonisch.

## Leistungen
- [Behandlung von Angstpatienten](https://www.beispiel-praxis.de/angstpatienten.html): Ablauf des ersten Termins, Sedierung, Kosten
- [Implantate](https://www.beispiel-praxis.de/implantate.html): Voraussetzungen, Dauer, Preisrahmen

## Praxis
- [Team und Öffnungszeiten](https://www.beispiel-praxis.de/praxis.html)
- [Anfahrt und Kontakt](https://www.beispiel-praxis.de/kontakt.html)

Speichern Sie die Datei als llms.txt im Hauptverzeichnis, sodass sie unter ihre-domain.de/llms.txt erreichbar ist. Bei WordPress geht das per FTP oder über ein Plugin, das Dateien im Stammverzeichnis anlegt; manche SEO-Plugins bringen inzwischen eine Funktion dafür mit. Halten Sie die Datei kurz, aktuell und frei von Werbesprache: Sie ist für Maschinen, nicht für Kunden.

Schema.org: Fakten für Maschinen

Strukturierte Daten nach Schema.org sind ein unsichtbarer Block im Quelltext (JSON-LD), der Maschinen die Fakten Ihrer Seite eindeutig mitteilt: Dies ist ein Betrieb vom Typ Zahnarztpraxis, mit dieser Adresse, diesen Öffnungszeiten, diesen Leistungen, dieser Person als Inhaber. Für KI-Systeme, die Quellen abgleichen, ist das wertvoll, weil sie die Angaben nicht aus dem Fließtext raten müssen.

Für einen lokalen Betrieb reichen wenige Typen: LocalBusiness (oder ein spezieller Untertyp wie Dentist, Attorney, RealEstateAgent) mit Adresse, Telefon, Öffnungszeiten und Einzugsgebiet; Service je Kernleistung; Person für Inhaber oder Behandler; FAQPage für Fragen und Antworten. Wichtig: Die strukturierten Daten müssen dem entsprechen, was sichtbar auf der Seite steht. Als Rich-Snippet zeigt Google FAQ-Auszeichnungen für die meisten Seiten nicht mehr an; als Lesehilfe für Maschinen bleibt die Auszeichnung sinnvoll.

Prüfen können Sie das mit dem Test für Rich-Suchergebnisse von Google oder dem Validator auf schema.org. Fehler dort bedeuten meist, dass ein Pflichtfeld fehlt oder ein Typ falsch gewählt ist.

Saubere Struktur: HTML, Ladezeit, Inhalte ohne Skripte

Der unspektakulärste Punkt ist oft der entscheidende. KI-Crawler lesen in der Regel das rohe HTML; was erst per JavaScript nachgeladen wird, sehen viele von ihnen nicht. Wenn Ihre Leistungen nur in einem Skript-gesteuerten Menü oder in einer Bildergalerie stehen, existieren sie für die KI nicht. Prüfen Sie: Sind die wichtigen Texte im Quelltext sichtbar, wenn Sie JavaScript abschalten?

Dazu kommen klare Überschriften (eine H1, dann H2 und H3 in sinnvoller Folge), Texte als Text und nicht als Bild, kurze Ladezeiten und eine Sitemap, die alle wichtigen Seiten enthält. Das sind dieselben Grundlagen wie für die normale Suche; wer sie hat, hat den größten Teil der technischen KI-Sichtbarkeit schon erledigt. Was darüber hinaus zu tun ist, steht auf der Leistungsseite KI-Sichtbarkeit.

ChatGPT, Perplexity, Gemini und Google sind Marken der jeweiligen Anbieter. Ich stehe mit keinem dieser Anbieter in einer Partnerschaft und habe keinen Einfluss darauf, was ihre Systeme antworten.

Häufige Fragen

Gut zu wissen.

Ihre Frage ist nicht dabei? Schreiben Sie mir einfach, ich antworte meist innerhalb von 24 Stunden.

Nein. Die Datei ist ein Vorschlag, dessen Nutzung durch die großen Anbieter nicht bestätigt ist. Sie schadet nicht und ist in einer Viertelstunde erstellt; Priorität haben aber lesbare Inhalte, korrekte Fakten und strukturierte Daten.

Das ist eine Abwägung. Wer die Such-Crawler (OAI-SearchBot, PerplexityBot) sperrt, wird in den Antworten dieser Systeme nicht mehr genannt. Wer nur das Training einschränken will, kann GPTBot und Google-Extended sperren und die Suche erlauben.

Bei einfachen Seiten ja: Es gibt Generatoren, die aus einem Formular den JSON-LD-Block erzeugen, den Sie in den Kopfbereich der Seite einfügen. Bei mehreren Leistungsseiten und Personen lohnt sich jemand, der das regelmäßig macht, weil Fehler sonst unbemerkt bleiben.

Rufen Sie den Quelltext der Seite auf (im Browser über „Seitenquelltext anzeigen“) und suchen Sie nach einem Satz aus Ihrer Leistungsbeschreibung. Steht er dort, ist er für Crawler lesbar. Fehlt er, wird er erst im Browser erzeugt, und viele KI-Crawler sehen ihn nicht.

Wissen, was die KI heute über Ihren Betrieb sagt?

Im kostenlosen Erstgespräch klären wir, wo Sie stehen. Danach bekommen Sie eine ehrliche Einschätzung und ein Festpreis-Angebot. Ohne Verpflichtung.

Erstgespräch buchen Anfrage schreiben
AnrufenErstgespräch buchen