9. Oktober 2026Internationale Ausgabe
Vol. I · No.
9. Oktober 2026
AI in Fashion
DAILY
Das tägliche Briefing zu KI im Modebusiness
Wo Mode auf künstliche Intelligenz trifft.
Commerce & Marketing · Praxis

KI-Crawler auf einer Modewebsite steuern: robots.txt, llms.txt und Lizenzierung

Ein praktischer Leitfaden dazu, welche KI-Crawler eine Modewebsite abrufen dürfen, was robots.txt leisten kann und was nicht, und wo llms.txt einzuordnen ist.

a close up of a network with wires connected to it
Foto: Albert Stoynov / Unsplash

DAS WICHTIGSTE Zusammenfassung der Redaktion

  1. OpenAI betreibt getrennte Crawler für die Suche (OAI-SearchBot), das Modelltraining (GPTBot) und nutzerausgelöste Abrufe (ChatGPT-User), und jeder lässt sich unabhängig steuern.
  2. Google-Extended ist ein robots.txt-Token, das regelt, ob gecrawlte Inhalte für das Training und das Grounding von Gemini verwendet werden dürfen, und es hat keinen Einfluss auf die Aufnahme in die Google-Suche.
  3. Laut Google braucht es weder llms.txt noch andere spezielle KI-Dateien, damit eine Seite in AI Overviews oder im AI Mode berücksichtigt wird.
  4. llms.txt ist ein Vorschlag vom September 2024 für eine Markdown-Datei, die KI-Agenten einen kuratierten Überblick über eine Website gibt, und kein formell verabschiedeter Standard.
  5. Web Bot Auth, das auf signierten HTTP-Anfragen beruht, gibt Website-Betreibern die Möglichkeit zu prüfen, ob ein Bot der ist, der er vorgibt zu sein, was robots.txt allein nicht leisten kann.

Welche KI-Crawler sollte eine Modewebsite kennen?

Eine Modewebsite wird von mehreren Arten automatisierter Agenten besucht, und die richtige Richtlinie hängt vom Zweck des jeweiligen Agenten ab. Such-Crawler rufen Seiten ab, damit ein Produkt oder ein Artikel in einer KI-Antwort zitiert werden kann. Trainings-Crawler sammeln Inhalte, die zum Aufbau von Modellen verwendet werden können. Nutzerausgelöste Abrufe laden eine Seite, weil eine Person einen Assistenten danach gefragt hat. Wer diese Typen gleich behandelt, riskiert entweder zu starkes Blockieren, wodurch die Marke aus KI-Antworten verschwindet, oder zu schwache Steuerung, wodurch Inhalte zu Bedingungen weitergegeben werden, die das Unternehmen nie gewählt hat.

In der Dokumentation von OpenAI und Google genannte Crawler-Typen
NameBetreiberZweck laut DokumentationGesteuert über
OAI-SearchBotOpenAIBringt Websites in den Suchfunktionen von ChatGPT zur Anzeigerobots.txt, Wirksamkeit nach etwa 24 Stunden
GPTBotOpenAISammelt Inhalte, die zum Training von Modellen verwendet werden könnenrobots.txt
ChatGPT-UserOpenAIRuft Seiten ab, wenn ein Nutzer eine Frage stelltLaut OpenAI gelten robots.txt-Regeln hier möglicherweise nicht
GooglebotGoogleCrawlt für die Suche, einschliesslich KI-Funktionenrobots.txt sowie Snippet-Steuerung
Google-ExtendedGoogleToken für die Nutzung für Gemini-Training und Groundingrobots.txt-Token, kein Einfluss auf die Aufnahme in die Suche

Auf Modewebsites stehen besondere Werte auf dem Spiel. Redaktionelle Inhalte, Lookbooks und Kampagnenfotografie haben kreativen Wert, Produktseiten haben kommerziellen Wert, und Kundenbewertungen können beides haben. Unterschiedliche Bereiche einer Website können unterschiedliche Regeln rechtfertigen, da robots.txt pfadbasiert funktioniert. Ein Händler könnte Discovery-Crawler auf Produkt- und Kategorieseiten zulassen, bei Bildverzeichnissen oder archivierten redaktionellen Inhalten aber eine strengere Linie fahren, sofern das Unternehmen dies für sinnvoll hält.

Wie funktioniert robots.txt bei KI-Crawlern?

Robots.txt ist eine freiwillige Konvention: eine Datei im Stammverzeichnis einer Domain, die konformen Crawlern mitteilt, welche Pfade sie abrufen dürfen. OpenAI erklärt, dass ein Disallow für GPTBot signalisiert, dass Inhalte nicht für das Training verwendet werden sollen, dass Websites, die OAI-SearchBot ausschliessen, nicht in den Suchantworten von ChatGPT erscheinen, wohl aber weiterhin als Navigationslinks angezeigt werden können, und dass jede Einstellung unabhängig ist.

Es gibt Grenzen. Abrufe, die ein Nutzer auslöst, etwa durch ChatGPT-User, befolgen robots.txt möglicherweise nicht, weil eine Person den Besuch veranlasst hat. Robots.txt kann zudem keinen nicht konformen Scraper aufhalten und nicht belegen, wer eine Anfrage stellt.

round white LED light
Lesen Sie auch
In ChatGPT Shopping und KI-Assistenten gefunden werden: Was Modemarken steuern können

Was bewirkt Google-Extended und was nicht?

Google beschreibt Google-Extended als eigenständiges Produkt-Token, mit dem Publisher steuern können, ob von Google gecrawlte Inhalte zum Training künftiger Gemini-Modelle und für das Grounding verwendet werden dürfen, bei dem Inhalte des Suchindex den Modellen zum Zeitpunkt der Anfrage zugeführt werden. Google erklärt, das Token wirke sich nicht auf die Aufnahme einer Website in die Google-Suche aus und sei kein Rankingsignal. Es hat keinen eigenen User-Agent-String, das Crawling erfolgt also weiterhin über die bestehenden Google-User-Agents.

Eine separate Seite hält fest, dass die robots.txt-Direktiven für Googlebot das Crawling für die Suche steuern, einschliesslich KI-Funktionen, und dass Snippet-Steuerungen wie nosnippet und max-snippet begrenzen, was angezeigt wird. Wer Googlebot blockiert, um Inhalte aus KI-Funktionen herauszuhalten, entfernt sie deshalb auch aus der Suche, was ein Händler selten will.

Lohnt sich llms.txt?

Der llms.txt-Vorschlag, den Jeremy Howard von Answer.AI am 3. September 2024 veröffentlicht hat, beschreibt eine Markdown-Datei im Stammverzeichnis der Website mit einem Titel, einer kurzen Zusammenfassung und kuratierten Links zu detaillierteren Seiten. Die Seite des Vorschlags selbst bezeichnet ihn als offen für Beiträge der Community und als informellen Überblick, nicht als verabschiedeten Standard. Sie gibt an, dass Tausende Websites die Datei veröffentlichen und dass OpenAI, Anthropic und Googles Gemini jeweils eine für ihre Entwicklerdokumentation bereitstellen.

Für einen Modehändler ist der Nutzen kaum belegt. Google erklärt, dass eine Website für die Anzeige in AI Overviews oder im AI Mode keine neuen maschinenlesbaren Dateien, KI-Textdateien oder spezielle Auszeichnungen benötigt. Auch die veröffentlichten Crawler-Hinweise von OpenAI erwähnen die Datei nicht. Eine vernünftige Sichtweise lautet: llms.txt ist günstig zu erstellen und unschädlich, sollte aber nicht vor Crawl-Zugang, sauberen Produktdaten und schnellen, indexierbaren Seiten priorisiert werden.

Wie lässt sich prüfen, ob ein Bot echt ist?

Da User-Agent-Strings kopiert werden können, gewinnt die Verifizierung an Bedeutung, sobald Agenten beginnen, Bestellungen aufzugeben. Cloudflare dokumentiert Web Bot Auth, ein Verfahren, bei dem ein Bot seine HTTP-Anfragen mit einem privaten Schlüssel signiert und den öffentlichen Schlüssel in einem Verzeichnis auf seiner eigenen Domain veröffentlicht. Die Website oder ihr CDN prüft die Signatur anhand des registrierten Schlüssels. Cloudflare empfiehlt kurze Ablaufzeiten, um Replay-Angriffe einzugrenzen.

Das ist Sache der Sicherheits- und Plattformteams. Für einen Händler liegt der Nutzen darin, verifizierte Agenten durchzulassen und nicht verifizierten Skripten mit Misstrauen zu begegnen, was mit robots.txt und IP-Listen allein schwer zu leisten ist.

Praktischer Ausgangspunkt ist das Logging. Server-Logs zeigen, welche User-Agents welche Pfade abrufen, wie oft und von wo. Der Abgleich mit den veröffentlichten Crawler-Namen zeigt rasch, ob die dokumentierten Crawler die Website erreichen und ob unbekannte Agenten Produktseiten scrapen. Diese Belege fliessen auch in die Diskussion über die Richtlinie ein, denn Entscheide fallen leichter, wenn sie auf beobachtetem Traffic statt auf Annahmen beruhen.

woman in black and white polka dot dress sitting on brown wooden chair
Lesen Sie auch
So prüfen Sie die Sichtbarkeit Ihrer Modemarke in ChatGPT, Gemini und Perplexity

Welche Schritte sollte eine Modewebsite in welcher Reihenfolge unternehmen?

  1. Die KI-Crawler festlegen, die für die Discovery zugelassen werden sollen, etwa OAI-SearchBot und Googlebot, und diese Richtlinie gemeinsam mit Recht und Marke schriftlich festhalten.
  2. Den Trainingszugang separat entscheiden, mit Regeln für GPTBot und Google-Extended.
  3. CDN- und Firewall-Regeln prüfen, damit zugelassene Crawler nicht blockiert werden.
  4. Zugriffs-Logs monatlich auf unbekannte Agenten durchsehen und für die Agenten, auf die man sich stützt, eine Signaturprüfung erwägen.
  5. llms.txt erst ergänzen, wenn die Grundlagen stehen, und die Datei kurz und korrekt halten.
  6. Bei Inhalten mit Lizenzwert, etwa Lookbooks oder redaktioneller Fotografie, vor einer Entscheidung für pauschalen Zugang Rechtsberatung beiziehen.

Die Lizenzierung verdient eine Anmerkung. Robots.txt drückt eine Präferenz aus und ist kein Vertrag. Marken, die für die Nutzung zu Trainingszwecken bezahlt werden oder sie vertraglich einschränken wollen, brauchen Nutzungsbedingungen und gegebenenfalls direkte Verhandlungen, und die Rechtslage unterscheidet sich je nach Rechtsordnung.

Häufige Fragen

Soll ich GPTBot auf meiner Modewebsite blockieren?

Das hängt davon ab, ob Sie Ihre Inhalte für das Modelltraining verwendet sehen möchten. OpenAI erklärt, dass ein Disallow für GPTBot signalisiert, dass Inhalte nicht für das Training verwendet werden sollen, und dass dies unabhängig von OAI-SearchBot ist, der die Aufnahme in die ChatGPT-Suche regelt.

Schadet das Blockieren von Google-Extended meinem Google-Ranking?

Laut Google nicht. Google-Extended ist ein Token, das die Nutzung von Inhalten für Gemini-Training und Grounding steuert, und es beeinflusst weder die Aufnahme in die Google-Suche noch dient es als Rankingsignal.

Was ist llms.txt, und brauche ich sie?

Es handelt sich um eine vorgeschlagene Markdown-Datei im Stammverzeichnis, die eine Website für KI-Agenten zusammenfasst. Laut Google sind für AI Overviews keine speziellen KI-Dateien nötig, sie ist also optional und gegenüber Crawl-Zugang und Produktdaten zweitrangig.

Hindert robots.txt ChatGPT daran, meine Seite zu lesen?

Nicht immer. OpenAI erklärt, dass Abrufe durch ChatGPT-User von Personen ausgelöst werden und robots.txt-Regeln daher möglicherweise nicht gelten, während GPTBot und OAI-SearchBot über robots.txt gesteuert werden.

LeitfadenDer umfassende Leitfaden zu KI in Mode-E-Commerce, Marketing und RetailDen ganzen Leitfaden lesen
Daily abonnieren

Eine Ausgabe an jedem Werktag. In fünf Minuten gelesen. Kostenlos für Branchenprofis.

Newsletter

Mehr zu Technologie

Alle anzeigen