Gérer les crawlers d'IA sur un site de mode : robots.txt, llms.txt et licences
Guide pratique pour décider quels crawlers d'IA peuvent accéder à un site de mode, ce que robots.txt peut et ne peut pas faire, et la place de llms.txt.

L'ESSENTIEL Résumé de la rédaction
- OpenAI exploite des crawlers distincts pour la recherche (OAI-SearchBot), l'entraînement des modèles (GPTBot) et les requêtes déclenchées par l'utilisateur (ChatGPT-User), et chacun peut être géré séparément.
- Google-Extended est un jeton robots.txt qui détermine si les contenus explorés peuvent servir à l'entraînement et au grounding de Gemini, sans effet sur l'inclusion dans Google Search.
- Google indique qu'aucun fichier llms.txt ni autre fichier IA spécifique n'est nécessaire pour qu'une page figure dans les AI Overviews ou en mode IA.
- llms.txt est une proposition de septembre 2024 pour un fichier Markdown qui offre aux agents d'IA un aperçu structuré du site ; ce n'est pas un standard formellement ratifié.
- Web Bot Auth, fondé sur des requêtes HTTP signées, permet aux propriétaires de sites de vérifier qu'un bot est bien celui qu'il prétend être, ce que robots.txt seul ne permet pas.
Quels crawlers d'IA un site de mode doit-il connaître ?
Un site de mode reçoit la visite de plusieurs types d'agents automatisés, et la bonne politique dépend de la finalité de chacun. Les crawlers de recherche récupèrent des pages afin qu'un produit ou un article puisse être cité dans une réponse d'IA. Les crawlers d'entraînement collectent des contenus susceptibles de servir à construire des modèles. Les récupérations déclenchées par l'utilisateur chargent une page parce qu'une personne a interrogé un assistant à son sujet. Les traiter comme un tout conduit soit à un blocage excessif, qui retire la marque des réponses d'IA, soit à une gestion insuffisante, qui cède des contenus à des conditions que l'entreprise n'a jamais choisies.
| Nom | Opérateur | Finalité selon la documentation | Contrôlé par |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Fait apparaître les sites dans les fonctions de recherche de ChatGPT | robots.txt, avec un délai d'environ 24 heures avant prise en compte |
| GPTBot | OpenAI | Collecte des contenus pouvant servir à entraîner des modèles | robots.txt |
| ChatGPT-User | OpenAI | Récupère des pages lorsqu'un utilisateur pose une question | OpenAI indique que les règles robots.txt peuvent ne pas s'appliquer |
| Googlebot | Explore pour Search, y compris les fonctions d'IA | robots.txt, ainsi que les contrôles d'extraits | |
| Google-Extended | Jeton pour l'entraînement et le grounding de Gemini | Jeton robots.txt, sans effet sur l'inclusion dans Search |
Les sites de mode ont des actifs bien particuliers en jeu. Les contenus éditoriaux, les lookbooks et les photos de campagne ont une valeur créative, les fiches produit une valeur commerciale, et les avis clients peuvent avoir les deux. Différentes parties d'un site peuvent justifier des règles différentes, puisque robots.txt fonctionne par chemin. Un distributeur peut autoriser les crawlers de découverte sur les pages produit et catégorie tout en adoptant une ligne plus stricte pour les répertoires d'images ou les archives éditoriales, si l'entreprise le juge judicieux.
Comment robots.txt fonctionne-t-il pour les crawlers d'IA ?
Robots.txt est une convention volontaire : un fichier placé à la racine d'un domaine qui indique aux crawlers respectueux les chemins qu'ils peuvent explorer. OpenAI indique que l'interdiction de GPTBot signale que les contenus ne doivent pas servir à l'entraînement, que les sites qui refusent OAI-SearchBot n'apparaîtront pas dans les réponses de recherche de ChatGPT, même s'ils peuvent encore s'afficher sous forme de liens de navigation, et que chaque réglage est indépendant.
Il y a des limites. Les requêtes déclenchées par un utilisateur, comme ChatGPT-User, peuvent ne pas respecter robots.txt, car c'est une personne qui a initié la visite. Robots.txt ne peut pas non plus arrêter un scraper non conforme, ni prouver l'identité de l'auteur d'une requête.

Que fait et que ne fait pas Google-Extended ?
Google décrit Google-Extended comme un jeton de produit autonome que les éditeurs peuvent utiliser pour déterminer si les contenus explorés par Google peuvent servir à entraîner les futurs modèles Gemini et au grounding, c'est-à-dire lorsque des contenus de l'index Search sont fournis aux modèles au moment de la requête. Google précise que ce jeton n'affecte pas l'inclusion d'un site dans Google Search et ne constitue pas un signal de classement. Il n'a pas de chaîne user agent propre : l'exploration passe donc toujours par les user agents Google existants.
Une autre page précise que les directives robots.txt de Googlebot régissent l'exploration pour Search, y compris les fonctions d'IA, et que les contrôles d'extraits comme nosnippet et max-snippet limitent ce qui est affiché. Bloquer Googlebot pour tenir des contenus à l'écart des fonctions d'IA les retirerait donc aussi de Search, ce qu'un distributeur souhaite rarement.
Faut-il ajouter un fichier llms.txt ?
La proposition llms.txt, publiée par Jeremy Howard d'Answer.AI le 3 septembre 2024, décrit un fichier Markdown à la racine du site comportant un titre, un bref résumé et des liens choisis vers des pages plus détaillées. La page de la proposition la présente comme ouverte aux contributions de la communauté et comme un aperçu informel, non comme un standard ratifié. Elle indique que des milliers de sites publient ce fichier et qu'OpenAI, Anthropic et Gemini de Google en publient un pour leur documentation développeur.
Pour un distributeur de mode, les preuves d'un bénéfice sont minces. Google indique que, pour apparaître dans les AI Overviews ou en mode IA, un site n'a besoin ni de nouveaux fichiers lisibles par machine, ni de fichiers texte pour l'IA, ni de balisage spécifique. Les consignes publiées par OpenAI sur ses crawlers ne mentionnent pas non plus ce fichier. On peut raisonnablement considérer que llms.txt est peu coûteux à produire et sans danger, mais qu'il ne doit pas passer avant l'accès des crawlers, des données produit propres et des pages rapides et indexables.
Comment un site peut-il vérifier qu'un bot est authentique ?
Les chaînes user agent pouvant être copiées, la vérification prend de l'importance à mesure que les agents commencent à passer des commandes. Cloudflare documente Web Bot Auth, une méthode dans laquelle un bot signe ses requêtes HTTP avec une clé privée et publie la clé publique dans un répertoire de son propre domaine. Le site, ou son CDN, vérifie la signature à l'aide de la clé enregistrée. Cloudflare recommande des durées d'expiration courtes pour limiter le rejeu.
Ce sujet relève des équipes sécurité et plateforme. Pour un distributeur, l'avantage est de pouvoir laisser passer les agents vérifiés tout en traitant avec méfiance les scripts non vérifiés, ce qui est difficile avec robots.txt et des listes d'adresses IP seuls.
Les journaux constituent le point de départ pratique. Les logs serveur montrent quels user agents demandent quels chemins, à quelle fréquence et depuis où. Leur comparaison avec les noms de crawlers publiés permet de voir rapidement si les crawlers documentés atteignent le site et si des agents inconnus aspirent les pages produit. Ces éléments nourrissent aussi la discussion sur la politique à adopter, car les décisions sont plus simples lorsqu'elles reposent sur le trafic observé et non sur des hypothèses.

Quelles mesures un site de mode doit-il prendre, et dans quel ordre ?
- Dressez la liste des crawlers d'IA que vous souhaitez autoriser pour la découverte, comme OAI-SearchBot et Googlebot, et consignez cette politique par écrit avec les équipes juridique et marque.
- Décidez séparément de l'accès pour l'entraînement, avec des règles pour GPTBot et Google-Extended.
- Vérifiez les règles du CDN et du pare-feu afin que les crawlers autorisés ne soient pas bloqués.
- Examinez chaque mois les journaux d'accès à la recherche d'agents inconnus et envisagez une vérification par signature pour ceux sur lesquels vous vous appuyez.
- N'ajoutez llms.txt qu'une fois les bases en place, et gardez-le court et exact.
- Lorsque des contenus tels que des lookbooks ou des photos éditoriales ont une valeur de licence, associez un conseil juridique avant de décider d'un accès général.
La question des licences mérite une remarque. Robots.txt exprime une préférence, pas un contrat. Les marques qui veulent être rémunérées pour l'usage à des fins d'entraînement, ou le restreindre par contrat, ont besoin de conditions d'utilisation et, le cas échéant, d'une négociation directe, et le droit varie selon les juridictions.
Questions fréquentes
Dois-je bloquer GPTBot sur mon site de mode ?
Cela dépend de votre volonté de voir vos contenus servir à l'entraînement de modèles. OpenAI indique que l'interdiction de GPTBot signale que les contenus ne doivent pas être utilisés pour l'entraînement, et que ce réglage est indépendant d'OAI-SearchBot, qui régit l'inclusion dans la recherche ChatGPT.
Bloquer Google-Extended nuit-il à mon classement Google ?
Google indique que non. Google-Extended est un jeton qui contrôle l'usage des contenus pour l'entraînement et le grounding de Gemini ; il n'affecte pas l'inclusion dans Google Search et n'est pas un signal de classement.
Qu'est-ce que llms.txt et en ai-je besoin ?
Il s'agit d'un fichier Markdown proposé, placé à la racine du site, qui résume un site pour les agents d'IA. Google indique qu'aucun fichier IA spécifique n'est nécessaire pour les AI Overviews ; il est donc facultatif et secondaire par rapport à l'accès des crawlers et aux données produit.
Robots.txt empêche-t-il ChatGPT de lire ma page ?
Pas toujours. OpenAI indique que les requêtes de ChatGPT-User sont initiées par des personnes, de sorte que les règles robots.txt peuvent ne pas s'appliquer, alors que GPTBot et OAI-SearchBot sont gérés via robots.txt.
Une édition chaque jour ouvrable. Lue en cinq minutes. Gratuite pour les professionnels.




