9 ottobre 2026Edizione internazionale
Vol. I · No.
9 ottobre 2026
AI in Fashion
DAILY
Il briefing quotidiano sull’IA nel business della moda
Dove la moda incontra l’intelligenza artificiale.
Commerce & Marketing · In pratica

Gestire i crawler IA su un sito di moda: robots.txt, llms.txt e licenze

Una guida pratica per decidere quali crawler IA possono accedere a un sito di moda, che cosa può e che cosa non può fare robots.txt e dove si colloca llms.txt.

a close up of a network with wires connected to it
Foto: Albert Stoynov / Unsplash

IN SINTESI Sintesi della redazione

  1. OpenAI utilizza crawler distinti per la ricerca (OAI-SearchBot), l'addestramento dei modelli (GPTBot) e le richieste avviate dall'utente (ChatGPT-User), e ciascuno può essere gestito in modo indipendente.
  2. Google-Extended è un token di robots.txt che stabilisce se i contenuti sottoposti a crawling possono essere usati per l'addestramento e il grounding di Gemini, senza alcun effetto sull'inclusione in Google Search.
  3. Google afferma di non richiedere file llms.txt né altri file speciali per l'IA per includere una pagina in AI Overviews o in AI Mode.
  4. llms.txt è una proposta del settembre 2024 per un file Markdown che offre agli agenti IA una panoramica curata del sito, e non è uno standard formalmente ratificato.
  5. Web Bot Auth, basato su richieste HTTP firmate, offre ai gestori dei siti un modo per verificare che un bot sia davvero chi dichiara di essere, cosa che robots.txt da solo non può fare.

Quali crawler IA deve conoscere un sito di moda?

Un sito di moda riceve la visita di diversi tipi di agenti automatici, e la policy giusta dipende dalla finalità di ciascuno. I crawler di ricerca recuperano le pagine affinché un prodotto o un articolo possa essere citato in una risposta IA. I crawler di addestramento raccolgono contenuti che possono servire a costruire modelli. I fetcher attivati dall'utente caricano una pagina perché una persona ha posto una domanda a un assistente. Trattarli come un'unica categoria porta o a bloccare troppo, con la conseguenza di far sparire il marchio dalle risposte IA, o a gestire troppo poco, regalando contenuti a condizioni che l'azienda non ha mai scelto.

Tipi di crawler citati nella documentazione di OpenAI e Google
NomeOperatoreFinalità secondo la documentazioneControllato tramite
OAI-SearchBotOpenAIMostra i siti nelle funzioni di ricerca di ChatGPTrobots.txt, con circa 24 ore per entrare in vigore
GPTBotOpenAIRaccoglie contenuti che possono essere usati per addestrare i modellirobots.txt
ChatGPT-UserOpenAIRecupera le pagine quando un utente pone una domandaSecondo OpenAI, le regole di robots.txt potrebbero non applicarsi
GooglebotGoogleEsegue il crawling per Search, comprese le funzioni IArobots.txt, più i controlli sugli snippet
Google-ExtendedGoogleToken per l'uso nell'addestramento e nel grounding di GeminiToken di robots.txt, nessun effetto sull'inclusione in Search

I siti di moda hanno asset particolari in gioco. I contenuti editoriali, i lookbook e la fotografia di campagna hanno un valore creativo, le schede prodotto un valore commerciale e le recensioni dei clienti possono avere entrambi. Parti diverse di un sito possono giustificare regole diverse, dato che robots.txt lavora per percorso. Un retailer potrebbe consentire ai crawler di scoperta l'accesso alle pagine di prodotto e di categoria, adottando una linea più rigida per le directory delle immagini o per l'archivio editoriale, se l'azienda lo ritiene opportuno.

Come funziona robots.txt con i crawler IA?

Robots.txt è una convenzione volontaria: un file nella radice di un dominio che indica ai crawler conformi quali percorsi possono recuperare. OpenAI afferma che il disallow di GPTBot segnala che i contenuti non devono essere usati per l'addestramento, che i siti che escludono OAI-SearchBot non compariranno nelle risposte della ricerca di ChatGPT, anche se possono comunque apparire come link di navigazione, e che ogni impostazione è indipendente.

Esistono dei limiti. Le richieste avviate da un utente, come ChatGPT-User, possono non rispettare robots.txt, perché la visita è stata attivata da una persona. Robots.txt, inoltre, non può fermare uno scraper non conforme e non può dimostrare chi sia l'autore di una richiesta.

round white LED light
Leggi anche
Farsi trovare in ChatGPT shopping e negli assistenti di IA: che cosa possono controllare i marchi di moda

Che cosa fa e che cosa non fa Google-Extended?

Google descrive Google-Extended come un token di prodotto autonomo che gli editori possono usare per stabilire se i contenuti sottoposti a crawling da Google possano servire ad addestrare i futuri modelli Gemini e al grounding, ossia alla fornitura ai modelli dei contenuti dell'indice di Search al momento del prompt. Precisa che il token non influisce sull'inclusione di un sito in Google Search e non è un segnale di ranking. Non ha una stringa user agent separata, quindi il crawling continua ad avvenire tramite gli user agent di Google già esistenti.

Un'altra pagina chiarisce che le direttive robots.txt per Googlebot controllano il crawling per Search, comprese le funzioni IA, e che i controlli sugli snippet, come nosnippet e max-snippet, limitano ciò che viene mostrato. Bloccare Googlebot per tenere i contenuti fuori dalle funzioni IA li escluderebbe quindi anche da Search, cosa che raramente un retailer desidera.

Vale la pena aggiungere llms.txt?

La proposta llms.txt, pubblicata da Jeremy Howard di Answer.AI il 3 settembre 2024, descrive un file Markdown nella radice del sito con un titolo, un breve riepilogo e link curati a pagine più dettagliate. La pagina stessa della proposta la definisce aperta ai contributi della community e una panoramica informale, non uno standard ratificato. Indica che migliaia di siti pubblicano il file e che OpenAI, Anthropic e Gemini di Google ne pubblicano uno per la propria documentazione per sviluppatori.

Per un retailer di moda le prove di un beneficio sono scarse. Google afferma che, per comparire in AI Overviews o in AI Mode, un sito non ha bisogno di nuovi file leggibili dalle macchine, file di testo per l'IA o markup speciale. Nemmeno le linee guida pubblicate da OpenAI sui crawler menzionano il file. Una posizione ragionevole è che llms.txt costi poco e sia innocuo, ma non vada messo davanti all'accesso dei crawler, a dati di prodotto puliti e a pagine veloci e indicizzabili.

Come può un sito verificare che un bot sia autentico?

Poiché le stringhe user agent possono essere copiate, la verifica conta sempre di più man mano che gli agenti iniziano a effettuare ordini. Cloudflare documenta Web Bot Auth, un metodo in cui il bot firma le proprie richieste HTTP con una chiave privata e pubblica la chiave pubblica in una directory sul proprio dominio. Il sito, o la sua CDN, verifica la firma rispetto alla chiave registrata. Cloudflare raccomanda tempi di scadenza brevi per limitare i replay.

Il tema è di competenza dei team di sicurezza e di piattaforma. Per un retailer, il vantaggio è la possibilità di far passare gli agenti verificati trattando con sospetto gli script non verificati, cosa difficile da ottenere con il solo robots.txt e con gli elenchi di IP.

Il punto di partenza pratico è il logging. I log del server mostrano quali user agent richiedono quali percorsi, con quale frequenza e da dove. Confrontarli con i nomi dei crawler pubblicati permette di capire in fretta se i crawler documentati raggiungono il sito e se agenti sconosciuti stanno facendo scraping delle pagine prodotto. Queste evidenze alimentano anche la discussione sulla policy, perché le decisioni sono più semplici quando poggiano sul traffico osservato e non su ipotesi.

woman in black and white polka dot dress sitting on brown wooden chair
Leggi anche
Come verificare la visibilità del vostro brand di moda in ChatGPT, Gemini e Perplexity

Quali passi deve compiere un sito di moda, e in quale ordine?

  1. Elencare i crawler IA che si vogliono consentire per la scoperta, come OAI-SearchBot e Googlebot, e mettere per iscritto la policy insieme ai team legale e di brand.
  2. Decidere separatamente sull'accesso per l'addestramento, con le regole per GPTBot e Google-Extended.
  3. Verificare le regole di CDN e firewall, in modo che i crawler consentiti non vengano bloccati.
  4. Esaminare ogni mese i log di accesso alla ricerca di agenti sconosciuti e valutare la verifica della firma per quelli su cui si fa affidamento.
  5. Aggiungere llms.txt solo dopo aver sistemato le basi, mantenendolo breve e accurato.
  6. Quando contenuti come lookbook o fotografia editoriale hanno un valore in termini di licenza, coinvolgere un legale prima di decidere un accesso generalizzato.

La questione delle licenze merita una nota. Robots.txt esprime una preferenza e non è un contratto. I brand che vogliono essere pagati per l'uso a fini di addestramento, o che vogliono limitarlo per via contrattuale, hanno bisogno di condizioni d'uso e, se del caso, di una trattativa diretta, e la normativa varia da una giurisdizione all'altra.

Domande frequenti

Devo bloccare GPTBot sul mio sito di moda?

Dipende dal fatto che si voglia o meno che i propri contenuti siano usati per l'addestramento dei modelli. OpenAI afferma che il disallow di GPTBot segnala che i contenuti non devono essere usati per l'addestramento e che ciò è indipendente da OAI-SearchBot, che regola l'inclusione nella ricerca di ChatGPT.

Bloccare Google-Extended danneggia il mio posizionamento su Google?

Google afferma di no. Google-Extended è un token che controlla l'uso dei contenuti per l'addestramento e il grounding di Gemini e non influisce sull'inclusione in Google Search né funge da segnale di ranking.

Che cos'è llms.txt e mi serve?

È un file Markdown proposto per la radice del sito, che riassume il sito per gli agenti IA. Google afferma che per AI Overviews non servono file speciali per l'IA, quindi è facoltativo e secondario rispetto all'accesso dei crawler e ai dati di prodotto.

Robots.txt impedisce a ChatGPT di leggere la mia pagina?

Non sempre. OpenAI afferma che le richieste di ChatGPT-User sono avviate da persone e che quindi le regole di robots.txt potrebbero non applicarsi, mentre GPTBot e OAI-SearchBot si gestiscono tramite robots.txt.

GuidaLa guida completa all’IA nell’e-commerce, nel marketing e nel retail della modaLeggi la guida completa
Ricevi il Daily

Un'edizione ogni giorno feriale. Si legge in cinque minuti. Gratuita per i professionisti del settore.

Newsletter

Altro su Tecnologia

Vedi tutto