7. Oktober 2026Internationale Ausgabe
Vol. I · No.
7. Oktober 2026
AI in Fashion
DAILY
Das tägliche Briefing zu KI im Modebusiness
Wo Mode auf künstliche Intelligenz trifft.
Glossar

Was ist Retrieval-Evaluierung in der Mode?

Die Retrieval-Evaluierung misst, wie gut ein Such- oder RAG-System zu einer Frage die richtigen Dokumente oder Produkte findet, bevor ein KI-Modell eine Antwort erzeugt.

Kurz erklärt

Retrieval-Evaluierung bedeutet, systematisch zu testen, ob eine Suchkomponente zu einer Anfrage die richtigen Inhalte liefert. In der Mode-KI prüft sie zum Beispiel, ob ein Assistent, der die Frage eines Einkäufers zu Lieferbedingungen beantwortet, tatsächlich die richtige Vertragsklausel oder den richtigen Produktdatensatz abruft, bevor er eine Antwort formuliert.

Wie funktioniert das in der Praxis?

Ein Team erstellt ein Testset mit realistischen Fragen und markiert, welche Dokumente, Produkte oder Textstellen die korrekten Antworten sind. Das Retrieval-System verarbeitet jede Anfrage, und die Ergebnisse werden mit den erwarteten verglichen. Gängige Kennzahlen erfassen, ob ein korrekter Treffer unter den ersten Ergebnissen erscheint, wie weit oben er steht und wie viele irrelevante Treffer beigemischt sind.

Beispielhafte Testfälle für ein Modeunternehmen könnten sein:

  • Welche Jacken der Herbstkollektion verwenden recyceltes Polyester? mit den erwarteten Artikelnummern.
  • Wie hoch ist die Mindestbestellmenge für Neukunden in Italien? mit dem erwarteten Abschnitt der Richtlinie.
  • Pflegehinweise für den Strick aus Wollmischung mit dem erwarteten Text des Pflegeetiketts.

Warum ist das für Modeunternehmen wichtig?

Interne Assistenten für Vertrieb, Kundenservice oder Produktteams scheitern oft unbemerkt. Sie liefern flüssige Antworten, die auf der Preisliste der falschen Saison oder auf einem ähnlichen, aber anderen Style beruhen. Die Retrieval-Evaluierung zeigt, wo die Suche versagt, sodass Teams Daten, Chunking oder Ranking verbessern können, statt endlos Prompts umzuschreiben.

Wie nutzt KI das?

Die Retrieval-Evaluierung gehört zum Aufbau jeder RAG-Anwendung. Sprachmodelle können zudem helfen, indem sie aus Produktdaten mögliche Testfragen erzeugen oder beurteilen, ob abgerufene Textstellen relevant sind. Solche automatisierten Urteile sollten jedoch stichprobenartig von Personen geprüft werden, die das Sortiment kennen.

Typische Stolperfallen

  • Zu wenige Testanfragen. Eine Handvoll Beispiele bildet nicht ab, wie Einkäufer und Mitarbeitende tatsächlich fragen.
  • Saisonalität ignorieren. Testsets müssen aktualisiert werden, wenn sich Kollektionen, Preise und Richtlinien ändern.
  • Nur die Endantwort testen. Ohne separate Messung des Retrievals bleibt die eigentliche Fehlerursache verborgen.

Häufige Fragen

Was ist der Unterschied zwischen Retrieval-Evaluierung und LLM-Evaluierung?

Die Retrieval-Evaluierung prüft, ob die richtigen Informationen gefunden wurden. Die LLM-Evaluierung prüft, ob das Modell diese Informationen genutzt hat, um eine korrekte, nützliche und sichere Antwort zu erzeugen.

Wie viele Testfragen sind nötig?

Eine feste Zahl gibt es nicht. Das Set sollte aber die wichtigsten Fragetypen, Produktkategorien und Sprachen abdecken, mit denen das System konfrontiert wird. Viele Teams starten klein und erweitern das Set anhand echter Nutzeranfragen und gemeldeter Fehler.

Alle Begriffe