Was ist ein Transformer in der Mode?
Ein Transformer ist eine Architektur neuronaler Netze, die Sequenzen wie Text oder Bildausschnitte verarbeitet, indem sie mithilfe von Attention gewichtet, wie jeder Teil mit allen anderen zusammenhängt.
Kurz erklärt
Ein Transformer ist eine Art neuronales Netz, das Sequenzen versteht, indem es darauf achtet, wie alle ihre Teile miteinander zusammenhängen. Er ist die Architektur hinter den meisten grossen Sprachmodellen und vielen Bildmodellen und damit hinter den meisten generativen KI-Werkzeugen, die heute in der Mode eingesetzt werden.
Wie funktioniert das in der Praxis?
Text wird in Tokens zerlegt, Bilder lassen sich in kleine Ausschnitte aufteilen. Der Transformer wandelt jedes Token in Zahlen um und entscheidet mithilfe eines Mechanismus namens Attention, welche anderen Tokens dafür am relevantesten sind. Im Satz Die Jacke mit abnehmbarer Kapuze ist wasserdicht hilft Attention dem Modell, wasserdicht mit der Jacke und nicht mit der Kapuze zu verknüpfen.
Da Attention alle Tokens parallel verarbeitet, lassen sich Transformer effizient mit sehr grossen Datenmengen trainieren. Durch das Stapeln vieler Schichten lernt das Modell Grammatik, Fakten, Stil und visuelle Konzepte.
Warum ist das für Modeunternehmen wichtig?
Die meisten KI-Werkzeuge, die Modeunternehmen heute nutzen, basieren auf Transformern. Beispiele sind:
- Produkt-Content, also die Erstellung und Übersetzung von Texten für Webshops und B2B-Kataloge.
- Assistenten für Aussendienst, Kundenservice und Einkäufer.
- Bild-Tagging und visuelle Suche in grossen Kollektionen.
- Dokumentenverarbeitung für Bestellungen, Rechnungen und Lieferantenzertifikate.
Wer die Grundlagen versteht, kann besser einschätzen, was solche Werkzeuge leisten können und was nicht.
Wie nutzt KI das?
Der Transformer ist die Kernarchitektur grosser Sprachmodelle, von Vision Transformern und von multimodalen Modellen, die Text und Bilder verbinden. Einige Bildgeneratoren setzen Transformer auch ergänzend zu Diffusionsverfahren ein. Weiterentwicklungen zielen auf Effizienz, längere Kontextfenster und geringere Betriebskosten.
Typische Stolperfallen
- Verständnis unterstellen. Transformer sagen wahrscheinliche Ausgaben voraus und können selbstbewusst Fehler produzieren.
- Kontextgrenzen. Sehr lange Dokumente oder Kataloge passen möglicherweise nicht in das Kontextfenster des Modells.
- Kosten. Grosse Modelle sind im grossen Massstab teuer im Betrieb, für Routineaufgaben genügen oft kleinere Modelle.
Häufige Fragen
Ist ein Transformer dasselbe wie ein grosses Sprachmodell?
Nein. Der Transformer ist die Architektur, also der Bauplan des Netzes. Ein grosses Sprachmodell ist ein konkretes Modell, das mit dieser Architektur gebaut und mit grossen Textmengen trainiert wurde.
Müssen Modeunternehmen eigene Transformer-Modelle entwickeln?
Selten. Die meisten nutzen bestehende Foundation Models über Software oder APIs und passen sie mit eigenen Daten durch Prompting, Retrieval oder Fine-Tuning an.

