Ist KI in der Mode voreingenommen? Grössen, Hauttöne und Fairness erklärt
Von virtuellen Models bis zu Grössenempfehlungen kann KI in der Mode enge Schönheitsnormen reproduzieren. Woher Verzerrungen kommen, was die Forschung zeigt und wie Marken ihre Systeme testen können.
DAS WICHTIGSTE Zusammenfassung der Redaktion
- Verzerrungen in der Mode-KI entstehen, wenn Trainingsdaten, Designentscheidungen oder Evaluierungen bestimmte Körpergrössen, Hauttöne, Altersgruppen oder Geschlechter unterrepräsentieren, was für diese Kundinnen und Kunden zu schlechteren Ergebnissen führt.
- Die Studie Gender Shades von 2018 ergab, dass kommerzielle Systeme zur Gesichtsanalyse bei Frauen mit dunkler Haut am schlechtesten abschnitten, mit einer Genauigkeit von nur 65,3 Prozent gegenüber 99,7 Prozent bei Männern mit heller Haut in einem der Systeme.
- Eine 2025 auf der NAACL vorgestellte Studie analysierte 4000 von DALL-E 3 generierte Bilder, um Vorurteile gegen dicke und zugunsten dünner Körper in KI-generierten Bildern zu untersuchen.
- Werkzeuge wie die Monk Skin Tone Scale von Google mit zehn Abstufungen helfen Teams zu prüfen, ob Bildsysteme über alle Hauttöne hinweg funktionieren.
- Der Digital Omnibus zur KI hat den EU AI Act um Artikel 4a ergänzt, der die Verarbeitung sensibler personenbezogener Daten erlaubt, soweit dies zur Erkennung und Korrektur von Verzerrungen unbedingt erforderlich ist, unter Schutzvorkehrungen.
KI in der Mode kann voreingenommen sein, und das Risiko ist dort am grössten, wo niemand darauf testet. Wenn Trainingsdaten und Designentscheidungen auf ein enges Spektrum an Körpergrössen, helle Hauttöne oder bestimmte Altersgruppen ausgerichtet sind, funktionieren KI-generierte Bilder, Virtual Try-on, Grössenempfehlungen und Suche für alle anderen schlechter. Verzerrungen sind nicht unvermeidlich, doch ihre Verringerung erfordert gezielte Datenerhebung, Tests und menschliche Prüfung.
Woher kommen Verzerrungen in der Mode-KI?
- Trainingsdaten: Modebilder zeigten historisch ein enges Spektrum an Körpern und Hauttönen, und Modelle lernen diese Muster.
- Produktdaten: Werden erweiterte Grössen seltener fotografiert oder weniger vollständig beschrieben, hat die KI weniger, woraus sie lernen kann.
- Kundendaten: Empfehlungs- und Passformmodelle lernen aus früheren Käufen und Retouren, die widerspiegeln, was wem angeboten wurde.
- Designentscheidungen: Das Spektrum an Körpertypen, das ein Tool für virtuelle Models oder ein Avatar-Baukasten anbietet, setzt von Anfang an Grenzen.
- Evaluierung: Wird ein System vor allem an Durchschnittsfällen getestet, bleiben Fehler bei anderen Gruppen unbemerkt.
Was zeigt die Forschung über Verzerrungen in Bild-KI?
Die bekanntesten Belege stammen aus der Gesichtsanalyse. Die 2018 veröffentlichte Studie Gender Shades von Joy Buolamwini und Timnit Gebru untersuchte Systeme zur Geschlechtsklassifizierung von IBM, Microsoft und Face++ anhand von 1270 Bildern. Alle drei schnitten bei Personen mit heller Haut besser ab als bei Personen mit dunkler Haut und am schlechtesten bei Frauen mit dunkler Haut. Im System von IBM lag die Genauigkeit bei Männern mit heller Haut bei 99,7 Prozent und bei Frauen mit dunkler Haut bei 65,3 Prozent. Die Autorinnen folgerten, dass Inklusion Absicht erfordert.
Generative KI wirft ähnliche Fragen zur Körpergrösse auf. Ein 2025 in den Findings of NAACL vorgestellter Fachartikel, Decoding Fatphobia, untersuchte Vorurteile gegen dicke und zugunsten dünner Körper in Bildern, die von DALL-E 3 generiert wurden. Dafür wurden 4000 Bilder aus gegensätzlichen Prompts erzeugt und manuell nach Körpergewicht codiert. Die Autoren halten fest, dass KI-generierte Bilder dazu neigen, gesellschaftliche Vorurteile zu verstärken. In der Mode, wo generierte Models und Kampagnenbilder immer häufiger werden, sind solche Muster kommerziell ebenso relevant wie ethisch.
Welche KI-Anwendungen in der Mode sind am anfälligsten für Verzerrungen?
| Anwendung | Mögliche Verzerrung | Wie man testet |
|---|---|---|
| KI-generierte Models und Bilder | Standardmässig schlanke, junge Figuren mit heller Haut | Stichproben der Ergebnisse über verschiedene Prompts nach Grösse, Alter und Hautton prüfen |
| Virtual Try-on | Schlechtere Darstellung der Kleidung an grösseren Körpern oder auf dunkler Haut | Qualitätsbewertungen über Körpertypen und Hauttöne hinweg vergleichen |
| Grössen- und Passformempfehlungen | Weniger genau bei erweiterten Grössen mit weniger Daten | Retouren- und Umtauschquoten nach Grössengruppe messen |
| Visuelle Suche und Verschlagwortung | Falsche Zuordnung hauttonbezogener Farben oder von Stilen aus manchen Kulturen | Fehlerquoten anhand vielfältiger Testbilder prüfen |
| Empfehlungen | Erweiterte Grössen oder bestimmte Stile werden nur manchen Kunden angezeigt | Sichtbarkeit von Produktlinien über Kundengruppen hinweg analysieren |
Warum sind Verzerrungen bei Grössen kommerziell relevant?
Verzerrung ist nicht nur eine ethische Frage. Ist eine Grössenempfehlung für manche Kundinnen und Kunden weniger genau, erhalten sie mit grösserer Wahrscheinlichkeit Artikel, die nicht passen, was Retouren und Umsatzverluste verursacht. Zeigen KI-generierte Produktbilder Kleidung nur an einem Körpertyp, haben Kundinnen und Kunden anderer Grössen weniger Informationen, um Passform und Fall zu beurteilen. Lernen Such- oder Empfehlungssysteme aus vergangenen Verkäufen, werden Sortimente, die zu knapp bestückt oder schlecht präsentiert waren, womöglich noch seltener angezeigt, was das Problem verstärkt.
Diese Effekte sind messbar. Ein Vergleich von Retourenquoten, Conversion und Kundenbeschwerden über Grössengruppen und Regionen hinweg kann zeigen, wo KI-Tools ungleichmässig funktionieren. Eine solche Analyse sollte Teil jeder Evaluierung sein, zusätzlich zu den von Anbietern gelieferten Gesamtgenauigkeiten.
Kann KI die Mode inklusiver machen?
KI kann auch genutzt werden, um mehr Vielfalt zu zeigen. Im April 2023 kündigte Levi's an, gemeinsam mit dem niederländischen Digital-Fashion-Unternehmen Lalaland.ai KI-generierte Models mit unterschiedlichen Körpertypen, Altersgruppen und Hauttönen zu testen. Nach Kritik, der Plan laufe auf künstliche Vielfalt hinaus, stellte Levi's klar, dass es sich um ein Experiment handle und KI menschliche Models im Unternehmen wahrscheinlich nie vollständig ersetzen werde. Die Episode zeigt, dass Inklusion durch KI als Abkürzung wahrgenommen werden kann, wenn sie echte Repräsentation ersetzt statt sie zu unterstützen.
Messinstrumente helfen. Im Mai 2022 veröffentlichte Google die Monk Skin Tone Scale, eine Skala mit zehn Abstufungen, die gemeinsam mit dem Harvard-Soziologen Ellis Monk entwickelt wurde, und stellte sie für Forschung und Produktentwicklung frei zur Verfügung. Google nutzt sie, um Computer-Vision-Modelle auf Fairness über verschiedene Hauttöne hinweg zu prüfen. Modeteams können ähnliche Skalen nutzen, um Testsets für Bilder, Try-on und visuelle Suche zu strukturieren.
Was sagt die EU-Regulierung zu Verzerrungen in der KI?
Der EU AI Act behandelt Verzerrungen am direktesten bei Hochrisikosystemen, etwa solchen für die Personalgewinnung, sowie über Anforderungen an die Data Governance. Der Digital Omnibus zur KI, Verordnung (EU) 2026/1744, hat Artikel 4a ergänzt, der es Anbietern und Betreibern erlaubt, besondere Kategorien personenbezogener Daten zu verarbeiten, soweit dies für die Erkennung und Korrektur von Verzerrungen unbedingt erforderlich ist, vorbehaltlich Schutzvorkehrungen wie Pseudonymisierung, eingeschränkter Weiterverwendung und strenger Zugriffskontrollen. Das ist wichtig, weil Tests auf Verzerrungen nach Hautton oder anderen sensiblen Merkmalen genau solche Daten betreffen können.
Die meisten KI-Anwendungen in der Mode, etwa Bilder und Empfehlungen, gelten nach dem AI Act nicht als hochriskant. Doch das Antidiskriminierungs-, Verbraucherschutz- und Datenschutzrecht gilt weiterhin, und verzerrte Ergebnisse können schnell Reputationsschäden verursachen.
Wie können Modemarken Verzerrungen in der KI verringern?
- Legen Sie für jede Anwendung fest, welche Gruppen relevant sind, etwa Grössenbereiche, Hauttöne, Altersgruppen und Geschlechter.
- Erstellen Sie repräsentative Testsets und messen Sie die Leistung für jede Gruppe, nicht nur im Durchschnitt.
- Fragen Sie Anbieter, wie ihre Modelle trainiert und auf Verzerrungen getestet wurden, und verlangen Sie die Ergebnisse.
- Beziehen Sie vielfältige Prüfende und nach Möglichkeit Kundinnen und Kunden in die Bewertung der Ergebnisse ein.
- Überwachen Sie die Ergebnisse nach dem Start, etwa Retouren nach Grössengruppe, und testen Sie nach Aktualisierungen erneut.
- Nutzen Sie KI-Bilder in Kampagnen als Ergänzung zu echter Repräsentation, nicht als Ersatz.
Häufige Fragen
Warum sind KI-Models in der Mode oft schlank und hellhäutig?
Generative Modelle lernen aus bestehenden Bildern, und Modebilder zeigten historisch ein enges Spektrum an Körpern und Hauttönen. Ohne gezielte Prompts, bewusste Datenentscheidungen und Prüfung reproduzieren die Ergebnisse meist diese Muster.
Wie lässt sich Mode-KI auf Verzerrungen bei Hauttönen testen?
Erstellen Sie ein Testset, das ein Spektrum von Hauttönen abdeckt, zum Beispiel strukturiert nach der Monk Skin Tone Scale mit zehn Abstufungen, und vergleichen Sie Ergebnisqualität und Fehlerquoten zwischen den Gruppen. Wiederholen Sie den Test nach jeder Modellaktualisierung.
Funktionieren Tools für Grössenempfehlungen für alle Grössen?
Sie können bei Grössen mit weniger Kauf- und Retourendaten weniger genau sein, oft bei den kleinsten und grössten. Marken sollten Genauigkeit und Retourenquoten nach Grössengruppe messen und die Daten dort verbessern, wo die Ergebnisse schwächer sind.
Reguliert der EU AI Act Verzerrungen in der Mode-KI?
Die Regeln zu Verzerrungen sind bei Hochrisikosystemen wie KI für die Personalgewinnung am strengsten. Seit dem Digital Omnibus erlaubt Artikel 4a die Verarbeitung sensibler Daten, soweit dies zur Erkennung und Korrektur von Verzerrungen unbedingt erforderlich ist. Die meisten Bild- und Empfehlungstools in der Mode gelten nicht als hochriskant, doch andere EU-Gesetze zu Diskriminierung und Verbraucherschutz gelten weiterhin.
Eine Ausgabe an jedem Werktag. In fünf Minuten gelesen. Kostenlos für Branchenprofis.
QUELLEN
- Gender Shades: Overview
- ACL Anthology: Decoding Fatphobia, Examining Anti-Fat and Pro-Thin Bias in AI-Generated Images
- Google: Improving skin tone representation across Google (Monk Skin Tone Scale)
- AI Business: Levi's to test diverse AI models to be more inclusive
- EUR-Lex: Regulation (EU) 2026/1744 (Digital Omnibus on AI)