8. Oktober 2026Internationale Ausgabe
Vol. I · No.
8. Oktober 2026
AI in Fashion
DAILY
Das tägliche Briefing zu KI im Modebusiness
Wo Mode auf künstliche Intelligenz trifft.
Merchandising & Einkauf · Leitfaden

Wie misst man die Prognosegenauigkeit in der Mode? MAPE, WAPE, Bias und MASE

Die Prognosegenauigkeit entscheidet, ob sich ein KI-Planungstool lohnt, doch die beliebteste Kennzahl eignet sich schlecht für die Mode. Ein Praxisleitfaden zu MAPE, WAPE, Bias und MASE und dazu, was gute Werte sind.

DAS WICHTIGSTE Zusammenfassung der Redaktion

  1. Die Prognosegenauigkeit in der Mode sollte mit mindestens zwei Kennzahlen gemessen werden: einer Kennzahl für die Fehlergrösse wie WAPE oder MASE und einer Bias-Kennzahl, die zeigt, ob Prognosen systematisch zu hoch oder zu tief liegen.
  2. MAPE ist nicht definiert, wenn die tatsächlichen Verkäufe null betragen, und wird extrem, wenn sie nahe null liegen. Das macht die Kennzahl für langsam drehende Grössen, Farben und Filialen unzuverlässig.
  3. MASE, von Hyndman und Koehler vorgeschlagen, setzt Fehler ins Verhältnis zu einer einfachen naiven Prognose. Ein Wert unter eins bedeutet, dass die Prognose diesen naiven Benchmark schlägt.
  4. Die Genauigkeit muss auf der Ebene gemessen werden, auf der Entscheidungen fallen, etwa Style-Farbe pro Woche oder Filiale, denn aggregierte Genauigkeit verdeckt Fehler, die zu Abschriften und Fehlbeständen führen.
  5. Einen allgemeingültigen guten Genauigkeitswert für die Mode gibt es nicht: Der aussagekräftige Test ist die Verbesserung gegenüber der bisherigen Methode bei denselben Produkten, demselben Horizont und auf derselben Ebene.

Die Prognosegenauigkeit in der Mode misst man am besten mit einer Fehlerkennzahl, die mit niedrigen Verkäufen und Nullverkäufen umgehen kann, etwa WAPE oder MASE, sowie mit einer separaten Bias-Kennzahl. MAPE, die meistzitierte Kennzahl, versagt bei Langsamdrehern und sollte nicht die einzige Zahl im Dashboard sein. Was als gut gilt, hängt von Ebene, Horizont und Produkttyp ab. Die Genauigkeit sollte deshalb immer an einem Benchmark auf denselben Daten gemessen werden.

Warum ist Prognosegenauigkeit in der Mode so wichtig?

Jeder Einkaufs-, Allokations- und Nachorderentscheid beruht auf einer Prognose. Zu hohe Prognosen werden zu Überbeständen und Abschriften, zu tiefe zu Fehlbeständen und entgangenen Verkäufen zum vollen Preis. Wenn eine Marke ein KI-Prognosetool bewertet, ist die Genauigkeit zudem der wichtigste Beleg für dessen Return on Investment. Ist die Messung falsch, ist auch der Business Case falsch.

Was sind die wichtigsten Kennzahlen für Prognosegenauigkeit?

Das Lehrbuch Forecasting: Principles and Practice von Hyndman und Athanasopoulos teilt Genauigkeitsmasse in skalenabhängige Fehler, prozentuale Fehler und skalierte Fehler ein. Die Tabelle fasst die Kennzahlen zusammen, die in der Handelsplanung am häufigsten verwendet werden.

Kennzahlen für Prognosegenauigkeit im Vergleich für den Einsatz in der Mode
KennzahlWas sie misstStärkeSchwäche in der Mode
MAE (mittlerer absoluter Fehler)Durchschnittliche Fehlergrösse in EinheitenLeicht zu erklärenKein Vergleich zwischen Artikeln mit unterschiedlichen Volumen möglich
RMSE (Wurzel des mittleren quadratischen Fehlers)Fehler, bei dem grosse Abweichungen stärker gewichtet werdenMacht grosse Fehlprognosen sichtbarAusreisserempfindlich, einheitenabhängig
MAPE (mittlerer absoluter prozentualer Fehler)Durchschnittlicher Fehler in Prozent der IstwerteEinheitenfrei, intuitivBei Nullverkäufen nicht definiert, nahe null extrem
WAPE (gewichteter absoluter prozentualer Fehler)Summe der absoluten Fehler geteilt durch die gesamten tatsächlichen VerkäufeRobust bei Artikeln mit geringem VolumenVon Artikeln mit hohem Volumen dominiert
MASE (mittlerer absoluter skalierter Fehler)Fehler im Verhältnis zu einer naiven PrognoseÜber Artikel hinweg vergleichbar, funktioniert mit NullwertenFür Fachanwender weniger intuitiv
BiasDurchschnittlicher vorzeichenbehafteter Fehler (zu hoch oder zu tief)Zeigt die systematische RichtungSagt nichts über die Fehlergrösse aus
assorted-color clothes lot
Lesen Sie auch
Wie senkt KI-gestützte Bestandsoptimierung Altware und Fehlbestände in der Mode?

Was ist an MAPE für Modeprognosen problematisch?

MAPE teilt jeden Fehler durch den Istwert. Hyndman und Athanasopoulos weisen darauf hin, dass prozentuale Masse unendlich oder nicht definiert sind, wenn ein Istwert null beträgt, und extreme Ergebnisse liefern, wenn Istwerte nahe null liegen. In der Mode sind Null- und Fast-Nullverkäufe allgegenwärtig: eine Grösse 34 in einer Filiale, eine Nischenfarbstellung, die erste oder letzte Woche im Lebenszyklus eines Produkts.

In ihrem Aufsatz Another look at measures of forecast accuracy gehen Hyndman und Koehler weiter: Bei sporadischer Nachfrage mit kleinen Mengen machen häufige Nullwerte prozentuale Masse unbrauchbar. Sie weisen zudem darauf hin, dass der Prognosewettbewerb M3 das Problem umging, indem er solche Daten ausschloss, ein Ausweg, der in der Praxis nicht zur Verfügung steht. Das Lehrbuch nennt ein zweites Problem: MAPE bestraft negative Fehler stärker als positive, was Teams zu systematisch zu tiefen Prognosen verleiten kann.

Was sollten Modeteams stattdessen verwenden?

Zwei Alternativen sind weit verbreitet. WAPE summiert die absoluten Fehler über alle Artikel und teilt sie durch die Gesamtverkäufe, sodass eine verfehlte Grösse bei einem langsam drehenden Artikel das Ergebnis nicht sprengt. Diese Kennzahl wird beispielsweise in der VISUELLE-Forschung von Skenderi und Kollegen zu neuen Fast-Fashion-Produkten ausgewiesen. Ihr Nachteil ist, dass Bestseller den Wert dominieren. Sie sollte deshalb zusammen mit einer Aufschlüsselung nach Produktsegmenten gelesen werden.

MASE, von Hyndman und Koehler vorgeschlagen, skaliert jeden Fehler mit dem Fehler einer einfachen naiven Prognose auf historischen Daten. Ein Wert unter eins bedeutet, dass die Prognose diesen naiven Benchmark schlägt, ein Wert über eins, dass sie schlechter abschneidet. Weil die Kennzahl auch bei Nullwerten definiert bleibt, eignet sie sich für granulare Modedaten und integriert den Benchmark direkt in die Kennzahl.

Warum sollte der Bias separat gemessen werden?

Fehlerkennzahlen messen die Grösse, nicht die Richtung. Eine Prognose kann einen akzeptablen WAPE aufweisen und dennoch konstant um einige Prozent zu hoch liegen, was Saison für Saison unbemerkt Überbestände aufbaut. Der Bias ist der durchschnittliche vorzeichenbehaftete Fehler oder die gesamte Prognose abzüglich der gesamten Istwerte im Verhältnis zu den Istwerten. Er sollte nach Kategorie, Kanal und manuellen Planungseingriffen verfolgt werden, denn systematischer Optimismus entsteht oft durch manuelle Anpassungen und nicht durch das Modell.

Die Wahl der Kennzahl bestimmt auch, worauf ein Modell optimiert. Das Lehrbuch hält fest, dass eine Methode, die den MAE minimiert, Prognosen des Medians liefert, während die Minimierung des RMSE Prognosen des Mittelwerts liefert. Bei schiefer Modenachfrage können sich diese beiden deutlich unterscheiden. Die Kennzahl im Vertrag mit einem Anbieter legt also faktisch fest, welche Art von Prognose geliefert wird.

Auf welcher Ebene sollte die Genauigkeit gemessen werden?

Die Genauigkeit steigt mit der Aggregation der Daten. Dieselbe Prognose kann auf Ebene Marke und Monat hervorragend und auf Ebene Style, Farbe, Grösse, Filiale und Woche schwach aussehen. Messen Sie auf der Ebene, auf der die Entscheidung getroffen wird.

  • Einkauf: Style oder Style-Farbe, gesamte Saison, zum Vorlaufzeitpunkt, an dem der Einkauf fest zugesagt wird.
  • Allokation: Style-Farbe nach Filiale oder Cluster, pro Woche.
  • Replenishment und Nachorder: SKU nach Standort, über die Wiederbeschaffungszeit.
  • Finanzplanung: Kategorie nach Monat, wo aggregierte Genauigkeit angemessen ist.

Die Verkäufe sollten vor der Messung zudem um Fehlbestände bereinigt werden. Eine Prognose, die die Nachfrage richtig eingeschätzt hat, wirkt falsch, wenn das Produkt ausverkauft war und die erfassten Verkäufe deshalb gedeckelt sind.

Lesen Sie auch
Welche KI-KPIs sollten Modeunternehmen in den einzelnen Funktionen messen?

Wie sieht gute Prognosegenauigkeit aus?

Für die Mode gibt es keinen verlässlichen branchenweiten Zielwert, und jeden Anbieter, der einen allgemeingültigen Prozentsatz nennt, sollte man fragen, wie dieser gemessen wurde. Veröffentlichte Forschung vermittelt eine Grössenordnung: In der Studie von Fisher und Vaidyanathan zur Prognose neuer Produkte in Handelskategorien lagen die Fehler bei den Umsatzanteilen zwischen 16,2 und 28,7 Prozent MAPE, und zwar auf aggregierter Ebene und ausserhalb der Mode. Granulare Modeprognosen weisen in der Regel deutlich höhere Fehler auf.

Daraus ergibt sich eine praktische Evaluationsroutine.

  1. Legen Sie vor dem Test für jeden Anwendungsfall die Entscheidungsebene und die Vorlaufzeit fest.
  2. Halten Sie eine vergangene Saison zurück, die das Modell nicht kennt, und prognostizieren Sie sie, als wäre sie live.
  3. Weisen Sie WAPE oder MASE sowie den Bias nach Kategorie, Kanal sowie neuen und fortlaufenden Produkten aus.
  4. Vergleichen Sie mit der bisherigen Planerprognose und mit einem einfachen naiven Benchmark.
  5. Übersetzen Sie die Fehlerreduktion in Auswirkungen auf Bestand und Marge, damit die Finanzabteilung den Return on Investment beurteilen kann.

Häufige Fragen

Was ist ein guter MAPE-Wert für Modeprognosen?

Einen allgemeingültigen guten MAPE-Wert für die Mode gibt es nicht, denn die Genauigkeit hängt stark von Ebene, Horizont und Produkttyp ab. MAPE ist zudem bei Artikeln mit geringem Volumen unzuverlässig, weil die Kennzahl bei Nullverkäufen nicht definiert ist. Besser ist es, WAPE oder MASE auf denselben Daten mit der bisherigen Methode zu vergleichen.

Was ist der Unterschied zwischen MAPE und WAPE?

MAPE mittelt den prozentualen Fehler jedes einzelnen Artikels, sodass ein kleiner Artikel mit grosser prozentualer Abweichung das Ergebnis verzerren kann. WAPE teilt den gesamten absoluten Fehler durch die gesamten tatsächlichen Verkäufe. Das macht die Kennzahl robust gegenüber Artikeln mit geringem Volumen, gewichtet Bestseller aber stärker.

Was ist ein Prognose-Bias?

Ein Prognose-Bias ist die Tendenz von Prognosen, systematisch zu hoch oder zu tief zu liegen. Er wird als durchschnittlicher vorzeichenbehafteter Fehler gemessen und ist in der Mode wichtig, weil ein anhaltender positiver Bias Überbestände und Abschriften aufbaut, selbst wenn die Fehlergrösse akzeptabel erscheint.

Was bedeutet ein MASE-Wert unter 1?

Ein MASE-Wert unter 1 bedeutet, dass der durchschnittliche Fehler der Prognose kleiner ist als der einer einfachen naiven Prognose auf den historischen Daten. Das ist ein schneller Test dafür, ob ein Modell oder ein KI-Tool einen Mehrwert über einen einfachen Benchmark hinaus liefert.

LeitfadenDer umfassende Leitfaden zu KI in Merchandising und EinkaufDen ganzen Leitfaden lesen
Daily abonnieren

Eine Ausgabe an jedem Werktag. In fünf Minuten gelesen. Kostenlos für Branchenprofis.

Newsletter

Mehr zu Prognose

Alle anzeigen