Wie misst man die Prognosegenauigkeit in der Mode? MAPE, WAPE, Bias und MASE
Die Prognosegenauigkeit entscheidet, ob sich ein KI-Planungstool lohnt, doch die beliebteste Kennzahl eignet sich schlecht für die Mode. Ein Praxisleitfaden zu MAPE, WAPE, Bias und MASE und dazu, was gute Werte sind.
DAS WICHTIGSTE Zusammenfassung der Redaktion
- Die Prognosegenauigkeit in der Mode sollte mit mindestens zwei Kennzahlen gemessen werden: einer Kennzahl für die Fehlergrösse wie WAPE oder MASE und einer Bias-Kennzahl, die zeigt, ob Prognosen systematisch zu hoch oder zu tief liegen.
- MAPE ist nicht definiert, wenn die tatsächlichen Verkäufe null betragen, und wird extrem, wenn sie nahe null liegen. Das macht die Kennzahl für langsam drehende Grössen, Farben und Filialen unzuverlässig.
- MASE, von Hyndman und Koehler vorgeschlagen, setzt Fehler ins Verhältnis zu einer einfachen naiven Prognose. Ein Wert unter eins bedeutet, dass die Prognose diesen naiven Benchmark schlägt.
- Die Genauigkeit muss auf der Ebene gemessen werden, auf der Entscheidungen fallen, etwa Style-Farbe pro Woche oder Filiale, denn aggregierte Genauigkeit verdeckt Fehler, die zu Abschriften und Fehlbeständen führen.
- Einen allgemeingültigen guten Genauigkeitswert für die Mode gibt es nicht: Der aussagekräftige Test ist die Verbesserung gegenüber der bisherigen Methode bei denselben Produkten, demselben Horizont und auf derselben Ebene.
Die Prognosegenauigkeit in der Mode misst man am besten mit einer Fehlerkennzahl, die mit niedrigen Verkäufen und Nullverkäufen umgehen kann, etwa WAPE oder MASE, sowie mit einer separaten Bias-Kennzahl. MAPE, die meistzitierte Kennzahl, versagt bei Langsamdrehern und sollte nicht die einzige Zahl im Dashboard sein. Was als gut gilt, hängt von Ebene, Horizont und Produkttyp ab. Die Genauigkeit sollte deshalb immer an einem Benchmark auf denselben Daten gemessen werden.
Warum ist Prognosegenauigkeit in der Mode so wichtig?
Jeder Einkaufs-, Allokations- und Nachorderentscheid beruht auf einer Prognose. Zu hohe Prognosen werden zu Überbeständen und Abschriften, zu tiefe zu Fehlbeständen und entgangenen Verkäufen zum vollen Preis. Wenn eine Marke ein KI-Prognosetool bewertet, ist die Genauigkeit zudem der wichtigste Beleg für dessen Return on Investment. Ist die Messung falsch, ist auch der Business Case falsch.
Was sind die wichtigsten Kennzahlen für Prognosegenauigkeit?
Das Lehrbuch Forecasting: Principles and Practice von Hyndman und Athanasopoulos teilt Genauigkeitsmasse in skalenabhängige Fehler, prozentuale Fehler und skalierte Fehler ein. Die Tabelle fasst die Kennzahlen zusammen, die in der Handelsplanung am häufigsten verwendet werden.
| Kennzahl | Was sie misst | Stärke | Schwäche in der Mode |
|---|---|---|---|
| MAE (mittlerer absoluter Fehler) | Durchschnittliche Fehlergrösse in Einheiten | Leicht zu erklären | Kein Vergleich zwischen Artikeln mit unterschiedlichen Volumen möglich |
| RMSE (Wurzel des mittleren quadratischen Fehlers) | Fehler, bei dem grosse Abweichungen stärker gewichtet werden | Macht grosse Fehlprognosen sichtbar | Ausreisserempfindlich, einheitenabhängig |
| MAPE (mittlerer absoluter prozentualer Fehler) | Durchschnittlicher Fehler in Prozent der Istwerte | Einheitenfrei, intuitiv | Bei Nullverkäufen nicht definiert, nahe null extrem |
| WAPE (gewichteter absoluter prozentualer Fehler) | Summe der absoluten Fehler geteilt durch die gesamten tatsächlichen Verkäufe | Robust bei Artikeln mit geringem Volumen | Von Artikeln mit hohem Volumen dominiert |
| MASE (mittlerer absoluter skalierter Fehler) | Fehler im Verhältnis zu einer naiven Prognose | Über Artikel hinweg vergleichbar, funktioniert mit Nullwerten | Für Fachanwender weniger intuitiv |
| Bias | Durchschnittlicher vorzeichenbehafteter Fehler (zu hoch oder zu tief) | Zeigt die systematische Richtung | Sagt nichts über die Fehlergrösse aus |

Was ist an MAPE für Modeprognosen problematisch?
MAPE teilt jeden Fehler durch den Istwert. Hyndman und Athanasopoulos weisen darauf hin, dass prozentuale Masse unendlich oder nicht definiert sind, wenn ein Istwert null beträgt, und extreme Ergebnisse liefern, wenn Istwerte nahe null liegen. In der Mode sind Null- und Fast-Nullverkäufe allgegenwärtig: eine Grösse 34 in einer Filiale, eine Nischenfarbstellung, die erste oder letzte Woche im Lebenszyklus eines Produkts.
In ihrem Aufsatz Another look at measures of forecast accuracy gehen Hyndman und Koehler weiter: Bei sporadischer Nachfrage mit kleinen Mengen machen häufige Nullwerte prozentuale Masse unbrauchbar. Sie weisen zudem darauf hin, dass der Prognosewettbewerb M3 das Problem umging, indem er solche Daten ausschloss, ein Ausweg, der in der Praxis nicht zur Verfügung steht. Das Lehrbuch nennt ein zweites Problem: MAPE bestraft negative Fehler stärker als positive, was Teams zu systematisch zu tiefen Prognosen verleiten kann.
Was sollten Modeteams stattdessen verwenden?
Zwei Alternativen sind weit verbreitet. WAPE summiert die absoluten Fehler über alle Artikel und teilt sie durch die Gesamtverkäufe, sodass eine verfehlte Grösse bei einem langsam drehenden Artikel das Ergebnis nicht sprengt. Diese Kennzahl wird beispielsweise in der VISUELLE-Forschung von Skenderi und Kollegen zu neuen Fast-Fashion-Produkten ausgewiesen. Ihr Nachteil ist, dass Bestseller den Wert dominieren. Sie sollte deshalb zusammen mit einer Aufschlüsselung nach Produktsegmenten gelesen werden.
MASE, von Hyndman und Koehler vorgeschlagen, skaliert jeden Fehler mit dem Fehler einer einfachen naiven Prognose auf historischen Daten. Ein Wert unter eins bedeutet, dass die Prognose diesen naiven Benchmark schlägt, ein Wert über eins, dass sie schlechter abschneidet. Weil die Kennzahl auch bei Nullwerten definiert bleibt, eignet sie sich für granulare Modedaten und integriert den Benchmark direkt in die Kennzahl.
Warum sollte der Bias separat gemessen werden?
Fehlerkennzahlen messen die Grösse, nicht die Richtung. Eine Prognose kann einen akzeptablen WAPE aufweisen und dennoch konstant um einige Prozent zu hoch liegen, was Saison für Saison unbemerkt Überbestände aufbaut. Der Bias ist der durchschnittliche vorzeichenbehaftete Fehler oder die gesamte Prognose abzüglich der gesamten Istwerte im Verhältnis zu den Istwerten. Er sollte nach Kategorie, Kanal und manuellen Planungseingriffen verfolgt werden, denn systematischer Optimismus entsteht oft durch manuelle Anpassungen und nicht durch das Modell.
Die Wahl der Kennzahl bestimmt auch, worauf ein Modell optimiert. Das Lehrbuch hält fest, dass eine Methode, die den MAE minimiert, Prognosen des Medians liefert, während die Minimierung des RMSE Prognosen des Mittelwerts liefert. Bei schiefer Modenachfrage können sich diese beiden deutlich unterscheiden. Die Kennzahl im Vertrag mit einem Anbieter legt also faktisch fest, welche Art von Prognose geliefert wird.
Auf welcher Ebene sollte die Genauigkeit gemessen werden?
Die Genauigkeit steigt mit der Aggregation der Daten. Dieselbe Prognose kann auf Ebene Marke und Monat hervorragend und auf Ebene Style, Farbe, Grösse, Filiale und Woche schwach aussehen. Messen Sie auf der Ebene, auf der die Entscheidung getroffen wird.
- Einkauf: Style oder Style-Farbe, gesamte Saison, zum Vorlaufzeitpunkt, an dem der Einkauf fest zugesagt wird.
- Allokation: Style-Farbe nach Filiale oder Cluster, pro Woche.
- Replenishment und Nachorder: SKU nach Standort, über die Wiederbeschaffungszeit.
- Finanzplanung: Kategorie nach Monat, wo aggregierte Genauigkeit angemessen ist.
Die Verkäufe sollten vor der Messung zudem um Fehlbestände bereinigt werden. Eine Prognose, die die Nachfrage richtig eingeschätzt hat, wirkt falsch, wenn das Produkt ausverkauft war und die erfassten Verkäufe deshalb gedeckelt sind.
Wie sieht gute Prognosegenauigkeit aus?
Für die Mode gibt es keinen verlässlichen branchenweiten Zielwert, und jeden Anbieter, der einen allgemeingültigen Prozentsatz nennt, sollte man fragen, wie dieser gemessen wurde. Veröffentlichte Forschung vermittelt eine Grössenordnung: In der Studie von Fisher und Vaidyanathan zur Prognose neuer Produkte in Handelskategorien lagen die Fehler bei den Umsatzanteilen zwischen 16,2 und 28,7 Prozent MAPE, und zwar auf aggregierter Ebene und ausserhalb der Mode. Granulare Modeprognosen weisen in der Regel deutlich höhere Fehler auf.
Daraus ergibt sich eine praktische Evaluationsroutine.
- Legen Sie vor dem Test für jeden Anwendungsfall die Entscheidungsebene und die Vorlaufzeit fest.
- Halten Sie eine vergangene Saison zurück, die das Modell nicht kennt, und prognostizieren Sie sie, als wäre sie live.
- Weisen Sie WAPE oder MASE sowie den Bias nach Kategorie, Kanal sowie neuen und fortlaufenden Produkten aus.
- Vergleichen Sie mit der bisherigen Planerprognose und mit einem einfachen naiven Benchmark.
- Übersetzen Sie die Fehlerreduktion in Auswirkungen auf Bestand und Marge, damit die Finanzabteilung den Return on Investment beurteilen kann.
Häufige Fragen
Was ist ein guter MAPE-Wert für Modeprognosen?
Einen allgemeingültigen guten MAPE-Wert für die Mode gibt es nicht, denn die Genauigkeit hängt stark von Ebene, Horizont und Produkttyp ab. MAPE ist zudem bei Artikeln mit geringem Volumen unzuverlässig, weil die Kennzahl bei Nullverkäufen nicht definiert ist. Besser ist es, WAPE oder MASE auf denselben Daten mit der bisherigen Methode zu vergleichen.
Was ist der Unterschied zwischen MAPE und WAPE?
MAPE mittelt den prozentualen Fehler jedes einzelnen Artikels, sodass ein kleiner Artikel mit grosser prozentualer Abweichung das Ergebnis verzerren kann. WAPE teilt den gesamten absoluten Fehler durch die gesamten tatsächlichen Verkäufe. Das macht die Kennzahl robust gegenüber Artikeln mit geringem Volumen, gewichtet Bestseller aber stärker.
Was ist ein Prognose-Bias?
Ein Prognose-Bias ist die Tendenz von Prognosen, systematisch zu hoch oder zu tief zu liegen. Er wird als durchschnittlicher vorzeichenbehafteter Fehler gemessen und ist in der Mode wichtig, weil ein anhaltender positiver Bias Überbestände und Abschriften aufbaut, selbst wenn die Fehlergrösse akzeptabel erscheint.
Was bedeutet ein MASE-Wert unter 1?
Ein MASE-Wert unter 1 bedeutet, dass der durchschnittliche Fehler der Prognose kleiner ist als der einer einfachen naiven Prognose auf den historischen Daten. Das ist ein schneller Test dafür, ob ein Modell oder ein KI-Tool einen Mehrwert über einen einfachen Benchmark hinaus liefert.
Eine Ausgabe an jedem Werktag. In fünf Minuten gelesen. Kostenlos für Branchenprofis.
QUELLEN
- Hyndman and Athanasopoulos, Forecasting: Principles and Practice (3rd ed.): Evaluating point forecast accuracy
- Rob J. Hyndman: Another look at measures of forecast accuracy (Hyndman and Koehler)
- arXiv: Well Googled is Half Done, multimodal forecasting of new fashion product sales with image-based Google Trends (Skenderi et al.)
- IDEAS/RePEc: A Demand Estimation Procedure for Retail Assortment Optimization with Results from Implementations (Fisher and Vaidyanathan, Management Science 2014)

