Ein 90-Tage-KI-Pilot im Wholesale: Umfang, Kennzahlen und Abbruchkriterien
Ein praxisnaher Plan für einen zeitlich begrenzten KI-Pilot in einem Wholesale-Geschäft, mit definiertem Umfang, messbaren Zielen und vereinbarten Bedingungen für Abbruch oder Ausweitung.

DAS WICHTIGSTE Zusammenfassung der Redaktion
- Ein 90-Tage-KI-Pilot im Wholesale sollte einen Prozess adressieren, mit Ausgangswert, einer kleinen Nutzergruppe, vereinbarten Kennzahlen und schriftlichen Kriterien für Ausweitung, Anpassung oder Abbruch.
- Die Umfrage State of AI 2026 von McKinsey stellte fest, dass 44 Prozent der Befragten sagen, KI skaliere im ganzen Unternehmen, und 37 Prozent der KI zumindest einen gewissen EBIT-Effekt zuschreiben. Vielen Organisationen fehlen also weiterhin messbare finanzielle Erträge.
- Die besten ersten Anwendungsfälle im Wholesale sind eng gefasst und datenreif, etwa Fragen zum Auftragsstatus, Prüfungen von Produktdaten oder Besuchsbriefings.
- Datenreife, Akzeptanz der Nutzer und der Aufwand für die Prüfung entscheiden oft stärker über das Ergebnis als die Modellqualität.
- Ein Pilot, der ohne Entscheidung endet, ist gescheitert, unabhängig vom technischen Resultat.
Ein guter 90-Tage-KI-Pilot im Wholesale wählt einen eng gefassten Prozess, misst ihn gegen einen Ausgangswert, bindet eine kleine Gruppe realer Nutzer ein und legt im Voraus fest, welches Ergebnis zu Ausweitung, Anpassung oder Abbruch führt. Das Ziel ist eine Entscheidung, nicht eine Demonstration.
Warum einen zeitlich begrenzten Pilot durchführen?
Die Umfrage State of AI 2026 von McKinsey (1719 Befragte in 97 Ländern, durchgeführt von Mai bis Juni 2026) berichtet, dass 44 Prozent sagen, KI skaliere im ganzen Unternehmen, gegenüber 38 Prozent ein Jahr zuvor, und dass 37 Prozent der KI zumindest einen gewissen EBIT-Effekt zuschreiben, im Wesentlichen unverändert. Ein Jahr zuvor stellte die Umfrage, wie von Le New Black zusammengefasst, fest, dass die Mehrheit der Organisationen noch experimentierte oder pilotierte. Das Bild legt nahe, dass viele Piloten keine messbaren finanziellen Ergebnisse erreichen. Ein fester Zeitrahmen erzwingt eine Entscheidung und begrenzt die Kosten.
Ein Zeitrahmen schützt auch das Team. Offene Experimente beanspruchen die Aufmerksamkeit derjenigen, die das Geschäft am besten kennen, und diese werden tendenziell als Erste in die tägliche Arbeit zurückgeholt. Neunzig Tage sind lang genug, um Verhaltensänderungen zu sehen, und kurz genug, dass ein Sponsor die Zeit vernünftigerweise schützen kann.
Wie sollte der Umfang aussehen?
Wählen Sie einen Prozess mit klarer Verantwortung, verfügbaren Daten und messbarem Ergebnis. Meiden Sie breite Ziele wie die Verbesserung der Kundenerfahrung. Gute Kandidaten im Wholesale sind die Beantwortung von Routinefragen zu Auftrag und Lieferung, die Prüfung von Preislisten und Produktdaten vor der Freigabe, die Vorbereitung von Briefings für Vertriebsmitarbeiter und der Entwurf von Nachfassnachrichten nach Terminen in der Marktwoche.
| Pilot | Wichtigste Voraussetzung | Typische Kennzahl |
|---|---|---|
| Assistent für den Auftragsstatus im Kundenservice | Verlässliche Auftrags- und Versanddaten | Anteil korrekt beantworteter Anfragen, Bearbeitungszeit |
| Prüfung von Preislisten und Produktdaten | Dokumentierte Regeln, saubere Stammdaten | Vor der Freigabe erfasste Fehler, Prüfzeit |
| Besuchsbriefings für Vertriebsmitarbeiter | Vollständige Kunden- und Bestellhistorie | Eingesparte Vorbereitungszeit, Bewertung der Nützlichkeit durch Vertriebsmitarbeiter |
| Re-Order-Erinnerungen für kleine Kunden | Bestellhistorie, Einwilligung zur Kontaktaufnahme | Re-Order-Rate gegenüber Kontrollgruppe |
Prüfen Sie die Datenreife früh. Führen Sie eine einwöchige Durchsicht der vom Pilot benötigten Daten durch: ob sie existieren, wem sie gehören, wie aktuell sie sind und ob das KI-Werkzeug sie nutzen darf. Viele Piloten verlieren Wochen, weil sie zu spät entdecken, dass die Bestellhistorie auf zwei Systeme verteilt ist oder eine Kundendatei geschützte Daten enthält. Eine kurze Datendurchsicht vor Tag 15 vermeidet das.

Wie sollten die 90 Tage gegliedert werden?
- Tage 1 bis 15, definieren: Wählen Sie Prozess, Verantwortliche, Nutzer, Ausgangskennzahlen sowie Erfolgs- und Abbruchkriterien.
- Tage 16 bis 30, vorbereiten: Prüfen Sie die Daten, legen Sie Zugriffsrechte fest und entscheiden Sie, wie Fehler protokolliert werden.
- Tage 31 bis 60, durchführen: Nutzen Sie das Werkzeug mit einer kleinen Gruppe, sammeln Sie wöchentlich Protokolle und Rückmeldungen und beheben Sie Probleme.
- Tage 61 bis 80, messen: Vergleichen Sie mit dem Ausgangswert und, wo möglich, mit einer Kontrollgruppe.
- Tage 81 bis 90, entscheiden: Halten Sie einen Review anhand der Abbruchkriterien ab und dokumentieren Sie die Entscheidung.
Dokumentieren Sie den Ausgangswert sorgfältig. Braucht der Kundenservice heute im Durchschnitt eine bestimmte Zeit für die Antwort auf eine Auftragsanfrage, halten Sie das mit derselben Definition fest, die Sie am Ende verwenden. Ohne Ausgangswert ist jede Verbesserung ein Eindruck, und ein Eindruck genügt nicht, um den Einsatz eines Werkzeugs in einer Vertriebsorganisation zu rechtfertigen.
Welche Kennzahlen zählen?
Verwenden Sie einen kleinen Satz, der drei Bereiche abdeckt. Ergebniskennzahlen spiegeln Geschäftsresultate, etwa die Zeit bis zur Antwort an einen Kunden, Fehler, die Einkäufer erreichen, oder die Re-Order-Rate. Qualitätskennzahlen spiegeln die Genauigkeit, etwa den Anteil der als korrekt verifizierten Antworten und die Zahl schwerwiegender Fehler. Akzeptanz- und Kostenkennzahlen zeigen, ob die Menschen das Werkzeug nutzen und was es kostet, einschliesslich Abonnement, Nutzungsgebühren und der Zeit, die für die Kontrolle seiner Arbeit anfällt.
Die Umfrage 2026 von McKinsey hält fest, dass etwa 20 Prozent der Befragten sagen, Betriebskosten, einschliesslich Tokens, hätten ihre KI-Nutzung eingeschränkt. Beziehen Sie die laufenden Kosten in den Pilot ein, nicht nur den Aufwand der Einrichtung.
Nehmen Sie eine Kennzahl für den Aufwand auf, der nötig ist, um die Ausgabe des Werkzeugs zu prüfen. Ein System mit 90 Prozent Genauigkeit klingt gut, bis das Team merkt, dass es noch jede Antwort lesen muss, um die anderen 10 Prozent zu finden. Die Prüfzeit kann den Nutzen auffressen, erfassen Sie sie daher ab der ersten Woche.
Welche Abbruchkriterien sind sinnvoll?
- Ausweiten: Das Werkzeug erreicht die Qualitätsschwelle, zeigt gegenüber dem Ausgangswert einen messbaren Nutzen, und die Nutzer verwenden es weiterhin freiwillig.
- Anpassen: Der Nutzen ist plausibel, aber Probleme bei Daten, Prozess oder Schulung sind klar und innerhalb eines definierten Zeitraums behebbar.
- Abbrechen: Die Qualität liegt unter der Schwelle, der Nutzen ist nicht messbar oder die Kosten der Aufsicht übersteigen den Gewinn.
- Harte Stopps: Ein schwerwiegender Fehler, etwa die Offenlegung vertraulicher Daten oder falsche Preise an Einkäufer, löst sofort einen Review aus.
Schreiben Sie die Schwellen vor dem Start des Piloten als Zahlen auf, zum Beispiel den Mindestanteil verifiziert korrekter Antworten und die maximal akzeptable Prüfzeit pro Antwort. Sie nachträglich festzulegen, verleitet zur verbreiteten Versuchung, Erfolg über das zu definieren, was der Pilot zufällig erreicht hat. Legen Sie auch fest, wer befugt ist, den Piloten vorzeitig zu stoppen, wenn ein harter Stopp ausgelöst wird.

Was geht üblicherweise schief?
Die häufigsten Fehlschläge sind unklare Verantwortung, fehlender Ausgangswert, spät entdeckte Datenprobleme und Nutzer, die nie gefragt wurden. Ein weiterer ist ein Pilot, der stillschweigend weiterläuft, weil niemand die Entscheidung treffen will. Benennen Sie einen Sponsor, der am Tag 90 entscheidet. Seien Sie schliesslich ehrlich bei der Frage Eigenbau oder Kauf: Die Umfrage von McKinsey berichtet, dass sich 32 Prozent der Befragten gegen den Kauf mindestens eines Softwareprodukts entschieden haben, weil agentische Coding-Werkzeuge ihnen den Eigenbau ermöglichten. Das bringt aber Wartung und Risiko mit sich, die einzukalkulieren sind.
Behandeln Sie die Bedenken der Mitarbeitenden als Teil des Piloten. Vertriebsmitarbeiter und Kundenserviceteams befürchten womöglich, das Werkzeug solle sie ersetzen, was beeinflusst, wie sie es nutzen. Die Umfrage von McKinsey berichtet, dass 39 Prozent der Befragten im kommenden Jahr mit einem Stellenabbau durch KI rechnen, die Sorge ist also nicht unbegründet. Machen Sie klar, was der Pilot bezweckt, was sich in den Rollen ändert, wenn er skaliert, und wie das Feedback verwendet wird.
Planen Sie schliesslich den Tag danach. Fällt die Entscheidung für die Ausweitung, sind Kosten, Support und Datenarbeit für einen breiteren Rollout meist grösser als beim Pilot und sollten vor dem Review geschätzt werden. Fällt sie für den Abbruch, halten Sie fest, was gelernt wurde, damit der nächste Pilot dieselben Fehler nicht wiederholt.
Häufige Fragen
Wie lange sollte ein KI-Pilot im Wholesale dauern?
Rund 90 Tage genügen, um einen eng gefassten Anwendungsfall zu definieren, durchzuführen und auszuwerten. Längere Piloten verlieren tendenziell den Fokus, wenn sie keine expliziten Meilensteine haben.
Welcher KI-Anwendungsfall im Wholesale eignet sich am besten für einen ersten Pilot?
Einer mit sauberen Daten, klarer Verantwortung und messbaren Ergebnissen, etwa Fragen zum Auftragsstatus, Prüfungen von Preislisten und Produktdaten oder Briefings für Vertriebsmitarbeiter.
Was sind Abbruchkriterien für einen KI-Pilot?
Vorab vereinbarte Bedingungen für Ausweitung, Anpassung oder Abbruch, die auf Qualität, gemessenem Nutzen, Akzeptanz der Nutzer und Kosten beruhen, plus harte Stopps bei schwerwiegenden Fehlern.
Warum skalieren viele KI-Piloten nicht?
Häufige Gründe sind unklare Verantwortung, fehlende Ausgangswerte, schlechte Daten, Prüfkosten und eine fehlende Entscheidung am Ende. Die Umfrage 2026 von McKinsey zeigt, dass nur eine Minderheit der KI einen erheblichen EBIT-Effekt zuschreibt.
Eine Ausgabe an jedem Werktag. In fünf Minuten gelesen. Kostenlos für Branchenprofis.




