Qualitätskontrolle für KI-generierte Produktseiten: ein praktischer Leitfaden
Generierte Produktbeschreibungen können Eigenschaften erfinden, von der Marke abdriften und Suchmaschinen-Abstrafungen auslösen. Ein Prüfablauf mit automatisierten Checks, menschlichen Stichproben und klarer Kennzeichnung.

DAS WICHTIGSTE Zusammenfassung der Redaktion
- Forschende von Amazon stellten 2024 fest, dass die automatisierte Erkennung von Halluzinationen in durch LLMs angereicherten Produktlistings bei strukturierten Attributen mit eindeutigen Werten gut funktioniert, bei langen Freitexten aber schlecht: Die Präzision war niedrig, und die LLM-Validierung brachte nur geringe Verbesserungen.
- Googles Richtlinien warnen, dass die massenhafte Erstellung von Seiten mit KI ohne Mehrwert gegen die Spam-Richtlinie zu «scaled content abuse» verstossen kann und dass generative Modelle keine Fakten abrufen, weshalb jede Ausgabe vor der Veröffentlichung geprüft werden muss.
- Google hält fest, dass Titel, Meta-Beschreibungen, strukturierte Daten und Alt-Texte von Bildern derselben Prüfung bedürfen wie der Fliesstext und dass das Merchant Center erwartet, dass KI-generierte Titel und Beschreibungen separat bereitgestellt und als KI-generiert gekennzeichnet werden.
- Stitch Fix beschreibt ein Modell, das auf mehrere hundert von Fachleuten verfasste Beschreibungen samt Attributen feinabgestimmt wurde, wobei Texterinnen und Texter jede Ausgabe prüfen und bearbeiten und regelmässige Qualitätskontrollen ins Modell zurückfliessen.
- Das sicherste Design generiert Texte ausschliesslich aus verifizierten Produktattributen, führt automatisierte Prüfungen gegen diese Attribute durch und leitet eine risikobasierte Stichprobe sowie jede markierte Seite an einen menschlichen Redakteur weiter.
Qualitätskontrolle für KI-generierte Produktseiten heisst: Texte nur aus verifizierten Produktdaten generieren, das Ergebnis automatisch gegen diese Daten prüfen und eine risikobasierte Stichprobe sowie jede markierte Seite vor der Veröffentlichung von einer Person prüfen lassen. Ziel ist es, erfundene Attribute, nicht belegbare Aussagen und generische Texte ohne Mehrwert abzufangen. Automatisierte Prüfungen helfen, doch veröffentlichte Forschung zeigt, dass sie bei Freitext schwächer sind als bei strukturierten Feldern.
Was kann bei KI-generierten Produktseiten schiefgehen?
- Erfundene oder nicht belegte Attribute: Ein Modell ergänzt ein Futter, eine Passform oder einen Verwendungszweck, die im Produktdatensatz nicht vorkommen.
- Falsche oder widersprüchliche Fakten: Zusammensetzung, Pflegehinweise, Grössenangaben oder Abmessungen, die dem Datenblatt widersprechen.
- Nicht belegte Aussagen: Aussagen zu Nachhaltigkeit, Leistung oder Herkunft ohne Nachweis.
- Abdriften bei Marke und Tonalität: Sprache, die generisch klingt oder Ihrem Styleguide widerspricht.
- Suchrisiko: grosse Mengen nahezu identischer Seiten, die wenig Mehrwert bieten.
Forschende von Amazon definieren Halluzination in diesem Zusammenhang als Text, der dem bereitgestellten Quelleneingang nicht treu ist, und unterscheiden intrinsische Fälle (die Ausgabe widerspricht der Quelle) von extrinsischen (die Ausgabe lässt sich nicht gegen die Quelle verifizieren). Manche nicht belegten Werte sind dennoch korrekt, etwa eine Farbe, die zum Produktbild passt, andere sind sowohl unbelegt als auch falsch. Ihre Richtlinie muss entscheiden, ob nicht belegte, aber plausible Aussagen erlaubt sind. Für die meisten Modehändler lautet die sichere Antwort: nein.
Wie erzeugen Sie Texte, die den Daten treu bleiben?
Beginnen Sie mit einem sauberen Produktdatensatz: Attribute, Zusammensetzung, Masse, Pflege und Zertifizierungen in strukturierten Feldern. Weisen Sie das Modell an, nur diese Felder zu verwenden und lieber eine Lücke zu lassen, als zu raten. Stitch Fix beschreibt, ein Basismodell auf mehrere hundert von menschlichen Fachleuten verfasste Beschreibungen mit jeweils zugehörigen Produktattributen feinabgestimmt zu haben, nachdem Few-Shot-Prompting generische Texte von begrenzter Qualität geliefert hatte. Das Unternehmen berichtet von höheren Qualitätswerten für die KI-Beschreibungen in einer Blindbewertung gegenüber von Menschen verfassten Texten, nennt aber keine Zahlen. Die Fachleute definierten das Ziel vorab: Originalität, natürliche und überzeugende Formulierungen, wahrheitsgemässe Aussagen und Markenkonformität.

Welche automatisierten Prüfungen funktionieren am besten?
Das Amazon-Paper schlägt zwei Phasen vor. Zuerst markiert ein günstiges lexikalisches und semantisches Screening (Token-Abgleich, N-Gramm-Metriken, Embedding-Ähnlichkeit und ähnliche Methoden) Kandidaten mit hohem Recall. Danach validiert ein grosses Sprachmodell die markierten Einträge, um die Präzision zu verbessern. Bei strukturierten Attributen mit eindeutigen Werten wie der Farbe schnitt der Ansatz stark ab, und das Screening senkte die zu validierenden Einträge auf unter 12,5 %. Bei unstrukturierten, langen Freitexten war der Recall zufriedenstellend, die Präzision aber niedrig, und der LLM-Validierungsschritt brachte nur geringe Verbesserungen. Die Autoren schliessen, dass die Methode bei strukturierten Attributen besser funktioniert.
| Prüfung | Methode | Am besten geeignet für |
|---|---|---|
| Attributabgleich (Farbe, Material, Passform, Länge) | Regeln sowie String- oder semantischer Abgleich mit dem Produktdatensatz | Jede Seite, automatisch |
| Liste verbotener und regulierter Aussagen | Schlüsselwort- und Musterregeln | Jede Seite, automatisch |
| Zahlen und Einheiten (Grössen, Prozentangaben) | Mustererkennung im Vergleich mit der Quelle | Jede Seite, automatisch |
| Tonalität und Markenstimme | Stilregeln plus menschliche Prüfung | Stichprobenseiten |
| Texttreue bei Freitext | Modellgestützte Prüfung plus menschliche Kontrolle | Alle markierten Seiten und eine Stichprobe |
| Doppelte und nahezu doppelte Inhalte | Ähnlichkeitsbewertung über den gesamten Katalog | Katalogweit, wöchentlich |
| Konsistenz von Bild und Text | Prüfung anhand der Produktbilder | Hochwertige oder neue Styles |
Was sagt Google zu KI-generierten Inhalten?
Googles Leitlinien zu generativen KI-Inhalten besagen, dass KI-gestützte Inhalte weiterhin die Search Essentials und die Spam-Richtlinien erfüllen müssen und dass die massenhafte Erstellung von Seiten ohne Mehrwert für Nutzende gegen die Spam-Richtlinie zu «scaled content abuse» verstossen kann. Google erklärt, dass generative Modelle wahrscheinliche Wortfolgen vorhersagen, statt Fakten abzurufen, die Ausgaben also falsch sein können, und rät, Fakten zu prüfen und alle Inhalte vor der Veröffentlichung zu kontrollieren. Ausserdem nennt es dieselbe Sorgfalt für Titel, Meta-Beschreibungen, strukturierte Daten und Alt-Texte von Bildern und empfiehlt, Leserinnen und Lesern zu erläutern, wie Automatisierung eingesetzt wurde. Für den E-Commerce gilt laut Google: KI-generierte Bilder benötigen im Merchant Center die Metadaten des IPTC-Digital-Source-Typs TrainedAlgorithmicMedia, und KI-generierte Produkttitel und -beschreibungen müssen separat bereitgestellt und als KI-generiert gekennzeichnet werden.
Wie sollte die menschliche Prüfung organisiert sein?
- Definieren Sie Risikostufen: Neue Kategorien, hochwertige Styles, regulierte Aussagen und alles, was automatisierte Prüfungen markieren, gehen in die vollständige Prüfung; risikoarme Wiederholungsstyles erhalten eine Stichprobe.
- Geben Sie den Redaktionen eine Checkliste: Attribute gegen das Datenblatt, Aussagen gegen Nachweise, Tonalität gegen den Styleguide, Einzigartigkeit gegen den übrigen Katalog.
- Zeigen Sie den Prüfenden die Quellattribute neben dem generierten Text, damit sie schnell vergleichen können.
- Erfassen Sie jede Änderung samt Begründung. Stitch Fix beschreibt, dass regelmässige Qualitätskontrollen Erkenntnisse ins Modell zurückspeisen; derselbe Kreislauf erlaubt es Ihnen, Prompts und Regeln anzupassen, wenn die Redaktion immer dasselbe Problem korrigiert.
- Verfolgen Sie Kennzahlen: Fehlerquote pro hundert Seiten nach Art, Anteil der Seiten, die ohne Änderung durchgehen, Prüfzeit pro Seite und als «nicht wie beschrieben» kodierte Retourengründe.
Planen Sie die Kapazität ehrlich. Die Prüfzeit pro Seite ist der Kostenfaktor, der entscheidet, ob KI Geld spart, messen Sie sie daher ab der ersten Woche. Wenn Redaktionen für das Korrigieren eines Entwurfs so lange brauchen wie für das Schreiben, beschränken Sie den Einsatz auf Kategorien mit reichhaltigen strukturierten Daten oder auf kurze Felder wie Aufzählungspunkte, bei denen die Prüfungen verlässlicher sind.

Was sollten Sie nach der Veröffentlichung messen?
Die Qualitätskontrolle geht nach dem Start weiter. Vergleichen Sie Seiten mit und ohne KI bei Conversion, Retourenquote nach Grund, Kundenservice-Kontakten, die die Beschreibung erwähnen, und Suchperformance. Zeigen mit KI verfasste Seiten mehr Retouren mit dem Code «nicht wie beschrieben», verschärfen Sie die Prüfungen. Halten Sie einen Rückweg bereit: Sie sollten einen Stapel schnell zurücksetzen können, wenn ein Fehlermuster auftritt, und ein Prüfprotokoll führen, welche Seiten welchen Prompt und welche Modellversion verwendet haben.
Häufige Fragen
Straft Google KI-generierte Produktbeschreibungen ab?
Google straft Inhalte nicht allein deshalb ab, weil KI eingesetzt wurde, doch laut seinen Leitlinien kann die massenhafte Erstellung von Seiten ohne Mehrwert gegen die Spam-Richtlinie zu «scaled content abuse» verstossen. Google rät, KI-Inhalte vor der Veröffentlichung zu prüfen und für das Merchant Center KI-generierte Titel und Beschreibungen zu kennzeichnen.
Wie erkenne ich KI-Halluzinationen in Produkttexten?
Vergleichen Sie den generierten Text mit dem strukturierten Produktdatensatz. Forschung von Amazon zeigt, dass Screening plus LLM-Validierung bei strukturierten Attributen wie der Farbe gut funktioniert, bei langen Freitexten aber schlecht. Kombinieren Sie daher automatisierte Prüfungen mit menschlicher Kontrolle markierter und stichprobenartig gezogener Seiten.
Wie viel menschliche Prüfung brauchen KI-generierte Produktseiten?
Prüfen Sie alle Seiten in Hochrisikostufen, etwa mit regulierten Aussagen, in neuen Kategorien oder bei hochwertigen Artikeln, sowie jede Seite, die automatisierte Prüfungen markieren. Den Rest ziehen Sie stichprobenartig. Stitch Fix beschreibt, dass Texterinnen und Texter generierte Beschreibungen prüfen und bearbeiten, statt von Grund auf zu schreiben.
Sollten Produktseiten angeben, dass sie mit KI geschrieben wurden?
Google rät, Leserinnen und Lesern zu erklären, wie Automatisierung eingesetzt wurde, und das Merchant Center verlangt, dass KI-generierte Titel und Beschreibungen separat bereitgestellt und als solche gekennzeichnet werden. Prüfen Sie die Anforderungen für jeden Kanal und Markt.
Eine Ausgabe an jedem Werktag. In fünf Minuten gelesen. Kostenlos für Branchenprofis.




