in einem Projekt stand ich vor dem üblichen Problem: Die Lieferanten liefern zu den Artikeln nur Einzeiler, der Shop hat über 50.000 Artikel inkl. Varianten, und jede Variante soll einen eigenen Text mit ihren Eigenschaften bekommen. Ich wollte wissen, ob lokale KI-Modelle das zuverlässig können – vor allem ohne etwas zu erfinden – und habe dafür 10 Modelle mit 30 echten Artikeln (Team- und Berufsbekleidung) getestet. Die Ergebnisse teile ich hier, vielleicht helfen sie jemandem.
Aufgabe: HTML-Beschreibung plus Meta-Title (≤ 60 Zeichen) und Meta-Description (≤ 155). Bewertet wurde je Text auf Faktentreue, Deutsch, Nutzen für B2B-Käufer und Format (max. 10 Punkte; die inhaltliche Bewertung hat Claude gegen die Ausgangsdaten gemacht, das Format ein Skript). Hardware: ein ASUS GX10, Software Ollama.
Modell
Punkte / 300
Sek. pro Text
Gemma 4 26B
288
5,7
Gemma 4 12B
287,5
17,1
Gemma 4 31B
287,5
38,8
Mistral Small 3.2 24B
282
31,3
Qwen 3.8 27B
281
16,1
Nemotron 3 Super 120B
276
25,2
Qwen 3.5 122B
271
18,6
Qwen 3.6 35B
253
5,2
Mistral Small 4 119B
241
14,3
Nemotron 3.5 Lightning
220,5
5,4
Was mich überrascht hat:
Deutsch schreiben fast alle ordentlich. Der Unterschied liegt im Erfinden: „100 % Baumwolle“, Farben und Größen, die es nicht gibt, „preiswert“ ohne Preis, Reflexstreifen „für mehr Sicherheit“ bei einem Artikel, der ausdrücklich keine PSA ist.
Größe hilft nicht: Das 119B-Modell von Mistral landet auf Platz 9, Gemma 12B auf Platz 2.
Artikel mit fast leeren Daten sind der eigentliche Test – da füllen viele Modelle einfach auf.
In einem zweiten Durchgang habe ich mit den Top 5 den Prompt um ein paar Regeln ergänzt (Zertifikate/Normen immer nennen, keine Leserhinweise, Farbcodes nicht als Anzahl lesen usw.) und jede Antwort per Skript prüfen lassen – bei Fehlern gab es eine Korrekturrunde. Ergebnis: 147 von 150 Texten bestehen die Prüfung statt vorher 71, die Gesamtqualität ändert sich aber kaum. Und eine Regel hatte eine Nebenwirkung: Weil „auf Anfrage“ verboten war, haben zwei Modelle bei leeren Datensätzen Größen erfunden.
Warum lokal: Die Texte entstehen ja laufend neu. Mit einem lokalen Modell bleibt die Version fest, bei Cloud-Modellen kann sich nach einem Update der Stil ändern.
Alle Texte mit Bewertung und der Prompt, falls jemand tiefer einsteigen will:
Mich würde interessieren: Nutzt jemand von euch schon KI für Produkttexte im Shop? Und wie stellt ihr sicher, dass nichts erfunden wird – prüft ihr per Skript, per Stichprobe oder gar nicht?
danke fuers Teilen. Ich finde den Ueberblick ueber das, was die verschiedenen OS Modelle koennen sehr spannend - genauso wie die sehr unterschiedlichen Laufzeiten auf einer 5k EUR Hardware.
Als Kunde finde ich per KI „aufgeblaehte“ Texte furchtbar, weil der Mehrwert exakt bei 0 liegt - alle Informationen waren vorher eine Liste von Eigenschaften und vielleicht ein einzelner Satz und ich kann das in 1-2s erfassen. Hinterher ist es ein Text fuer den ich laenger brauche, obwohl keine einzige Information zusaetzlich darin steckt und im schlimmsten Fall eher noch Halluzinationen.
Ich finde es von Haendlern, die so etwas machen, geradezu respektlos, die Zeit ihrer Kunden damit zu verschwenden.
Aber wie gesagt - das ist nur meine persoenliche Meinung und mag anderen Konsumentinnen anders gehen.
danke dir, der Punkt ist berechtigt, und ehrlich gesagt sehe ich das als Käufer ähnlich. Aufgeblasener Text ohne neue Information hilft niemandem. Und Halluzinationen waren im Test genau das größte Problem, deshalb lag der Schwerpunkt darauf.
Mir geht es auch nicht darum, eine gute Eigenschaftsliste durch Prosa zu ersetzen. In den Testtexten bleibt die Liste erhalten, dazu kommen eine kurze Einleitung und Meta-Daten. Die eigentlichen Gründe sind eher:
Bei vielen Artikeln gibt es gar keine Liste, sondern nur einen Einzeiler oder nichts. Dann müssen die Eigenschaften aus Varianten und Attributen erst in eine lesbare Form gebracht werden.
Meta-Title und Meta-Description von Hand für zehntausende Varianten pflegt niemand.
Viele fast identische Varianten ohne eigenen Text sind für Suchmaschinen schwierig.
Ob 150 Wörter die richtige Länge sind, darüber kann man streiten. Kürzer und stichpunktlastiger geht natürlich genauso, das ist nur eine Einstellung im Prompt.
Kleine Korrektur: Ich habe das Gerät noch für 3.500 € bekommen, inzwischen sind die Preise stark gestiegen. Für die Einordnung spielt das aber kaum eine Rolle. Richtige KI-Server für Firmen liegen schnell im sechsstelligen Bereich, ein DGX-System mit 8 GPUs kostet um die 300.000 $. Dagegen sind 3.500 oder 5.000 € für so ein Tischgerät Kleingeld.
ChatGPT und Claude generieren beide ganz hervorragende Produktbeschreibungen und darüber hinaus auch jeglichen anderen Content für den Shop. Ich spreche dabei nicht von den kostenlosen Varianten und man muss auch selbst erstmal einiges an Arbeit investieren. Wir haben dazu ein Content Creator Plugin für uns (und nur für uns, falls die Frage aufkommt) entwickelt, das wir auf unsere Bedürfnisse angelernt haben. Die KI greift per API auf den Shop zu, erstellt den Content, der dann im Backend zur Prüfung und Freigabe bereitgestellt wird. Meta-Angaben gehören zum Arbeitsumfang.
Der Content wird bei Bedarf mehrsprachig erstellt und darüber hinaus humanisiert.
Das KI keinen vernünftigen Content erstellen kann ist nämlich mittlerweile nur noch ein Märchen.
Die KI kann quasi alles, man muss nur selbst komplex genug denken können um einen entsprechenden Arbeitsauftrag zu erstellen. Mit Claude habe wir mittlerweile +30 Plugins erstellt, dabei u.a. eine ERP, die zum Monatsende Live eingesetzt wird. Bisher konnte die KI jede neue Idee fehlerfrei und sicher umsetzen.
Kleiner Tipp, es ist äußerst effizient, wenn man die Arbeit einer KI von einer anderen überprüfen lässt.
Bei uns arbeiten mehrere Modelle ohne Einschränkung in einer gesicherten Linux VM auf einem Windows Hostsystem, in der wir zum lokalen arbeiten eine Dockware Installation mit einem Klon des Liveshops (anonymisiert, d.h. ohne Kundendaten, etc.) zur die Entwicklung nutzen.
Auf dem Weg testet die KI auch jedes Shopware Update auf Kompatibilität zu unseren Plugins und zum Theme. Wenn Anpassungen erforderlich sind, werden diese umgehend von der KI erledigt und wenn dabei Bugs im Shopware eigenen Code gefunden werden, wird von der KI ein Issue im Github Kanal von Shopware erstellt.
Alle Entwicklungen werden automatisch und immer aktuell auf Github (in privaten Repos) gesichert.
Verstaendlich
Aber rein aus Interesse: Haettest du ungefaehre Zahlen, wie viele Issues der Account erstellt hat und wie viele davon jeweils verfolgt oder abgelehnt wurden?
Aus dem Kopf würde ich sagen: ungefähr 10 Issues insgesamt. Davon wurde etwa die Hälfte weiterverfolgt bzw. später behoben, ein oder zwei wurden abgelehnt bzw. als „not planned“ geschlossen. Der Rest ist entweder noch offen oder wurde geschlossen, ohne dass ich das jetzt genauer zuordnen würde.
Die meisten Menschen unterschätzen einfach was KI bereits leisten kann, weil sie die ressourcen nicht richtig nutzen oder nur mit den kostenlosen Varianten experimentieren.
Dennoch oder gerade deswegen teile ich die Meinung einiger KI Entwickler aus den USA, dass uns KI irgenwann fressen kann/wird.
Wir nutzen hier übrigens ein 100 € Abo für Anthropic Claude und 20 € für ChatGPT. Beides jeden Cent wert.
Das führt aber jetzt alles am Thema vorbei, bzw. wäre einen eigenen Thread wert.
Da hast du sicher recht - wer sich noch nicht intensiv damit beschaeftigt hat, glaubt oft nicht, was mit einem gut gebauten Setup moeglich ist
Andere wiederum ueberschaetzen die Moeglichkeiten fuer manche Anwendungsfaelle - alles immer noch sehr spannend.
Macht doch in einem eigenen Thread weiter. Ich finde das ausgesprochen lesenswert. Zudem helfen mir bereits die kostenfreien KI-Versionen ganz massiv im Arbeitsalltag. Ich baue das gerne peu á peu weiter aus.
Mit Claude […] eine ERP, die zum Monatsende Live eingesetzt wird
Das ist einer der gefährlichsten Sätze, die ich in den letzten 1 1/2 Jahren immer wieder gehört habe. Bisher ist noch -jeder- damit nach wenigen Wochen oder Monaten gescheitert und musste mit erheblichem Aufwand die alten Prozesse und Systeme wiederbeleben. Die meisten verwechseln einen funktionierenden Prototypen in einem klar abgegrenzten Testsystem mit einem belastbaren ERP im Produktiveinsatz.