System 03 · KI-Systeme
Semantic Commerce Architecture
Gebaut und über zehn Modelle hinweg evaluiert
In Arbeit
Eine Parent/Child-Hub-Architektur, die Beziehungen zwischen Themen, Materialien, Produkten und redaktionellen Inhalten sichtbar macht - gebaut über konkurrierende Modellprototypen, bewertet gegen ein festes Rubric aus zehn Modellen.
Problem
Commerce-Kataloge verbergen ihre eigene Struktur
Ein Commerce-Katalog zeigt in der Regel Produkte und Collections, aber nicht die Beziehungen zwischen Themen, Materialien, Produktfamilien, Anwendungen und redaktionellen Inhalten. Genau diese Beziehungen nutzen klassische Suche und KI-gestützte Retrieval-Systeme, um zu verstehen, wovon eine Site tatsächlich handelt.
Dieses System gehört zur breiteren Architektur von AI Operations und baut auf dem Katalog der Fallstudie International Commerce Transformation auf.
Architektur
Ein Parent-Hub, geplante Children
Die Architektur soll klarere Beziehungen für Suche und KI-gestützte Retrieval-Systeme sichtbar machen. Ob KI-Crawler die Architektur nachweislich bereits verstehen, ist eine offene Frage - ein solcher Anspruch wird hier nicht erhoben.
Workflow
Konkurrierende Prototypen, menschliche Auswahl
Jede Seite entsteht aus vier konkurrierenden Prototypen. Der Modellpool umfasst zehn Modelle: Google Flash 3.7, Claude Opus 5, Claude Fable 5, Claude Fable 5.1, GPT Terra 5.6, GPT Sol 5.6, GPT Luna 5.6, Grok 4.6, Kimi K3 und GLM 5.2, mit Codex stark für Ausführung und Iteration. Die Modelle lesen dasselbe Projekt unterschiedlich - das ist der Punkt: der Mensch vergleicht, wählt und kritisiert, statt ein Modell zu prompten und die erste Antwort zu nehmen.
- Eingabe
- Autonome Aktion
- Urteilsvermögen
- Ausgabe
Design und Layout bleiben über die Sprachen hinweg konsistent; der Text wird unabhängig für Deutsch, Englisch, Französisch und Spanisch angepasst, mit Respekt vor nativer Suchintention, Terminologie und Keyword-Relevanz - Lokalisierung ist unabhängige Anpassung je Sprache, keine Übersetzung.
Bewertung
Zehn Modelle, ein Rubric
Prototypen werden nicht nach Gefühl ausgewählt. Jede Seite entsteht aus vier konkurrierenden Prototypen bei identischen Inputs, bewertet gegen drei feste Kriterien. Gleiche Inputs, gleiche Bewertenden - die letzte Entscheidung liegt bei mir.
- Semantische Qualität - Erklärt die Struktur die internen Beziehungen? Und behauptet sie nur Beziehungen, die der Katalog tatsächlich stützt?
- Visuelle Identität - Hält sie die Brand Guidelines und den UI/UX-Anspruch?
- Hub-Konsistenz - Liest sie sich als Teil desselben Systems wie die bereits ausgelieferten Hubs?
Das Rubric existiert, weil das Urteil meines ist und wiederholbar sein soll, nicht stimmungsabhängig.
Der Modellpool
Google Flash 3.7 · Claude Opus 5 · Claude Fable 5 · Claude Fable 5.1 · GPT Terra 5.6 · GPT Sol 5.6 · GPT Luna 5.6 · Grok 4.6 · Kimi K3 · GLM 5.2
| Kriterium | Führend |
|---|---|
| Semantische Qualität | Kimi K3, Opus 5 |
| Visuelle Identität | Luna 5.6 - fast immer, meist mit dem ersten Prototyp |
| Hub-Konsistenz | Luna 5.6, Fable 5 |
| Aggregat, kostennormalisiert | Luna 5.6 deutlich vorn · Kimi K3 zweiter · Claude-Modelle dritter |
Nicht das erwartete Ergebnis. Die Frontier-Modelle führen dort, wo das Nachdenken über Beziehungen zählt - aber nicht in der Aufgabe insgesamt, und beim Preis nicht annähernd.
Allgemeine Benchmarks messen Fähigkeiten an Aufgaben, die nicht diese Aufgabe sind. Sechs Durchläufe gegen ein eigenes Rubric sagen mehr über das eigene Problem als jedes Leaderboard.
Grenzen der Aussage. Sechs Durchläufe, eine Aufgabenklasse, eine Markenstimme - eine kleine Stichprobe. Übertragbar ist die Methode, nicht das Ergebnis: der Gewinner ist der Stand dieses Quartals, Modellpreise bewegen sich.
Das Rubric ist das Gegenstück zur Kalibrierung im Metadaten-System: dort ließ sich Qualität auf Regeln reduzieren und die Aufsicht wurde nach drei bis vier Durchläufen entfernt. Hier lässt sie sich nicht auf Regeln reduzieren - der Mensch bleibt, und das Rubric hält ihn konsistent.
Menschliche Rolle
Was menschlich bleibt
- Verantwortung für den Auftrag und die letzte Entscheidung
- Urteilsvermögen: Vergleich, Kritik, Richtung
Agenten führen aus und iterieren; der Mensch entscheidet, wie gut aussieht. Geschätzte Ersparnis: ≥4 volle Arbeitstage (~30+ Stunden) je fertigem viersprachigem Hub - Recherche, Inhalt, Design, Code, responsive Umsetzung, Lokalisierung und Iteration. Das ist eine Schätzung, keine gemessene Zahl.
Verwandt