System 03 · KI-Systeme

Semantic Commerce Architecture

Gebaut und über zehn Modelle hinweg evaluiert

In Arbeit

Eine Parent/Child-Hub-Architektur, die Beziehungen zwischen Themen, Materialien, Produkten und redaktionellen Inhalten sichtbar macht - gebaut über konkurrierende Modellprototypen, bewertet gegen ein festes Rubric aus zehn Modellen.

StatusIn Arbeit Aktueller Stand4 live · 1 wird abgeschlossen · 1 als Nächstes Plan12-15 Child-Hubs unter einem Parent

Problem

Commerce-Kataloge verbergen ihre eigene Struktur

Ein Commerce-Katalog zeigt in der Regel Produkte und Collections, aber nicht die Beziehungen zwischen Themen, Materialien, Produktfamilien, Anwendungen und redaktionellen Inhalten. Genau diese Beziehungen nutzen klassische Suche und KI-gestützte Retrieval-Systeme, um zu verstehen, wovon eine Site tatsächlich handelt.

Dieses System gehört zur breiteren Architektur von AI Operations und baut auf dem Katalog der Fallstudie International Commerce Transformation auf.

Architektur

Ein Parent-Hub, geplante Children

Aktueller Stand: 4 live, 1 wird abgeschlossen, 1 als Nächstes. Schema, Brotkrumen und explizite strukturierte Beziehungen sind in Entwicklung.

Die Architektur soll klarere Beziehungen für Suche und KI-gestützte Retrieval-Systeme sichtbar machen. Ob KI-Crawler die Architektur nachweislich bereits verstehen, ist eine offene Frage - ein solcher Anspruch wird hier nicht erhoben.

Workflow

Konkurrierende Prototypen, menschliche Auswahl

Jede Seite entsteht aus vier konkurrierenden Prototypen. Der Modellpool umfasst zehn Modelle: Google Flash 3.7, Claude Opus 5, Claude Fable 5, Claude Fable 5.1, GPT Terra 5.6, GPT Sol 5.6, GPT Luna 5.6, Grok 4.6, Kimi K3 und GLM 5.2, mit Codex stark für Ausführung und Iteration. Die Modelle lesen dasselbe Projekt unterschiedlich - das ist der Punkt: der Mensch vergleicht, wählt und kritisiert, statt ein Modell zu prompten und die erste Antwort zu nehmen.

  • Eingabe
  • Autonome Aktion
  • Urteilsvermögen
  • Ausgabe
Agenten arbeiten aus dem Shopify-Katalog, bestehenden Collections und Artikeln, Keyword- und Suchdaten, der bestehenden Hub-Architektur, Produktbeziehungen sowie Markenregeln und Ton.

Design und Layout bleiben über die Sprachen hinweg konsistent; der Text wird unabhängig für Deutsch, Englisch, Französisch und Spanisch angepasst, mit Respekt vor nativer Suchintention, Terminologie und Keyword-Relevanz - Lokalisierung ist unabhängige Anpassung je Sprache, keine Übersetzung.

Bewertung

Zehn Modelle, ein Rubric

Prototypen werden nicht nach Gefühl ausgewählt. Jede Seite entsteht aus vier konkurrierenden Prototypen bei identischen Inputs, bewertet gegen drei feste Kriterien. Gleiche Inputs, gleiche Bewertenden - die letzte Entscheidung liegt bei mir.

  • Semantische Qualität - Erklärt die Struktur die internen Beziehungen? Und behauptet sie nur Beziehungen, die der Katalog tatsächlich stützt?
  • Visuelle Identität - Hält sie die Brand Guidelines und den UI/UX-Anspruch?
  • Hub-Konsistenz - Liest sie sich als Teil desselben Systems wie die bereits ausgelieferten Hubs?

Das Rubric existiert, weil das Urteil meines ist und wiederholbar sein soll, nicht stimmungsabhängig.

Der Modellpool

Google Flash 3.7 · Claude Opus 5 · Claude Fable 5 · Claude Fable 5.1 · GPT Terra 5.6 · GPT Sol 5.6 · GPT Luna 5.6 · Grok 4.6 · Kimi K3 · GLM 5.2

Sechs Durchläufe, Ergebnisse
Führende Modelle nach Rubric-Kriterium über sechs Durchläufe
Kriterium Führend
Semantische Qualität Kimi K3, Opus 5
Visuelle Identität Luna 5.6 - fast immer, meist mit dem ersten Prototyp
Hub-Konsistenz Luna 5.6, Fable 5
Aggregat, kostennormalisiert Luna 5.6 deutlich vorn · Kimi K3 zweiter · Claude-Modelle dritter

Nicht das erwartete Ergebnis. Die Frontier-Modelle führen dort, wo das Nachdenken über Beziehungen zählt - aber nicht in der Aufgabe insgesamt, und beim Preis nicht annähernd.

Allgemeine Benchmarks messen Fähigkeiten an Aufgaben, die nicht diese Aufgabe sind. Sechs Durchläufe gegen ein eigenes Rubric sagen mehr über das eigene Problem als jedes Leaderboard.

Grenzen der Aussage. Sechs Durchläufe, eine Aufgabenklasse, eine Markenstimme - eine kleine Stichprobe. Übertragbar ist die Methode, nicht das Ergebnis: der Gewinner ist der Stand dieses Quartals, Modellpreise bewegen sich.

Das Rubric ist das Gegenstück zur Kalibrierung im Metadaten-System: dort ließ sich Qualität auf Regeln reduzieren und die Aufsicht wurde nach drei bis vier Durchläufen entfernt. Hier lässt sie sich nicht auf Regeln reduzieren - der Mensch bleibt, und das Rubric hält ihn konsistent.

Menschliche Rolle

Was menschlich bleibt

  • Verantwortung für den Auftrag und die letzte Entscheidung
  • Urteilsvermögen: Vergleich, Kritik, Richtung

Agenten führen aus und iterieren; der Mensch entscheidet, wie gut aussieht. Geschätzte Ersparnis: ≥4 volle Arbeitstage (~30+ Stunden) je fertigem viersprachigem Hub - Recherche, Inhalt, Design, Code, responsive Umsetzung, Lokalisierung und Iteration. Das ist eine Schätzung, keine gemessene Zahl.

Verwandt