Benchmarks

Das Hauptexperiment ist ohne Skills vs. mit Skills. Wir messen verpacktes Wissen, nicht welches Labor das neueste Modell geliefert hat.

Katalog-Stats

Knowledge Uplift

+35,8%

Software Throughput

13,6×

Menschliche Intervention

5→0

Primär

Wird ein Agent besser darin, Ruby-Software zu erzeugen, wenn er Ruby-spezifisches Wissen bekommt?

Sekundär

Erzeugt besseres Wissen mehr korrekte Software pro Zeiteinheit?

Relay

relay.example · dieselbe App, jeder Lauf

Ein Support-Posteingang: Tickets, Zuweisung und ein Hotwire-Gesprächsthread.

  • Rails 8.1
  • Hotwire
  • PostgreSQL
  • RSpec

Protokoll

Beispiel-Lauf · August 2026 · GPT-5 auf Relay

Ein Prompt. Eine leere Rails-App. Wissen ist die einzige Variable — zuerst keines, dann Skills in Schichten.

Baue einen kleinen Support-Posteingang. Das Team kann Tickets listen, einen Owner zuweisen und in einem Live-Thread antworten.

Vollständiges Skillfile

  • example/rails-conventions
  • example/secure-defaults
  • example/request-specs
  • example/hotwire-ui
  • example/job-queues

Ohne Skills vs. mit Skills

Ablation auf GPT-5. Illustrative Zahlen, kein Live-Labor.

Experiment Tests Zeit Iterationen Tokens Mensch Throughput
Basismodell 31/44 24m 7 184k 5 4,9
+ Rails-Konventionen 36/44 20m 5 151k 3 10,2
+ Testwissen 41/44 18m 3 126k 2 17,3
Vollständiges Skillfile 44/44 15m 2 103k 0 66,7