Knowledge Uplift
+35,8%
Das Hauptexperiment ist ohne Skills vs. mit Skills. Wir messen verpacktes Wissen, nicht welches Labor das neueste Modell geliefert hat.
Knowledge Uplift
+35,8%
Software Throughput
13,6×
Menschliche Intervention
5→0
Primär
Wird ein Agent besser darin, Ruby-Software zu erzeugen, wenn er Ruby-spezifisches Wissen bekommt?
Sekundär
Erzeugt besseres Wissen mehr korrekte Software pro Zeiteinheit?
Ein Support-Posteingang: Tickets, Zuweisung und ein Hotwire-Gesprächsthread.
Ein Prompt. Eine leere Rails-App. Wissen ist die einzige Variable — zuerst keines, dann Skills in Schichten.
Baue einen kleinen Support-Posteingang. Das Team kann Tickets listen, einen Owner zuweisen und in einem Live-Thread antworten.
Vollständiges Skillfile
example/rails-conventionsexample/secure-defaultsexample/request-specsexample/hotwire-uiexample/job-queues| Experiment | Tests | Zeit | Iterationen | Tokens | Mensch | Throughput |
|---|---|---|---|---|---|---|
| Basismodell | 31/44 | 24m | 7 | 184k | 5 | 4,9 |
| + Rails-Konventionen | 36/44 | 20m | 5 | 151k | 3 | 10,2 |
| + Testwissen | 41/44 | 18m | 3 | 126k | 2 | 17,3 |
| Vollständiges Skillfile | 44/44 | 15m | 2 | 103k | 0 | 66,7 |
Nacharbeit ist menschliche Intervention plus extra Iterationen. Das volle Skillfile auf Relay ist auf dieser Skala 13,6× das Basismodell.
Basismodell
+ Rails-Konventionen
+ Testwissen
Vollständiges Skillfile
GPT-5 ohne Ruby Skills
67
GPT-5 + Ruby Skills
91
Knowledge Uplift
+35,8%
| Modell | Ohne Skills | Mit Skills | Uplift |
|---|---|---|---|
|
GPT-5 OpenAI |
67 | 91 | +35,8% |
|
Grok 4.6 Cursor |
64 | 88 | +37,5% |
|
Gemini 2.5 Pro |
58 | 79 | +36,2% |
|
Claude Opus 4.1 Anthropic |
71 | 94 | +32,4% |
|
Claude Sonnet 4 Anthropic |
63 | 84 | +33,3% |
example/query-performance
example/secure-defaults
example/rails-conventions
example/request-specs
example/hotwire-ui
example/request-specs
example/job-queues
example/query-performance
example/rails-conventions
example/hotwire-ui
| # | Modell | Score | Tests | Zeit |
|---|---|---|---|---|
| 1 |
Claude Opus 4.1 |
94 | 42/44 | 18m |
| 2 |
GPT-5 |
91 | 41/44 | 16m |
| 3 |
Grok 4.6 |
88 | 39/44 | 14m |
| 4 |
Claude Sonnet 4 |
84 | 38/44 | 11m |
| 5 |
Gemini 2.5 Pro |
79 | 35/44 | 22m |