Aumento de conocimiento
+35,8%
El experimento principal es sin skills vs con skills. Medimos conocimiento empaquetado, no qué laboratorio lanzó el último modelo.
Aumento de conocimiento
+35,8%
Software Throughput
13,6×
Intervención humana
5→0
Principal
¿Dar conocimiento específico de Ruby a un agente lo hace mejor produciendo software Ruby?
Secundaria
¿Un mejor conocimiento produce más software correcto por unidad de tiempo?
Bandeja de soporte: tickets, asignación y un hilo de conversación en Hotwire.
Un prompt. Una app Rails vacía. La única variable es el conocimiento — primero ninguno, luego skills por capas.
Construye una bandeja de soporte pequeña. El equipo lista tickets, asigna un responsable y responde en un hilo en vivo.
Full Skillfile
example/rails-conventionsexample/secure-defaultsexample/request-specsexample/hotwire-uiexample/job-queues| Experimento | Tests | Tiempo | Iteraciones | Tokens | Humano | Throughput |
|---|---|---|---|---|---|---|
| Modelo base | 31/44 | 24m | 7 | 184k | 5 | 4,9 |
| + Rails conventions | 36/44 | 20m | 5 | 151k | 3 | 10,2 |
| + Testing knowledge | 41/44 | 18m | 3 | 126k | 2 | 17,3 |
| Full Skillfile | 44/44 | 15m | 2 | 103k | 0 | 66,7 |
El retrabajo es intervención humana más iteraciones extra. El Full Skillfile en Relay es 13,6× el modelo base en esta escala.
Modelo base
+ Rails conventions
+ Testing knowledge
Full Skillfile
GPT-5 sin Ruby Skills
67
GPT-5 + Ruby Skills
91
Aumento de conocimiento
+35,8%
| Modelo | Sin skills | Con skills | Aumento |
|---|---|---|---|
|
GPT-5 OpenAI |
67 | 91 | +35,8% |
|
Grok 4.6 Cursor |
64 | 88 | +37,5% |
|
Gemini 2.5 Pro |
58 | 79 | +36,2% |
|
Claude Opus 4.1 Anthropic |
71 | 94 | +32,4% |
|
Claude Sonnet 4 Anthropic |
63 | 84 | +33,3% |
example/query-performance
example/secure-defaults
example/rails-conventions
example/request-specs
example/hotwire-ui
example/request-specs
example/job-queues
example/query-performance
example/rails-conventions
example/hotwire-ui
| # | Modelo | Puntuación | Tests | Tiempo |
|---|---|---|---|---|
| 1 |
Claude Opus 4.1 |
94 | 42/44 | 18m |
| 2 |
GPT-5 |
91 | 41/44 | 16m |
| 3 |
Grok 4.6 |
88 | 39/44 | 14m |
| 4 |
Claude Sonnet 4 |
84 | 38/44 | 11m |
| 5 |
Gemini 2.5 Pro |
79 | 35/44 | 22m |