Benchmarks

El experimento principal es sin skills vs con skills. Medimos conocimiento empaquetado, no qué laboratorio lanzó el último modelo.

Estadísticas del catálogo

Aumento de conocimiento

+35,8%

Software Throughput

13,6×

Intervención humana

5→0

Principal

¿Dar conocimiento específico de Ruby a un agente lo hace mejor produciendo software Ruby?

Secundaria

¿Un mejor conocimiento produce más software correcto por unidad de tiempo?

Relay

relay.example · la misma app en cada ejecución

Bandeja de soporte: tickets, asignación y un hilo de conversación en Hotwire.

  • Rails 8.1
  • Hotwire
  • PostgreSQL
  • RSpec

Protocolo

Ejecución de ejemplo · agosto de 2026 · GPT-5 en Relay

Un prompt. Una app Rails vacía. La única variable es el conocimiento — primero ninguno, luego skills por capas.

Construye una bandeja de soporte pequeña. El equipo lista tickets, asigna un responsable y responde en un hilo en vivo.

Full Skillfile

  • example/rails-conventions
  • example/secure-defaults
  • example/request-specs
  • example/hotwire-ui
  • example/job-queues

Sin skills vs con skills

Ablation en GPT-5. Cifras ilustrativas, no un laboratorio en vivo.

Experimento Tests Tiempo Iteraciones Tokens Humano Throughput
Modelo base 31/44 24m 7 184k 5 4,9
+ Rails conventions 36/44 20m 5 151k 3 10,2
+ Testing knowledge 41/44 18m 3 126k 2 17,3
Full Skillfile 44/44 15m 2 103k 0 66,7