知識の向上
+35.8%
主実験はスキルなし対スキルありです。測るのはパッケージ化された知識であり、どのラボが最新モデルを出したかではありません。
知識の向上
+35.8%
Software Throughput
13.6×
人手の介入
5→0
主仮説
Ruby固有の知識をエージェントに与えると、Rubyソフトウェアの品質は上がるか。
副仮説
より良い知識は、単位時間あたりにより正しいソフトウェアを生むか。
サポート受信箱:チケット、担当割り当て、Hotwireの会話スレッド。
プロンプトは1つ。空のRailsアプリも1つ。変数は知識だけ — 最初はなし、次にスキルを層ごとに追加。
小さなサポート受信箱を作ってください。スタッフはチケット一覧、担当割り当て、ライブスレッドでの返信ができます。
Full Skillfile
example/rails-conventionsexample/secure-defaultsexample/request-specsexample/hotwire-uiexample/job-queues| 実験 | テスト | 時間 | 反復 | トークン | 人手 | Throughput |
|---|---|---|---|---|---|---|
| ベースモデル | 31/44 | 24分 | 7 | 184k | 5 | 4.9 |
| + Rails conventions | 36/44 | 20分 | 5 | 151k | 3 | 10.2 |
| + Testing knowledge | 41/44 | 18分 | 3 | 126k | 2 | 17.3 |
| Full Skillfile | 44/44 | 15分 | 2 | 103k | 0 | 66.7 |
手戻りは人手の介入と余分な反復です。Relay上のFull Skillfileは、この尺度でベースモデルの 13.6 倍です。
ベースモデル
+ Rails conventions
+ Testing knowledge
Full Skillfile
Ruby SkillsなしのGPT-5
67
GPT-5 + Ruby Skills
91
知識の向上
+35.8%
| モデル | スキルなし | スキルあり | 向上 |
|---|---|---|---|
|
GPT-5 OpenAI |
67 | 91 | +35.8% |
|
Grok 4.6 Cursor |
64 | 88 | +37.5% |
|
Gemini 2.5 Pro |
58 | 79 | +36.2% |
|
Claude Opus 4.1 Anthropic |
71 | 94 | +32.4% |
|
Claude Sonnet 4 Anthropic |
63 | 84 | +33.3% |
example/query-performance
example/secure-defaults
example/rails-conventions
example/request-specs
example/hotwire-ui
example/request-specs
example/job-queues
example/query-performance
example/rails-conventions
example/hotwire-ui
| # | モデル | スコア | テスト | 時間 |
|---|---|---|---|---|
| 1 |
Claude Opus 4.1 |
94 | 42/44 | 18m |
| 2 |
GPT-5 |
91 | 41/44 | 16m |
| 3 |
Grok 4.6 |
88 | 39/44 | 14m |
| 4 |
Claude Sonnet 4 |
84 | 38/44 | 11m |
| 5 |
Gemini 2.5 Pro |
79 | 35/44 | 22m |