ベンチマーク

主実験はスキルなし対スキルありです。測るのはパッケージ化された知識であり、どのラボが最新モデルを出したかではありません。

カタログ統計

知識の向上

+35.8%

Software Throughput

13.6×

人手の介入

5→0

主仮説

Ruby固有の知識をエージェントに与えると、Rubyソフトウェアの品質は上がるか。

副仮説

より良い知識は、単位時間あたりにより正しいソフトウェアを生むか。

Relay

relay.example · 毎回同じアプリ

サポート受信箱:チケット、担当割り当て、Hotwireの会話スレッド。

  • Rails 8.1
  • Hotwire
  • PostgreSQL
  • RSpec

プロトコル

サンプル実行 · 2026年8月 · Relay上のGPT-5

プロンプトは1つ。空のRailsアプリも1つ。変数は知識だけ — 最初はなし、次にスキルを層ごとに追加。

小さなサポート受信箱を作ってください。スタッフはチケット一覧、担当割り当て、ライブスレッドでの返信ができます。

Full Skillfile

  • example/rails-conventions
  • example/secure-defaults
  • example/request-specs
  • example/hotwire-ui
  • example/job-queues

スキルなし対スキルあり

GPT-5でのアブレーション。実ラボではなく、説明用の数値です。

実験 テスト 時間 反復 トークン 人手 Throughput
ベースモデル 31/44 24分 7 184k 5 4.9
+ Rails conventions 36/44 20分 5 151k 3 10.2
+ Testing knowledge 41/44 18分 3 126k 2 17.3
Full Skillfile 44/44 15分 2 103k 0 66.7