9月29日、MarkTechPostが「Google Research Open-Sources RRSI: AI Agents That Improve Their Own Harness Without Overfitting」と題した記事を公開した。この記事では、GoogleとUNC-Chapel Hill・Stanford・Washington University in St. Louisの共同研究による、AIエージェントが自身のハーネスを過学習なしに自律改善するフレームワーク「RRSI(Regularized Recursive Self-Improvement)」のオープンソース公開について詳しく紹介されている。
なぜ今この研究が重要か
LLMエージェントを「自律的に改善する」研究は近年急増しているが、多くの手法が同じ落とし穴にはまってきた。評価に使うベンチマークを繰り返し参照するうちに、エージェントがそのタスクだけに最適化されてしまい、未知のタスクへの汎化性能が下がる――いわゆる過学習(overfitting)だ。
RRSIが示す核心的な問いは「自律改善ループに、機械学習の正則化と同等の歯止めをかけられるか」という点にある。evolveスコア(最適化対象ベンチマーク)では競合手法より低くても、未知タスクへのOOD転移スコアで他を上回るという実験結果は、この問いへの一つの実証的な答えだ。ベンチマークゲームではなく、真の汎化を目指す設計思想がRRSIの最大の特徴といえる。
モデルの重みは変えない。「ハーネス」を進化させる
LLMエージェントの性能向上手法として、プロンプトや外部ツールといった「ハーネス」(harness)と呼ばれる周辺設定を自動で改善するアプローチが近年研究されている。ハーネスとは、プロンプト・ツール・メモリ・制御フロー・サブエージェントなど、モデルを動かす仕組み全体を指す言葉だ。
Google Cloud AI Researchらが公開した**RRSI(Regularized Recursive Self-Improvement)**は、このハーネス自体をエージェントに書き換えさせる手法である。モデルの重みは一切変更しない。
問題は、従来の手法がベンチマークに過学習してしまうことだった。改善ループは固定のタスクセットでスコアを評価し続けるため、そのタスクへの最適化が進みすぎる。RRSIの論文はこれを3つの失敗モードとして整理している。
- ベンチマーク固有フィッティング:特定タスクへの最適化
- ノイズ追随:評価の揺らぎを実際の改善と誤認
- 複雑性の蓄積:ハーネスが肥大化して転用性が落ちる
RRSIはこれらに対処するため、改善ループそのものに「正則化」をかける。
正則化の仕組み:提案側と選択側の二重ガード
RRSIの設計は、機械学習の正規化手法(L0/L1/L2)になぞらえて説明できる。
提案(Proposal)側では、3つの制約が働く。
- アニーリング編集バジェット:序盤は複数の編集をまとめて試せるが、後半は1回の変更に絞られる。コサインスケジュールで調整。L0正則化に対応する。
- エビデンスに基づくクレジット:候補ごとに「仮説・差分・スコア変化・コスト変化・結果」をレジャー(台帳)に記録。誤った仮説は再提案されない。
- 構造的探索:改善が停滞すると、まだ手を付けていないコンポーネントにバジェットが移動する。
選択(Selection)側では、採択基準をさらに絞る。
- リーケージ批判器:タスク名・エンティティ・回答・ベンチマーク固有ロジックがdiffに含まれていれば、スコアリング前に弾く
- ノイズ調整フロア:変更なしのベースハーネスで計測したばらつきを超える改善でなければ採択しない
- コストルール:追加推論トークンは計測済みの性能向上で賄えなければならない。L2正則化に対応
- プルーニング:改善に寄与しなくなったコンポーネントは削除対象になる。L1(Lasso)に対応
数字で見る効果:OOD転移が鍵
Terminal-Bench 2.1では、Claude Opus 4.8(Anthropicが2026年にリリースした上位世代モデル)を使ったスコアが**74.2%→80.2%へ向上した。SWE-bench Verifiedは選択に使っていないにもかかわらず82.0%→83.8%**に上昇した(held-outの6分割すべてで改善)。
Gemini 3.5 Flash(Googleが2026年にリリースした軽量・高速世代モデル)をポリシーとして使った結果も公開されており、Terminal-Bench 2.1が64.6→78.7、SWE-bench Verifiedが76.8→79.0だった。
トークン使用量も削減されている。エージェントワークスペースインスタンスでの1試行あたりのポリシートークンは2.42Mで、正則化なしの進化手法の3.80Mと比較して30〜36%少ない。
競合手法との比較で際立つのはOOD(Out-of-Distribution)転移だ。元記事のTable 1より:
| 手法 | Harvey LAB evolveスコア | OOD平均(H0=39.7) |
|---|---|---|
| RRSI | 90.5 | 43.6 |
| Meta-Harness | 93.0 | 40.6 |
| AHE | 90.7 | 39.2 |
| TTHE | 91.1 | 38.0 |
| HarnessX | 91.8 | 39.7 |
表の補足を整理しておく。Harvey LAB evolveスコアは、RRSIの改善ループが最適化対象とするベンチマーク群でのスコアだ。一方、OOD平均は最適化に一切使っていない3つの外部ベンチマーク――JobBench(職務遂行型タスク評価)・GDPval(文書処理・計画立案タスク)・APEX-Agents(マルチステップ推論エージェント評価)――の平均スコアである。H0=39.7はベースライン(改善前のハーネス)のOOD平均を指し、各手法がベースラインから汎化性能を伸ばせているかを測る基準値だ。
evolveスコアではMeta-Harnessが93.0でトップだが、最適化に使っていないJobBench・GDPval・APEX-AgentsのOOD平均ではRRSIだけがH0を1ポイント以上上回っている。他の手法は43.6には届いていない。evolveスコアを下げてでもOOD汎化を取る、という設計上のトレードオフが数字に表れている。
セットアップ
コードはApache 2.0でGitHub公開されており、Python 3.10以上が必要だ。モデルはLiteLLMのモデル文字列をそのまま指定できる。デフォルトはVertex AI上のClaude Opus 4.8。
git clone https://github.com/google-research/rrsi.git && cd rrsi
pip install -e ".[dev]"
python3 rrsi.py --domain coding baseline
python3 rrsi.py --domain coding run
1ラウンドごとに2候補を別々のgit worktreeで生成し、スクリーニング後に評価、スコアが高い方にブランチを進める。コーディングインスタンスはDockerとharborも必要。新しいドメインは単一のアダプターモジュールで追加できる。
なお、これは研究用フレームワークであり、Googleの公式プロダクトではない。
詳細はGoogle Research Open-Sources RRSI: AI Agents That Improve Their Own Harness Without Overfittingを参照していただきたい。




