powered by TechFeed
表示モード
Google

GoogleがオープンソースにしたRRSI — AIエージェントが自分自身を改善しても過学習しない仕組みとは

9月29日、MarkTechPostが「Google Research Open-Sources RRSI: AI Agents That Improve Their Own Harness Without Overfitting」と題した記事を公開した。この記事では、GoogleとUNC-Chapel Hill・Stanford・Washington University in St. Louisの共同研究による、AIエージェントが自身のハーネスを過学習なしに自律改善するフレームワーク「RRSI(Regularized Recursive Self-Improvement)」のオープンソース公開について詳しく紹介されている。

9月29日、MarkTechPostが「Google Research Open-Sources RRSI: AI Agents That Improve Their Own Harness Without Overfitting」と題した記事を公開した。この記事では、GoogleとUNC-Chapel Hill・Stanford・Washington University in St. Louisの共同研究による、AIエージェントが自身のハーネスを過学習なしに自律改善するフレームワーク「RRSI(Regularized Recursive Self-Improvement)」のオープンソース公開について詳しく紹介されている。


なぜ今この研究が重要か

LLMエージェントを「自律的に改善する」研究は近年急増しているが、多くの手法が同じ落とし穴にはまってきた。評価に使うベンチマークを繰り返し参照するうちに、エージェントがそのタスクだけに最適化されてしまい、未知のタスクへの汎化性能が下がる――いわゆる過学習(overfitting)だ。

RRSIが示す核心的な問いは「自律改善ループに、機械学習の正則化と同等の歯止めをかけられるか」という点にある。evolveスコア(最適化対象ベンチマーク)では競合手法より低くても、未知タスクへのOOD転移スコアで他を上回るという実験結果は、この問いへの一つの実証的な答えだ。ベンチマークゲームではなく、真の汎化を目指す設計思想がRRSIの最大の特徴といえる。


モデルの重みは変えない。「ハーネス」を進化させる

LLMエージェントの性能向上手法として、プロンプトや外部ツールといった「ハーネス」(harness)と呼ばれる周辺設定を自動で改善するアプローチが近年研究されている。ハーネスとは、プロンプト・ツール・メモリ・制御フロー・サブエージェントなど、モデルを動かす仕組み全体を指す言葉だ。

Google Cloud AI Researchらが公開した**RRSI(Regularized Recursive Self-Improvement)**は、このハーネス自体をエージェントに書き換えさせる手法である。モデルの重みは一切変更しない。

問題は、従来の手法がベンチマークに過学習してしまうことだった。改善ループは固定のタスクセットでスコアを評価し続けるため、そのタスクへの最適化が進みすぎる。RRSIの論文はこれを3つの失敗モードとして整理している。

  • ベンチマーク固有フィッティング:特定タスクへの最適化
  • ノイズ追随:評価の揺らぎを実際の改善と誤認
  • 複雑性の蓄積:ハーネスが肥大化して転用性が落ちる

RRSIはこれらに対処するため、改善ループそのものに「正則化」をかける。


正則化の仕組み:提案側と選択側の二重ガード

RRSIの設計は、機械学習の正規化手法(L0/L1/L2)になぞらえて説明できる。

提案(Proposal)側では、3つの制約が働く。

  • アニーリング編集バジェット:序盤は複数の編集をまとめて試せるが、後半は1回の変更に絞られる。コサインスケジュールで調整。L0正則化に対応する。
  • エビデンスに基づくクレジット:候補ごとに「仮説・差分・スコア変化・コスト変化・結果」をレジャー(台帳)に記録。誤った仮説は再提案されない。
  • 構造的探索:改善が停滞すると、まだ手を付けていないコンポーネントにバジェットが移動する。

選択(Selection)側では、採択基準をさらに絞る。

  • リーケージ批判器:タスク名・エンティティ・回答・ベンチマーク固有ロジックがdiffに含まれていれば、スコアリング前に弾く
  • ノイズ調整フロア:変更なしのベースハーネスで計測したばらつきを超える改善でなければ採択しない
  • コストルール:追加推論トークンは計測済みの性能向上で賄えなければならない。L2正則化に対応
  • プルーニング:改善に寄与しなくなったコンポーネントは削除対象になる。L1(Lasso)に対応

数字で見る効果:OOD転移が鍵

Terminal-Bench 2.1では、Claude Opus 4.8(Anthropicが2026年にリリースした上位世代モデル)を使ったスコアが**74.2%→80.2%へ向上した。SWE-bench Verifiedは選択に使っていないにもかかわらず82.0%→83.8%**に上昇した(held-outの6分割すべてで改善)。

Gemini 3.5 Flash(Googleが2026年にリリースした軽量・高速世代モデル)をポリシーとして使った結果も公開されており、Terminal-Bench 2.1が64.6→78.7、SWE-bench Verifiedが76.8→79.0だった。

トークン使用量も削減されている。エージェントワークスペースインスタンスでの1試行あたりのポリシートークンは2.42Mで、正則化なしの進化手法の3.80Mと比較して30〜36%少ない。

競合手法との比較で際立つのはOOD(Out-of-Distribution)転移だ。元記事のTable 1より:

手法 Harvey LAB evolveスコア OOD平均(H0=39.7)
RRSI 90.5 43.6
Meta-Harness 93.0 40.6
AHE 90.7 39.2
TTHE 91.1 38.0
HarnessX 91.8 39.7

表の補足を整理しておく。Harvey LAB evolveスコアは、RRSIの改善ループが最適化対象とするベンチマーク群でのスコアだ。一方、OOD平均は最適化に一切使っていない3つの外部ベンチマーク――JobBench(職務遂行型タスク評価)・GDPval(文書処理・計画立案タスク)・APEX-Agents(マルチステップ推論エージェント評価)――の平均スコアである。H0=39.7はベースライン(改善前のハーネス)のOOD平均を指し、各手法がベースラインから汎化性能を伸ばせているかを測る基準値だ。

evolveスコアではMeta-Harnessが93.0でトップだが、最適化に使っていないJobBench・GDPval・APEX-AgentsのOOD平均ではRRSIだけがH0を1ポイント以上上回っている。他の手法は43.6には届いていない。evolveスコアを下げてでもOOD汎化を取る、という設計上のトレードオフが数字に表れている。


セットアップ

コードはApache 2.0でGitHub公開されており、Python 3.10以上が必要だ。モデルはLiteLLMのモデル文字列をそのまま指定できる。デフォルトはVertex AI上のClaude Opus 4.8。

git clone https://github.com/google-research/rrsi.git && cd rrsi
pip install -e ".[dev]"
python3 rrsi.py --domain coding baseline
python3 rrsi.py --domain coding run

1ラウンドごとに2候補を別々のgit worktreeで生成し、スクリーニング後に評価、スコアが高い方にブランチを進める。コーディングインスタンスはDockerとharborも必要。新しいドメインは単一のアダプターモジュールで追加できる。

なお、これは研究用フレームワークであり、Googleの公式プロダクトではない。


詳細はGoogle Research Open-Sources RRSI: AI Agents That Improve Their Own Harness Without Overfittingを参照していただきたい。