powered by TechFeed
表示モード
Google

自己改善AIが「テストの丸暗記」に陥る問題をGoogleが解決 — 訓練スコアより汎化性能を優先する設計で未知タスクの全ベースラインを上回る

10月4日、The Decoderが「Google researchers find a way to keep self-improving AI agents from memorizing their tests」と題した記事を公開した。この記事では、自己改善型AIエージェントがテストタスクを「丸暗記」してしまう問題を、Googleの研究者がRRSIという手法で解決したことについて詳しく紹介されている。

10月4日、The Decoderが「Google researchers find a way to keep self-improving AI agents from memorizing their tests」と題した記事を公開した。この記事では、自己改善型AIエージェントがテストタスクを「丸暗記」してしまう問題を、Googleの研究者がRRSIという手法で解決したことについて詳しく紹介されている。


「自己改善」の落とし穴——スコアは上がるが汎化しない

AIエージェントの性能は、モデル本体だけでなく「ハーネス」と呼ばれる実行環境の設計に大きく左右される。ハーネスとは、エージェントがどのファイルを読むか、ミスからどう回復するか、結果をどう返すかといった動作制御の仕組みのことだ。論文によれば、近年のエージェント性能向上の多くは、新しいモデルではなくハーネスの改善によってもたらされているという。

近年はこのハーネスをLLMに自動で書き換えさせる「再帰的自己改善(Recursive Self-Improvement)」が注目されている。システムがフィードバックを受け取り、それをもとにハーネスを何度も更新していく仕組みだ。

しかし、この自動化には深刻な問題がある。同じテストタスクを繰り返し使うことで、エージェントがタスクを丸暗記してしまうのだ。訓練タスクのスコアは上がり続ける一方、未知のタスクへの汎化性能は伸び悩むか、むしろ低下する。具体的には以下のような形で過学習が起きる:

  • 特定ベンチマークにしか通用しないパターンを記憶する
  • 偶然スコアが高い候補を優先してしまう
  • テストスコアを上げるだけの不要な複雑さを積み重ねる

RRSI——2つの制約で汎化性能を守る

Googleの研究チームが提案したのが RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)だ。ハーネスを自由に編集しながら、過学習を防ぐ仕組みを最適化ループの両端に組み込んでいる。

変更提案フェーズでは、1ラウンドあたりに提案できる独立した編集の数を「バジェット」として上限設定する。このバジェットはラウンドが進むにつれて段階的に縮小される。初期ラウンドは大きな書き換えを許容するが、後半になるほど結果と明確に対応付けられる小さな変更しか認めなくなる。また、過去の失敗した試みを記録しておき、同じ方向に無駄なコストをかけないようにする。改善が止まったときは、まだ手をつけていないハーネスの部分をあえて試す。

変更採用フェーズでは、批評モデルがすべての提案をレビューし、タスク名や解法など特定ベンチマークへの依存をハードコードしたものを除外する。計算コストの増加は測定可能な性能向上が伴う場合のみ許可され、効果のなくなったコンポーネントは削除される。


実験結果——訓練スコアを犠牲にして汎化を得る

実験はコーディング、オフィス業務、エンジニアリング設計の8つのベンチマークで実施された。ベースモデルはClaude Opus 4.8で固定し、既存の4種類の最適化手法と比較した。

結果は以下の通りだ:

  • 訓練タスクで最大14.1ポイント向上
  • 未知の5つのベンチマークで最大4.7ポイント向上(最大の改善はJobBenchで4.7ポイント)
  • 未正則化版と比べてランタイムのトークン使用量が約30%削減
  • 未知のベンチマークでベースラインを下回ったケースはゼロ

比較した他の手法はいずれも訓練タスクで高スコアを出したが、未知タスクでは2手法がベースラインを下回った。RRSIは訓練タスクでの改善幅が最も小さかったが、未知タスクでの改善ではすべての手法を上回った。このトレードオフは意図的な設計によるものだ。

さらに興味深い結果もある。Gemini 3.5 FlashでRRSIを用いて最適化したコーディングハーネスを、より小型のGemini 3.1 Flash Liteにそのまま適用したところ、精度が11.2ポイントから14.6ポイントへ向上した。ハーネスで発見されたメカニズムは、それを発見したモデルの能力に依存しないということを示している。


関連動向

ハーネスの汎化問題は以前から指摘されており、ARC-AGI-3のテストでは、手動設計のハーネスを使ったClaude Opus 4.6が慣れ親しんだ環境で97.1%を記録した一方、未知の環境では0%という極端な結果が出ている。このケースはRRSIが取り組む問題の深刻さを端的に示しており、汎化を設計の中心に据えるアプローチの意義を裏付けている。

類似アプローチとして、Nvidiaはコーディングエージェントのハーネスをリサーチエージェントが自動再構築するSoL-Piを発表しており、トークン使用量を最大49%削減しつつ性能を維持している。Google DeepMindも、エージェントに過去の検索実行を「夢想」させて戦略を改善するDream-RSIを発表している。RRSIがループ内の正則化で過学習を抑える設計なのに対し、これらは探索戦略や構造再設計に重点を置いており、アプローチの切り口が異なる点は注目に値する。

RRSIの論文はarXivで公開されており、コードはGitHubでも参照できる。


詳細はGoogle researchers find a way to keep self-improving AI agents from memorizing their testsを参照していただきたい。