powered by TechFeed
表示モード
Deep Dive

AIエージェントに任せられるのは実質「1ステップだけ」 — 数式で示す自律性の限界と、人間がループそのものであるべき理由

9月29日、Codemanshipが「The Agentic Sweet Spot? The Human IS The Loop」と題した記事を公開した。AIエージェントへの過信が後退しつつある現状を踏まえ、「人間がループそのものである」という開発スタイルこそが信頼性と速度の最適点だと論じている。

9月29日、Codemanshipが「The Agentic Sweet Spot? The Human IS The Loop」と題した記事を公開した。AIエージェントへの過信が後退しつつある現状を踏まえ、「人間がループそのものである」という開発スタイルこそが信頼性と速度の最適点だと論じている。


エージェント万能論の揺り戻し

ここ数週間、かつてAIエージェントの熱心な支持者だった人々が、ワークフローの制御を自分の手に取り戻す動きが広がっている——筆者はそう観察する。

データもこの流れを裏付けている。METRの調査によれば、エージェントが「自律的に作業できるタスクの長さ(autonomous horizon)」は2019年以降、6〜7ヶ月ごとにほぼ倍増している。ただし、この「倍増」が示すのはあくまで「こなせるタスクの長さ」の拡大であり、「信頼できる」自律性のホライズンは依然として非常に短い。両者は別の指標であり、前者が伸びても後者が伴わなければ、実用上の信頼性は変わらない——というのが記事の重要な前提だ。


Measuring AI Ability to Complete Long Tasks, METR, 2025

つまり、動作の信頼性が求められる場面では、人間がループに留まるどころか、人間がループそのものでなければならない。


「ソフトウェアファクトリー」幻想との決別

「自律ホライズンを延ばすことがAI活用の成熟だ」と説く"ソフトウェアファクトリー"論者(特に人間の介在を極限まで排除した"ダークファクトリー"志向)に対し、筆者は明確に異を唱える。

重要なのは自律性の拡大ではなく、「十分に信頼できるソフトウェアを、より早く、より低コストで出荷できる」スイートスポットを探すことだ。

この視点は、Steve McConnellが論文「Software Quality at Top Speed」で示した「品質と速度には最適点がある」という考え方と重なる。


数式で見る「信頼できる自律ホライズン」

記事の核心は、エージェントに任せられるステップ数に明確な上限があるという主張だ。筆者はそれを次の式で示す。

HQ = ⌊ ln Q / ln R ⌋

  • R:1ステップあたりのエージェントの信頼性
  • Q:出荷時に必要なソフトウェアの信頼性
  • HQ:エラーの累積効果が許容範囲を超える前に、エージェントに任せられる最大ステップ数

筆者が出荷に必要と考える信頼性水準でこの式を解くと、HQ = 1になる。エージェントに連続して任せられるのは実質1ステップのみ。ワークフローの各ステップを人間——Actual Intelligence(AI=Artificial Intelligenceとの対比として筆者が使う表現)——が制御しなければならないという結論だ。

さらに、クリティカルシステムに求められる信頼性レベルでは、HQは事実上ゼロになる。高信頼性ソフトウェアを扱うチームの多くで、コーディングエージェントをコードに直接触れさせないことが現実のポリシーになっている、と筆者は指摘する。


LLMの使いどころ:コードを「直接触らせない」使い方

コーディングエージェントをコードに触れさせないからといって、LLM自体を使わないわけではない。筆者が挙げる現実的な活用例は以下だ。

  • 実装の参考例をLLMに生成させて「どう書けるか」を確認する
  • コードブロックのレビューをさせる
  • コミットメッセージを生成させる

これらは「役には立つが周辺的な用途」であり、エージェントがコードを直接編集することとは明確に区別される。筆者は、エージェントに直接コードを書かせた場合の不具合について「保険でカバーされないだろう」と率直に表現している。これは liability(法的・業務上の責任)の観点からの比喩であり、品質保証の観点で担保できないリスクを負うことへの警句として読める。


「継続的デリバリー」との接続

この議論は継続的デリバリー(Continuous Delivery)の原則とも直結する。Jez HumbleとDavid Farleyが『Continuous Delivery』で体系化したように、「現実からのフィードバックを早く・頻繁に得ることが価値の最大化につながる」という考え方に立てば、ソフトウェアは常に「出荷可能な状態」を保ち続けなければならない。エラーが累積するエージェント任せの長いチェーンは、その条件を破壊する。人間が各ステップで判断を挟み続けることは、速度の妨げではなく、フィードバックループを健全に保つための必要条件だという点で、両者の主張は一致している。


自律性の拡大を追求するのではなく、信頼性と速度のバランスが取れたスイートスポットを見つけること——筆者の主張はシンプルだが、エージェントへの投資判断を迫られる立場には重い問いを投げかけている。

詳細はThe Agentic Sweet Spot? The Human IS The Loopを参照していただきたい。