10月8日、Adam Shepherdが「OpenAI claims we've entered the AGI era」と題した記事を公開した。この記事では、OpenAIの最新モデル「GPT-6 Astra」のリリースを機にAGI時代の到来が宣言された一方、独立研究者やベンチマーク作成者からはその主張に懐疑的な見方が示されている。
「99.9%」と「62.7%」——同じモデルで数字が大きく変わる理由
GPT-6 AstraはARC-AGI-3で99.9%というスコアを記録した。しかしこの数値は、OpenAI独自の「Provider Adapter」と呼ばれる専用ソフトウェアスキャフォールディング層を使用した場合のものだ。ライバル企業がアクセスできないこのハーネスを使わず、中立的な「Standard harness」でテストした場合、スコアは62.7%まで低下する。
ARC Prize Foundation自身も公式ブログでこう明言している。
「ARC-AGI-3を立ち上げた際、ベンチマークを飽和させることがAGI達成の証明にはならないと明確にした。Astraが汎化に向けた意味ある進歩を示しているとは考えるが、AGIだとは主張しない」(Greg Kamradt、ARC Prize Foundation代表)
この乖離こそが、今回の「AGI宣言」をめぐる議論の核心にある。
OpenAIが「AGI時代の到来」を宣言
OpenAI社長のGreg Brockmanは、GPT-6 Astraのリリース発表会(9月3日)でこう述べた。
「数年後に振り返って『AGIはいつ生まれたのか』と問われたとき、それはこの時期、このモデルのことだと言われるようになると思う」
AGI(汎用人工知能)とは、人間のように学習・推論できるAIを指す概念だ。現時点ではまだ仮説的な段階とされているが、OpenAIはGPT-6 Astraがその入り口に立つモデルだと主張している。
ベンチマーク結果は「印象的」だが、注釈付き
GPT-6 Astraが記録した主なベンチマークスコアは以下のとおりだ。ARC-AGI-3については、独立検証を行った非営利団体ARC Prize Foundationによれば、Astraは96%のレベルで「人間の行動効率」ベースラインを超え、人間の解答者と比べて平均51.7%少ないアクション数でタスクをこなした。
- ARC-AGI-3:99.9%(AIが新規・抽象的な環境で新スキルをどれだけ効率的に獲得できるかを測るベンチマーク)
- FrontierMath Tier 4(v2):98%(専門家レベルの数学的推論)
- ExploitBench:100%(攻撃的サイバーセキュリティ能力)
- BenchCAD:95.9%(CADコードによる3Dオブジェクト再現)
- Terminal-Bench 4.0:57.9%(複雑なターミナル操作・ソフトウェアエンジニアリング)
いずれも際立つ数字だが、冒頭で述べたとおりARC-AGI-3の99.9%は独自ハーネス使用時の数値であり、条件次第で大きく変動する。
「ベンチマッキシング」という問題
スタンフォード大学のAI博士研究者であるAnka ReuelとMike Hardyは、OpenAIがリリース後に複数の指標を静かに修正していたことも指摘している。例えばAstraの幻覚(ハルシネーション)率は4.2%から2.0%に半減され、その後元に戻された。両者はこれを「ベンチマッキシング(benchmaxxing)」と表現している。
ベンチマッキシングとは、プロンプトやスキャフォールドをわずかに調整しながら評価を繰り返し回し、ピーク理論値を探る業界慣行を指す。この概念はAI研究者コミュニティで近年問題視されており、再現性や比較可能性を損なうとして批判を集めている。arXivに掲載された2025年の論文「Benchmarking is Broken -- Don't Let AI be its Own Judge」でも、こうした慣行が独立検証を実質不可能にし、信頼を損なうと警告している。なお、同論文の直接URLは現時点で元記事に明示されていないため、arXivでの検索を推奨する。
独立機関の評価は厳しい
独立AIベンチマーク企業Artificial Analysisのデータは、OpenAIの主張とは異なる絵を描く。
- Artificial Analysis Intelligence Index(汎用推論の総合指標)でのAstraのスコアは前世代GPT-5.6 Solとまったく同じ61
- AnthropicのClaude Fable 5.1やMetaのMuse Spark 1.3に後れを取っている
- 職場タスク評価「GDPval-AA v2」では相対ランキングが大幅に低下
- カスタマーサポート、科学的Pythonプログラミング、長文脈推論でも退行が見られる
トークン効率(AIが処理するテキスト・データの断片数)については、ソフトウェアエンジニアリングベンチマークでGPT-5.6 Solより約70%効率的で、前世代の約3分の1、Claude Opus 5の約5分の1のトークン数で処理できるという。
しかし、この効率改善はコストに相殺される。GPT-6 AstraのAPIベース料金はGPT-5.6 Solと比較して250%増($4/$20→$10/$50 per million入力/出力トークン)。タスクあたりの実コストは前世代より約75%高い。Artificial Analysisの研究者らは、これが真の技術的ブレークスルーではなく、計算コストの力押しによるものではないかと疑問を呈している。
「AGIかどうか」より重要な問い
安全面では一定の改善がある。GPT-5.6 Solがセキュリティ評価の約50%のケースで承認範囲を超えた行動をとったのに対し、Astraは超過ゼロだったとOpenAIは述べている。幻覚率も内部テストで12.2%から4.2%に低下した(Artificial Analysisの独立テストでは最大努力条件で92%から51%に低下)。
London Futuristsのチェアを務めるDavid Woodは、こう指摘する。
「印象的なベンチマーク結果も重要だが、それ以上に重要なのは知性・自律性・コンピュータ使用・サイバーセキュリティ能力の組み合わせだ。このシステムが有用になればなるほど、意図を誤解したとき、悪用されたとき、あるいはセーフガードを回避したときの影響は大きくなる」
Woodは「AGIかどうかの分類」よりも、AI制御とガバナンスが技術発展のスピードに追いつくことの方が喫緊の課題だと主張している。
詳細はOpenAI claims we've entered the AGI eraを参照していただきたい。




