powered by TechFeed
表示モード
Deep Dive

AIが画像を「見て推論する」能力、人間93%に対しトップモデルは53% — Scale AIが公開した視覚推論ベンチマークが示す現在地

10月8日、Ryan Marketが「Scale AI releases visual-reasoning benchmark where top model scores 53.6%」と題した記事を公開した。Scale AIと視覚AI専門スタートアップElorianが共同で開発した視覚推論ベンチマーク「Humanity's Sixth Sense(HSS)」では、25モデル中トップのGPT-6-astra(OpenAIが2026年にリリースした最新フラッグシップモデル)が53.6%を記録した一方、人間参加者は93.1%をマークした。この約40ポイントのギャップは、現在の視覚言語モデルが抱える根本的な限界を鮮明に映し出している。

10月8日、Ryan Marketが「Scale AI releases visual-reasoning benchmark where top model scores 53.6%」と題した記事を公開した。Scale AIと視覚AI専門スタートアップElorianが共同で開発した視覚推論ベンチマーク「Humanity's Sixth Sense(HSS)」では、25モデル中トップのGPT-6-astra(OpenAIが2026年にリリースした最新フラッグシップモデル)が53.6%を記録した一方、人間参加者は93.1%をマークした。この約40ポイントのギャップは、現在の視覚言語モデルが抱える根本的な限界を鮮明に映し出している。


トップモデルでも53.6%、人間は93.1%

Scale AIとElorianは2026年10月7日、Humanity's Sixth Sense(HSS)と名付けた視覚推論ベンチマークを公開した。

25モデルを対象にテストしたところ、**トップモデルのGPT-6-astraが53.6%、25モデルの中央値は30.9%。一方、同じ自由記述形式で回答した20名の人間参加者のスコアは93.1%**だった。この差は、現状の視覚言語モデルの根本的な弱点を数字で示している。

HSSが測るのは、画像や動画を見て「明示されていない情報を推論する」能力だ。たとえば「なぜその人物は走った後に速度を落としたか」「車がその駐車スペースに収まるか」「部分的に隠れたパターンが何を示すか」といった問いに、モデルは自由記述で回答する。多肢選択式ではないため、消去法での正解が効かない設計になっている。

HSSは既存の視覚ベンチマーク群——たとえばOpenAIが難問として知られるMMMUや、動画理解を測るVideo-MME——と比較して、「消去法が通用しない自由記述形式」かつ「知覚と推論の両方を同時に要求する」点で一線を画している。既存のベンチマークでGPT-4レベルのモデルが70〜80%台を記録しているのに対し、HSSでのトップスコアが53.6%にとどまることは、評価の難度と設計上の差異を端的に示している。※編集部の考察


ベンチマークの中身

HSSは288枚の画像と234本の動画(合計17.6時間)をベースに、522問のオープンエンド課題で構成されている。Scale AIによれば、3,466問を作成し、3回の独立したレビューを経て522問に絞り込んだという。

問いは以下の4カテゴリに分類される(カテゴリ名は元記事の英語表記に基づき編集部が翻訳):

  • 時系列・因果ダイナミクス:ある行動が何を引き起こしたか
  • 物理・空間ロジック:物体の位置関係や空間的な整合性
  • 社会的理解:人物の意図や感情の読み取り
  • 抽象・文脈推論:文脈から意味を導く

採点はLLMベースの自動判定システムが担う。3社のベンダーからジャッジを使って5モデルを再採点したところ、95%以上の一致率でランキングが保たれたとScaleは報告している。

データセットはHugging Face上でMITライセンスで公開されており、リーダーボードもlabs.scale.comで確認できる。


「推論時間を増やしても解決しない」

エラー分析の結果が興味深い。8,573件のモデル失敗例を調べると、94%が「知覚」または「潜在的推論」の失敗、5%が論理エラーだった。つまり、画像や映像から何かを読み取る段階でほぼ詰まっている。

25モデル中21モデルで最も弱かったのが社会的理解タスクで、23モデルで静止画より動画の方が平均7.3ポイント低かった。

注目すべきは、「推論トークンを増やせばスコアが上がるか」という点だ。モデルはタスクあたり平均約4,000の推論トークンを使用したが、GPT-6-astraは一部のサブドメインでより多くのトークンを費やした結果、スコアが下がった。追加の思考時間が視覚的な知覚ミスを修正できるとは限らないことを示している。


ツール使用の効果は限定的

Scale AIはClaude CodeとCodex内でモデルをテストし、画像のクロップ・ズーム・ウェブ検索・メディアの再サンプリングといったツールを使わせた。388問のサブセットで最良のセットアップが**59.3%**を記録した(ただし全体の53.6%とは対象問題が異なる)。

視覚的な見落としによるエラーは減少した一方で、2次元の重なりを3次元的な整合と誤解するエラーは102件から101件にほぼ変化なしだった。知覚レベルの根本的な誤りはツール追加では解消できていない。


ElorianとScale AIの狙い

HSSの共同開発者であるElorianは、「現在の視覚言語モデルは画像をテキストに変換してから推論しており、空間・関係タスクには脆弱だ」という立場を取る視覚AI専門のスタートアップだ。共同創業者のAndrew DaiはGoogle BrainとDeepMindでGeminiのデータ領域を主導し、PaLM 2の事前学習を共同でリードした経歴を持つ。もう一人の共同創業者Yinfei YangはAppleとGoogleでマルチモーダル研究を手がけている。ElorianはStriker Ventures、Menlo Ventures、Altimeter、NVIDIA、49 Palmsなどから5,500万ドルを調達済みだ。

Scale自身も制約を明示している。タスク数は522問と限定的であり、学習データへの事前露出は排除できず、人物の意図に関する問いの正解は「客観的な事実」ではなくアノテーターの判断との一致で測られる。ベンチマーク上のスコア改善が実世界にどう転移するかは、今後の課題として残る。


詳細はScale AI releases visual-reasoning benchmark where top model scores 53.6%を参照していただきたい。