powered by TechFeed
表示モード
Deep Dive

AI専門家の予測は5〜10年単位で外れ続けた — 数学オリンピック金メダル達成もAI企業の収益も、「プロの見立て」を現実が次々と追い越す

9月25日、The Decoderが「Top AI experts badly underestimated how fast the field is moving, study finds」と題した記事を公開した。AI分野のトップ専門家たちが技術進歩の速度を一貫して大幅に過小評価していたことを示す調査結果で、その乖離は数学オリンピックの金メダル達成では5〜10年、AI企業の収益予測では4倍以上に及ぶ。

9月25日、The Decoderが「Top AI experts badly underestimated how fast the field is moving, study finds」と題した記事を公開した。AI分野のトップ専門家たちが技術進歩の速度を一貫して大幅に過小評価していたことを示す調査結果で、その乖離は数学オリンピックの金メダル達成では5〜10年、AI企業の収益予測では4倍以上に及ぶ。


専門家たちの予測は、ことごとく現実に追い越された

予測精度の研究機関であるForecasting Research Institute(FRI)は、2022年半ばからAIの進歩に関する予測データを継続的に収集してきた。調査対象の「LEAP(Longitudinal Expert AI Panel)」第一弾には339名の専門家が参加。内訳はコンピュータ科学者76名、業界専門家76名、エコノミスト68名、AI政策専門家119名で、コンピュータ科学者のうち30名はトップ20機関の教授、10名はAI分野の被引用数上位200名に入る研究者だ。

加えて、「スーパーフォーキャスター」と呼ばれる汎用予測者グループも含まれる。これはPhilip Tetlockの大規模予測研究(Good Judgment Project)から生まれた概念で、専門知識ではなく予測手法の精度において実績を積み重ねた人々を指す。ドメイン知識の深さよりも「正しく更新する力」に長けた集団として、専門家との比較対象として機能している。

今回FRIが発表した中間レポートの核心は、「専門家もスーパーフォーキャスターも、AIの進歩を系統的に過小評価してきた」という事実だ。そして驚くべきは、予測精度で鍛えられたはずのスーパーフォーキャスターでさえ、この傾向を免れなかった点である。


最大のミス:数学オリンピックと生物学

最も乖離が大きかったのが数学ベンチマークだ。

AIは2025年7月、国際数学オリンピック(IMO)で金メダル相当の成績を達成した。ところが専門家の中央値予測では「2030年」、スーパーフォーキャスターに至っては「2035年」と見ていた。つまり5〜10年早く現実が予測を追い越したことになる。


専門家は実際に起きたベンチマーク結果に平均24.6%の確率を割り当てており、スーパーフォーキャスターはわずか9.7%。数学オリンピックの金メダル級達成に限ると、それぞれ8.6%と2.3%まで落ちる。(出典:Forecasting Research Institute)

確率の低さが物語るのは、単なる時期の読み違えではなく、「そもそもこの水準の達成はありえない」に近い認識だったということだ。数学オリンピックの金メダルはAI研究者にとっても長らく「人間固有の高度知性の証明」と見なされてきた領域であり、その突破が想定より一桁早く訪れたことは、専門家自身の認知的前提を揺さぶるものだった。

ウイルス学の能力評価でも同様の構図だ。専門家は「AIがトップウイルス学者チームに匹敵するのは2030年」と予測し、スーパーフォーキャスターは「2034年」と見ていた。FRIは、これが2025年4月の時点で既に達成されていた可能性が高いと報告している。


ウイルス学能力テストでのAI達成時期について、専門家の中央値予測は2030年、スーパーフォーキャスターは2034年だったが、FRIは2025年4月に達成済みとしている。(出典:Forecasting Research Institute)


経済規模の予測も一桁外れた

能力面での過小評価は、経済規模の予測にもそのまま波及した。2026年末時点でのAI企業の最大年間経常収益(ARR)について、専門家の中央値は200億ドル、エコノミストは160億ドル、スーパーフォーキャスターでも250億ドルと見ていた。

現実には、Anthropicの2026年9月時点の年換算収益は約1,000億ドルに達したとFRIは指摘する。最も楽観的なグループであるスーパーフォーキャスターの予測値(250億ドル)でさえ、実際の4分の1以下だった。


AnthropicとOpenAIの年換算収益(左)は、全調査グループの中央値予測(右)を大幅に上回った。最高グループの中央値予測である250億ドルでも、2026年7月に報告された650億ドルには遠く及ばない。(出典:Forecasting Research Institute)

技術的ブレークスルーと市場成長が連動して加速するという構造を、エコノミストを含む専門家グループが揃って読み切れなかった。能力予測の保守性が、そのまま市場規模予測の保守性にも転写された格好だ。


過小評価だけではない:過大評価のケースも

ここで重要な留保を加えておく必要がある。すべての予測が低すぎたわけではなく、過大評価に終わった事例も存在する。これは本調査の信頼性を担保するうえで無視できない事実だ。

自動運転タクシーについては、専門家の中央値が「2027年時点で米国のライドヘイリング全体の7.3%が自動運転」と予測したのに対し、LLMによる予測では2.5%にとどまるとされており、こちらは過大評価の可能性がある。

生物安全分野でも逆の結果が出た。AIを使った生物実験タスクの完了率について専門家は22.5%、ウイルス学者は40%と予測したが、実際の試験では**5.2%**(インターネット単独では6.6%)という結果になった。AIはここでは有意な差をもたらさず、生物安全リスクの観点からはむしろ楽観的すぎた予測だったことになる。ただしサンプルサイズは小さく、この領域については引き続き慎重な解釈が求められる。

過小評価が目立つ全体像の中で、こうした「期待を下回った事例」が存在することは、AIの進歩がすべての領域で均一に加速しているわけではないことを示している。どの能力が、どのような条件下で急伸するかの見極めこそ、今後の予測研究に残された核心的な問いだ。


専門家の将来観は上方修正されつつある

予測が外れた経験を踏まえてか、両調査を完了した参加者の間で期待値は上昇している。AIが「世紀の技術」(電力に匹敵する影響力)になる確率について、専門家グループは9ヶ月間で**31%→36%、スーパーフォーキャスターは28%→35%**に引き上げた。


専門家・スーパーフォーキャスター共に、9ヶ月前より大きな社会的影響をAIに期待するようになっている。(出典:Forecasting Research Institute)

この上方修正は、予測者たちが自らの誤りから学習しつつあることを示す一方、それでもなお過去の外れ幅と比べると小幅な修正にとどまっているとも読める。「驚き」を経験した後も、根本的な認知フレームの更新には時間がかかるということかもしれない。


調査自体の限界も認めている

FRIは自らのデータの偏りも明示している。過小評価は現実が予測を追い越した時点で即座に判明するが、過大評価は期限が来るまで見えない。そのため、この中間報告は構造的に「予測が慎重すぎた事例」を見つけやすい設計になっている。また一部のFRI評価は、元の予測者が持っていなかった情報を利用したLLM予測に依存している点も留意が必要だ。

今後FRIは、2040年までの急速な進歩を想定するサブグループの予測を強調し、LLMによる予測をリアルタイムで人間の予測と並列公開していく方針だ。ForecastBenchによれば、一部のモデルは特定の質問タイプですでにスーパーフォーキャスターに匹敵する精度を持つという。


詳細はTop AI experts badly underestimated how fast the field is moving, study findsを参照していただきたい。