powered by TechFeed
表示モード
Deep Dive

AIは「民意」を代替できない — Pew Research Centerの実験で判明した「ステレオタイプ増幅」「モデル依存」という構造的欠陥と、平均12.4ポイントの誤差

9月30日、Pew Research Centerが「Can AI Stand In for Human Survey-Takers? Not Really」と題した記事を公開した。実際の回答者の代わりにAIに世論調査を回答させる「合成調査(Synthetic survey)」の精度を定量的に検証した実験の結果を報告したものだ。結論は現時点では「厳格な人間調査の代替にならない」という明確な否定——ただし「Not Really」というタイトルが示すように、完全な否定ではなく、現時点での限界を示すものとして読む必要がある。

9月30日、Pew Research Centerが「Can AI Stand In for Human Survey-Takers? Not Really」と題した記事を公開した。実際の回答者の代わりにAIに世論調査を回答させる「合成調査(Synthetic survey)」の精度を定量的に検証した実験の結果を報告したものだ。結論は現時点では「厳格な人間調査の代替にならない」という明確な否定——ただし「Not Really」というタイトルが示すように、完全な否定ではなく、現時点での限界を示すものとして読む必要がある。


「合成調査」とは何か、なぜ今注目されているか

合成調査とは、実際の回答者に調査票を配布する代わりに、AIモデルに「この属性の人なら何と答えるか」を予測させる手法だ。調査設計・実施・集計にかかるコストと時間を大幅に削減できるとして、2020年代前半から一部の研究者や調査会社が実用化を模索してきた。

この分野の先行研究としては、Stanford大学のグループによる「シリコン・サンプリング」の概念提唱や、政治学・社会学領域でのLLMの世論模擬実験が知られている。ただし多くの先行研究は実験規模が小さく、実際の大規模パネル調査との比較に基づくものは限られていた。Pew Research Centerは今回、自ら保有する高品質なパネルデータと照合することで、より厳密な精度検証を試みた点で注目に値する。

実験では、Anthropic製のClaude Opus 4.6(※元記事執筆時点での最新モデル)を使って「デジタルツイン」と呼ぶ合成回答者を生成し、同センターが運営するパネル調査「American Trends Panel」の実際の回答と比較した。調査は2026年1月〜5月にかけて3つの波(Wave 185・190・192)で実施された。


「ステレオタイプ増幅」という構造的欠陥

誤差の大きさを論じる前に、まず質的な問題を先に示しておきたい。AIの回答には、単なる数値のずれとは別の、構造的な歪みが確認された。

特定の属性グループに関して、AIは現実の傾向をステレオタイプ的に誇張する方向に振れた:

  • ヒスパニック系がワールドカップを追う確率:実際43%に対してAIは97%
  • 共和党支持者のイスラエルへの好感度:実際58%に対してAIは95%
  • 民主党支持者が「億万長者は国に悪い」と考える割合:実際45%に対してAIは86%

特定集団に統計的に多い傾向を、ほぼ全員が持つかのように描く。これは世論調査としては致命的な歪みだ。

また、回答の分布そのものが人間とは根本的に異なる。中絶の合法性に関する設問では、「すべての場合に合法」と答えた人間は23%、「すべての場合に違法」は11%だった。ところがAIは前者を13%、後者を0%と推計した。合法・違法の合計比率は近いが、両端の強い意見が消えて中間に集中する。設問全体で見ると、約半数の設問で少なくとも1つの選択肢がAIに一切選ばれなかった。


平均誤差12.4ポイント:数値で見る精度の限界

定量的な結果も明確だ。約300問にわたる設問全体で、AI回答と人間回答の差は平均12.4パーセントポイント。全体の28%の設問では差が15ポイントを超え、個別の設問では20・30・40ポイントを超えるケースも珍しくなかった。

グループ Wave 185 Wave 190 Wave 192 平均
全体 11.3 14.7 11.2 12.4
共和党/共和寄り 15.1 16.6 16.4 16.1
民主党/民主寄り 12.2 16.7 11.9 13.6
白人 11.7 14.1 11.6 12.5
ヒスパニック 12.7 16.8 12.3 13.9
黒人 14.1 18.5 12.7 15.1
アジア系※ 12.5 16.1 11.9 13.5

※アジア系の推計は英語話者のみを対象。

特に誤差が大きかったのが時事的な政治問題だ:

  • トランプ大統領の支持率:実際は34%だが、AIは**46%**と過大推計(+12ポイント)
  • 移民担当官が顔を覆うことの容認度:実際は38%だが、AIは**17%**と過小推計(−21ポイント)
  • データセンターについて「よく聞いたことがある」:実際は25%だが、AIは**3%**(−22ポイント)

さらに、誤差の方向は予測しにくい。生活費に関する設問では、医療費や消費財の心配を過大評価する一方、電気料金への懸念は大幅に過小評価した。同じカテゴリの中でも過大・過小が混在するため、系統的な補正も困難だ。


AIは「知らない」と言えない

知識問題でも差は顕著だった。

設問 実際の正答率 AI正答率 誤差
修正第1条が保障する権利 52% 98% +46
NATOの主な目的 56% 99% +43
グリーンランドはどの国の領土か 63% 82% +19

AIはトレーニングで習得した「正解」を回答するため、一般市民の知識水準を再現できない。また、「わからない」の選択肢を人間が選ぶ頻度はAIの約4倍だった。不確実性を表明することへの構造的な抵抗が、ここにも現れている。


モデルによって「民意」が変わる

OpenAIのGPT-5.1とAnthropicのClaude Opus 4.6(※いずれも元記事執筆時点でのモデル)を同じ設問で比較したところ、GPT-5.1は「極端な意見を持つ国民」を描き、Opus 4.6は「中庸な国民」を描いた。どちらも実態とはずれるが、ずれの方向が逆だ。使うモデルによって「民意」の像が変わるという事実は、この手法の客観性に対する根本的な疑問を提起する。ステレオタイプ増幅・分布の平坦化・知識の過信という問題は各モデルに共通するが、その現れ方はモデルごとに異なる。


現時点での限界、そして今後

Pew Research Centerはこの実験から、現時点でAI調査は「厳格な人間調査の代替にならない」と明確に結論づけた。誤差が大きいだけでなく、誤差の方向が予測しにくく、時事的な出来事やモデル選択によって結果が大きく変わる点が本質的な問題だとしている。「Not Really」というタイトルが示す通り、これはAI活用の全否定ではなく、現時点での限界の提示だ。同センターは今後もこの分野の研究を続ける方針であり、手法の改善可能性については引き続き検討するとしている。

詳細はCan AI Stand In for Human Survey-Takers? Not Reallyを参照していただきたい。