10月9日、Scientific American が「Mathematicians marvel, and grumble, at OpenAI's trove of new results」と題した記事を公開した。OpenAIが数学・計算機科学のオープンな未解決問題に対するAI生成の証明群を一斉公開したことで、数学者コミュニティに驚きと批判の双方が巻き起こっている。その反応は品質評価から透明性批判、さらにはAI企業との協力中止を求める声明まで多岐にわたっており、AI生成の数学的成果をどう評価・受容するかという問い自体が問われている。
「スロップドロップ」と呼ばれた一斉公開
OpenAIは先日、372件のオープンな数学・計算機科学の問題に対するAI生成の証明を含む、700件以上のファイルを一気に公開した。数学者たちはこれを「slop drop(粗雑なコンテンツの一斉投下)」と呼んでいる。
ハーバード大学の数学者 Michael Douglas は「昨日(公開日)は、数学と数理物理学の新時代が始まった日として記録されるだろう」と Scientific American に語った。彼は今回の公開を、同じOpenAI内部モデルによる先月のナビエ・ストークス問題への取り組みよりも、さらに大きな出来事だと位置づけている。なお、ナビエ・ストークス問題はクレイ数学研究所のミレニアム懸賞問題のひとつ(賞金100万ドル)であり、AI生成の証明が数学界で正式に認められたかどうかについては現時点で専門家による査読・検証が継続中であり、確定的な「解決」と見なすには慎重な留保が必要だ。
質のばらつきと「AIスロップ」問題
専門家の評価は二極化している。
チリ・カトリカ大学の数学者 Hector Pasten は、引用の扱いが以前より改善されており「クレジット表記がうまくできるようになっている」と評価する。一方、ニューヨーク大学の数学者 Roland Bauerschmidt は手厳しい。
「論文の中には意味をつかむのが非常に難しいものがある。いわゆる『AIスロップ』だ。無名の人物からメールで受け取ったら、おそらくそのまま削除していた。それほど書き方がひどい」
ただし、意味不明に見えても内容的には正しい可能性が高い。公開された証明の42%は定理証明支援系の Lean でコード化されており、論理の健全性はほぼ保証されている。Lean とは、数学的証明をコンピュータが検証可能な形式で記述するプログラミング言語だ。
一方で、すでに3本の論文が重大な誤りを指摘されて撤回されている。MITの数学者 Andrew Sutherland は「最終的にほとんどは正しいか修正可能だと思うが、深刻な誤りを含む証明もあると覚悟すべきだ」と述べた。
透明性への批判と、一団体によるボイコット呼びかけ
コミュニティの批判は品質面だけにとどまらない。
Sutherland は、OpenAIがモデルが解けなかった問題(数千件に上るとされる)を公開しないことを問題視する。「オープンサイエンスとはそういうものだ。ネガティブな結果もポジティブな結果と同じように報告しなければならない」と彼は言う。OpenAI はこれに応じないと彼は予測しており、透明性の欠如を指摘する。
さらに興味深い指摘がある。複数の数学者が独立して、モデル自身が解くべき問題を自ら生成している可能性を示唆した。根拠のひとつは、複数の論文が非常によく似たアイデアと手法を用いていること——まるで「著者たち」が互いにやりとりしているかのようだと言う。エージェント同士の連鎖的な対話がバックグラウンドで走っているという仮説だ。OpenAI はこの点についての取材に回答していない。
最も強硬な批判は「Association for Human Mathematics(人間の数学のための協会)」から出た。同団体は数学コミュニティにおけるAI利用に批判的な立場を取る団体であり、数学界全体を代表する組織ではないが、その声明は注目を集めた。声明では次のように述べられている。
「700件以上のファイルを一度に公開することは、学術的な貢献の示し方ではなく、権力の誇示だ。我々は数学者たちにOpenAIとの協力を中止し、人間の理解を中心に据えた科学のビジョンに立ち返ることを求める」
これは事実上のボイコット呼びかけであり、AI企業と学術コミュニティの一部の間で摩擦が単なる研究手法の議論を超えた段階に入りつつあることを示している。
査読・受容の枠組みそのものが存在しない
今回の公開が浮き彫りにしたより根本的な問題は、AI生成の数学的成果をどう査読し、どう受け入れるかという枠組みそのものがまだ整備されていないという点だ。
従来の数学出版では、著者が論文を投稿し、専門家による査読を経て学術誌に掲載されるというプロセスが機能してきた。arXiv のようなプレプリントサーバーも、個人または研究チームが段階的に成果を公開する形式を前提としている。今回のように700件以上のファイルが一斉に投下される事態は、こうした既存の評価プロセスのキャパシティを根本から超えている。どの証明を誰が優先して検証するか、撤回された証明の扱いをどう定めるか——いずれも前例のない問いだ。
今週追加された数学がどれほど新規のものかを把握するには、数カ月、場合によっては数年かかるという見方で専門家の意見は一致している。論文の一斉公開という手法、モデルが自ら問題を設定している可能性、撤回された証明の存在——これらは、数学界がAI生成の成果を受け入れるための制度・文化・技術的インフラがいまだ追いついていない現実を示している。
詳細はMathematicians marvel, and grumble, at OpenAI's trove of new resultsを参照していただきたい。




