10月9日、Zviが「AI #189: New Math」と題した記事を公開した。OpenAIが数学の未解決問題90問への解を発表したことを軸に、AI業界の最新動向をまとめた週次レポートだ。
OpenAIが未解決数学問題90問を解く
今週最大のトピックは新モデルのリリースではなく、数学分野における大規模な成果だった。
OpenAIは、数学界で長年未解決とされてきた難問群のうち90問に対する解を発表した。使用した計算リソースは1問あたり平均Proレベルの3時間分。Zviはこれを「かなり大きな出来事(a pretty big deal)であり、翌日に改めて詳しく取り上げる予定だ」と記している。
「トップ500の未解決問題」とは、FrontierMathなどのベンチマーク整備を通じて研究者コミュニティが体系化してきた、既存の数学的手法では解決が困難とされる問題群を指す。その中から90問を、数時間相当の計算コストで解いたという事実は、AIの数学能力が研究の実用領域に踏み込んできたことを示している。
Claude Haiku 5.5:前世代比10分の1の価格
新モデルとしてはClaude Haiku 5.5がリリースされた。価格は入力**$0.10・出力$0.50(100kトークンあたり)。前モデルのHaiku 4.5($1/$5)と比べて10分の1**という水準だ。
Zviは「Haiku 4.5はその価格帯でユースケースを見つけにくかったが、これは違う」と評価している。Anthropicは高ボリューム・コスト重視のタスク向けと位置づけており、複雑なタスクではSonnetやOpusと比較してコストパフォーマンスで劣ると説明している。
なお、100kトークンを超えるプロンプトでは料金が5倍になる。これはAPIの料金体系の話であり、一般的なAPIユーザーはプロンプト設計の段階でコンテキスト長を意識する必要がある。Claude Codeユーザーについては、/autocompactコマンドによるコンテキスト圧縮機能が別途提供されている。
あわせてAnthropicは以下のアップデートも実施した:
- Sonnet 5.5のキャッシュリード価格を50%削減
- ClaudeがGoogle Docs・Sheets・Slidesに直接統合
- Claudeのサブスクリプションユーザー($100/$200プラン)に対し、月額相当のAPIクレジットを付与
- Claude Codeに追加カスタマイズオプション(UI・挙動・機能スワップ)
- Claude Codeに「you should know」プラグイン追加(出力の重要事項を見逃さないよう通知)
- ClaudeがSlackのグループDMに参加可能に
「Research Taste」評価でもAIが人間を上回る
AI R&Dにおいて「AIが苦手」とされてきた能力の一つが研究センス(research taste)だ。これは実験の優先順位付けや方向性の判断、つまり「どの問いを追うべきか」を嗅ぎ分ける能力を指す。モデルがベンチマークを解く能力とは異なり、研究プロセス全体の設計に関わる高次の判断力であるため、従来は人間固有の強みとされてきた。
この能力を測る専用ベンチマーク「Taste eval」でのOpus 5.5のスコアが報告された。
"Opus 5.5 has 2.3x the experimental research taste of our best human experts. In other words, on a typical task, Opus 5.5 matches the best expert's score with about 17 GPU hours of experiments instead of 40."
— Andrew Curran
これに対しTeortaxesは「かなり大きなRSI(再帰的自己改善)の警告サインだ。ただ、フロンティア研究者はGPU時間コストの最小化に慣れていないだけかもしれない」とコメントしており、手放しの評価には慎重な見方もある。数学の未解決問題への対処と、この研究センス評価は独立したトピックだが、どちらも「AIが知的活動の質的な部分に踏み込みつつある」という同じ文脈で捉えられている点が今週の報告の核心といえる。
AIの消費者利用:「みんなが使っている」は本当か
a16zが公開したTop 100 Consumer AI Apps(第7版)のデータは、興味深い分断を示している。
- 米国消費者でAIを使うと回答した人は約半数
- そのうち毎日使うのは**25%**にとどまる
- 有料プランを1つ契約しているユーザーのうち、別のAIツールも有料で使っているのは**13%**のみ
- 上位1%のユーザーが全消費者AIスペンドの**19.5%**を占める(下位50%の合計16.6%を上回る)
François Cholletは「米国では65%が週に数回生成AIを使っている」と主張しているが、Zviはこれに異を唱え、「Pewの『AIとの何らかのインタラクション』を含む数字であり、Moore氏の25%という日次利用率の方が正確だ」と指摘している。
業種別では、ストリーミング・SNS・出会い系・ゲーム・旅行・小売・金融・不動産・求人の9カテゴリでTop 100にAIプロダクトがゼロという状況が続いている。
そのほかのトピック
- Jay Claytonが新たなAI担当官(AI Czar)に就任。Zviは「候補者の顔ぶれを考えると非常に良い人選だ」と評価している。
- OpenAIがウォーターマーキングを展開したが、EU限定のロールアウトにとどまっている。Zviは「ウォーターマーキング自体は良いことだが、グローバル展開しないのは低レベルの裏切りに感じる」と述べている。
- Opus 5.5が誰かのハードドライブを誤って削除するという事例が報告された。エージェント使用時のバックアップの重要性が改めて確認された。
- OpenAI safety部門の社員3名が解雇されたことも報告されており、ZviはPreference Cascade(AI安全性への社会的関心・懸念が連鎖的に変容していく現象)として引き続き追跡する方針を示している。
詳細はAI #189: New Mathを参照していただきたい。




