powered by TechFeed
表示モード
Anthropic

ClaudeがベテランCPA12名(半数はBig Four出身)に正答率100%対37%で圧勝 — 18ヶ月前はAIが人間の平均点にすら届いていなかった

10月5日、TechStartupsが「Claude beats experienced human accountants 100% to 37% in Mercor test, and finishes in under 10 minutes」と題した記事を公開した。AI採用・評価スタートアップMercorが実施したテストで、ClaudeがベテランCPA(公認会計士)を正答率100%対37%という大差で上回り、しかも10分以内にタスクを完了したという検証結果だ。

10月5日、TechStartupsが「Claude beats experienced human accountants 100% to 37% in Mercor test, and finishes in under 10 minutes」と題した記事を公開した。AI採用・評価スタートアップMercorが実施したテストで、ClaudeがベテランCPA(公認会計士)を正答率100%対37%という大差で上回り、しかも10分以内にタスクを完了したという検証結果だ。


Claude、ベテラン会計士12名を圧倒

AI採用・評価スタートアップのMercorが発表した研究によると、12名のCPAとフロンティアAIモデルを同一の会計タスクで比較した結果、AIが速度・精度の両面で全員を上回った。

被験者の会計士は決してジュニアレベルではない。平均経験年数は約5.4年、12名中10名がシニア会計士またはマネージャーであり、半数はBig Four(デロイト、PwC、EY、KPMGの4大会計事務所)出身だ。

それでも結果は一方的だった。

  • 人間の会計士:平均正答率約**37%**、所要時間は30分〜3時間
  • Claude Opus 5:20回の単独試行で正答率100%、全試行を10分以内に完了

Mercorはその差をコストでも試算している。タスクの採点基準1項目を正解するコストは、Claude Opus 5が約21セント(約30円)に対し、人間の会計士は約10.35ドル(約1,500円)。AIは人間の約49分の1のコストで同等以上の成果を出した計算になる。

「12名のCPA資格保有者とフロンティアAIモデルを、リアルな会計タスクで比較した。モデルはあらゆる会計士よりも速く、正確だった」——Mercor(X投稿より)

テストは、Mercorが開発するAPEX-Accountingベンチマークを簡略化したタスクが基になっており、月次決算のクローズ処理を模した4つのシナリオを扱った。会社ファイルの検索、正しい数値の特定、計算の実行、指定フォーマットでの出力という一連の作業だ。なお、APEX-AccountingはMercor独自の評価指標であり、一般公開された標準ベンチマークとは異なる点に留意が必要だ。


本当に驚くべきは「18ヶ月間の進化速度」

今回の結果が単なる「AIが人間に勝った」話で終わらない理由がある。わずか18ヶ月前、MercorのテストでトップのAIモデルは会計士の平均スコア(約37%)にすら届いていなかった。

モデル別の進化を見ると:

  • GPT-4o:テストタスクでほぼゼロ点
  • OpenAI o3:2025年春ごろに人間の平均を突破
  • GPT-5:約**69%**に到達
  • Claude Opus 5:**100%**(完全スコア)

この進化曲線が示すのは、特定の職業水準を超えるまでにAIが要する時間が急速に短縮されているという事実だ。18ヶ月前にトップモデルが手こずっていたタスクが、今や数分で完璧に処理できる。

なお、Mercorはこの結果が一人歩きすることを懸念し、公開を見送ることも検討したと明かしている。


「会計士は代替可能」ではない——Mercor自身が釘を刺す

Mercorは研究の限界についても明確に述べている。

「今回の結果は、会計士が代替可能であることを意味しない」——Mercor

テストが対象としたのは、ファイル検索・詳細な指示への従い方・構造化された処理といった、AIが得意とする領域に偏っている。実務の会計士はクライアントとの対話、不審な取引への疑問提起、不完全な情報下での判断、組織固有の文脈の適用といった業務を日常的に行っており、これらはテストで再現されていない。

Mercorが別途実施したより広範な会計研究でも、AIは単発タスクでは強いが、判断や継続的な処理が求められる長めのワークフローでは性能が落ちると報告されている。

歴史的な類比として、表計算ソフトの普及が参考になる。スプレッドシートは財務部門の手計算を劇的に削減したが、財務チームを消滅させたわけではなく、人間が担う業務の中身を変えた。AIも同様の変化を、ただしより大きなスケールで引き起こす可能性がある。


会計士の「時間の使い方」が変わる

近い将来の影響は、職種の消滅よりも業務内容の再編として現れる公算が大きい。

月次決算クローズには、スプレッドシートの検索・数値の照合・差異の発見・計算の繰り返しといった、構造化されたルーティン処理が大量に含まれる。これらはまさにAIが得意とする作業だ。

その結果として、人間の会計士の価値は「判断・コミュニケーション・例外処理・最終的な責任の引き受け」といった、AIが苦手とする領域に集中していく方向が考えられる。

本題はここにある。訓練を受けた専門家が1〜2時間かけて行っていた業務を、AIが約21セント・10分以内で完了できるとき、その業務の対価はどう評価されるのか——という問いだ。過去18ヶ月の改善ペースが続けば、今日のベンチマークは1年後には驚くに値しないものになっているかもしれない。

なお、専門職とAIの能力比較という文脈では、法律分野におけるHarvey AIの弁護士業務への応用など先行事例も存在しており、会計に限らない職種横断的な議論が続いている。Mercorの調査結果の詳細は公式サイトでも確認できる。

詳細はClaude beats experienced human accountants 100% to 37% in Mercor test, and finishes in under 10 minutesを参照していただきたい。