powered by TechFeed
表示モード
Deep Dive

「AIはなぜ動画を学習できていないのか」—再生速度ではなく、トークンコストとラベル不足が本当の壁

10月10日、Fastlyが「The Video Data Myth: Why AI Hasn't "Watched" the Internet Yet」と題した記事を公開した。Fastlyは大規模なCDN(コンテンツデリバリーネットワーク)を運営しており、ビデオ配信トラフィックの処理は同社の中核事業の一つだ。その立場から、AIがビデオデータをいまだ十分に学習できていない本当の理由——「再生速度」ではなく「トークンコストとラベル不足」にある——を論じている。

10月10日、Fastlyが「The Video Data Myth: Why AI Hasn't "Watched" the Internet Yet」と題した記事を公開した。Fastlyは大規模なCDN(コンテンツデリバリーネットワーク)を運営しており、ビデオ配信トラフィックの処理は同社の中核事業の一つだ。その立場から、AIがビデオデータをいまだ十分に学習できていない本当の理由——「再生速度」ではなく「トークンコストとラベル不足」にある——を論じている。


「テキストは高速にスクレイピングできるが、動画は再生時間分かかるからAIはまだ動画を学習できていない」という説明を見聞きしたことがある人は多いだろう。この説は直感的にわかりやすい。だが、この説は間違っている。

モデルは動画を「再生」していない

LLMが動画を処理する際、ファイルをリアルタイムで頭から再生する必要はない。Geminiを例に取ると、デフォルトで約1秒に1フレームをサンプリングし、音声と合わせてトークンに変換する。この処理の多くは並列実行が可能だ。

Googleが公表しているGeminiのビデオ処理のオーバーヘッドは、固定コスト約2秒+動画1分あたり約0.5秒。90分の動画でも実際の処理時間は1分を大幅に下回る(参考:How does Gemini process videos?)。

学習フェーズはさらにリアルタイムとは無縁だ。動画はフレームに分解され、テキストコーパスがトークン化されるのと同様に、オフラインでバッチ処理される。パイプラインのどこにも「モデルが座って動画を観ている」ステップは存在しない。

本当のボトルネック①:トークンコストが高すぎる

再生時間ではなく、情報を表現するコストが問題だ。

Googleの料金体系によると、低解像度で1時間の動画を処理すると約47万5,000トークン(フレーム分約36万+音声分約11万5,000)を消費する(参考:Understand and count tokens)。一方、同じ1時間分の音声を書き起こしたテキストは1万〜1万5,000トークン程度に収まる。

このギャップの原因はフレームの冗長性にある。誰かが話している動画の40フレーム目は39フレーム目とほぼ同一であり、膨大なトークンがほぼ重複した情報を符号化することになる。Googleが最近導入した「エージェンティック」ビデオ処理(モデルが動画全体を逐次処理するのではなく、関連性の高い部分のみを自律的に選択・抽出する方式)がトークン使用量を最大88%削減したのも、まさにこの冗長性を標的にしているからだ(参考:Google cuts Gemini video analysis tokens by up to 88%)。これは速度の問題への対処ではなく、コストの問題への対処である。

本当のボトルネック②:ラベルがない

テキストには動画にない特性がある。テキストはそれ自体がラベルになるという点だ。ある段落のテキストは、そのまま自身の説明になっている。

動画にはこれに相当するものがない。「誰かがカップを持ち上げて置く」クリップには、その動作・因果関係・物理的な構造を説明するアノテーションが付いていない。オンライン動画のキャプションが存在したとしても、せいぜい「台所にいる男性」程度であり、フレーム内で実際に起きていることの注釈ではない。

これがラベリング問題だ。速度の問題ではない。だからこそ各研究機関は、手作業でラベル付けされた動画を必要としない自己教師あり学習(self-supervised learning)のアプローチにシフトしている。現在のフロンティアは、より速い取り込みではなく、ラベルを必要としない新しいアーキテクチャにある。

なぜ今、業界は動画に向かっているのか

テキストが枯渇しつつあるからだ。広く引用されている推計によると、スクレイピング可能な高品質なウェブテキストの成長率は年10%未満であるのに対し、学習データへの需要はほぼ年倍増のペースで拡大しており、2028年頃に需給が逆転すると予測されている(参考:The data wall is important)。

Yann LeCunが長年主張しているように、4歳の子供がこれまでに吸収してきた生の感覚データは、あらゆるLLMのテキスト学習セットをはるかに上回り、そのほとんどは視覚から得られている。動画は、ラベルがなく冗長でトークン単価が高いものの、事実上無限に供給可能という点で、テキストが枯渇した後の次のフロンティアとして自然な候補だ。

この課題に取り組む動きは研究機関レベルでも加速している。MetaのV-JEPAはラベルなしで動画の時空間的な構造を学習する試みであり、DeepMindのGatoも映像を含むマルチモーダルな汎用エージェントを志向している。いずれも「どう高速に取り込むか」ではなく「どうラベルなしで意味を抽出するか」を中心的な問いとして設計されている点が共通している。

まとめ

AIが動画を十分に学習できていないのは、取り込みが遅いからではない。有用なシグナルあたりのコストが高く(情報量に対してトークン数が膨大)、時間的・因果的構造に対するラベルが不足しているからだ。業界が今まさに動画へ軸足を移しているのは、速度問題を解決したからではなく、簡単なデータソースであるテキストが尽きかけているからである。「動画AI」の本格化は、より速いハードウェアよりも、ラベルフリーな学習手法の成熟にかかっていると言えるだろう。

詳細はThe Video Data Myth: Why AI Hasn't "Watched" the Internet Yetを参照していただきたい。