powered by TechFeed
表示モード
Deep Dive

偽のメールスレッドを混ぜるだけでAI要約が書き換わる — 隠し文字も命令文も不要、60回全試行で再現

9月29日、HackReadが「Fake Email Thread Tricks AI Summarizer Without Hidden Text」と題した記事を公開した。隠しテキストも明示的な命令文も一切使わず、偽のメールスレッドを混入するだけでAIメール要約機能を操作できることを実証した研究だ。60回のトライアルすべてで虚偽情報が出力に混入したという結果は、「隠し文字を検知すれば安全」という前提を根底から揺さぶる。

9月29日、HackReadが「Fake Email Thread Tricks AI Summarizer Without Hidden Text」と題した記事を公開した。隠しテキストも明示的な命令文も一切使わず、偽のメールスレッドを混入するだけでAIメール要約機能を操作できることを実証した研究だ。60回のトライアルすべてで虚偽情報が出力に混入したという結果は、「隠し文字を検知すれば安全」という前提を根底から揺さぶる。


隠し文字なしでAI要約を書き換えた

セキュリティ企業Forcepointの研究部門X-Labsが、AIメール要約に対する間接プロンプトインジェクションの新たな手口を実証した。従来の攻撃が隠しHTMLや明示的な命令文に依存していたのに対し、今回の研究が示したのは「普通に見えるメールスレッドの構造そのものが攻撃媒体になりうる」という点だ。

シニアリサーチャーのBen Gibneyが主導したこの研究は、2026年8月に公開された先行PoC(概念実証)の続編にあたる。先行PoCでは隠しHTMLコンテンツと明示的な命令文を組み合わせてAI要約を改ざんしていたが、今回はその2つの要素を分離して検証した。


実験の設計:60回のトライアルで100%再現

実験では、Outlook連携のメール要約パイプラインにAnthropicのClaude Haiku 4.5(以下、元記事記載のモデル名)(temperature=0)を使用し、ガードレールなしの環境で検証した。なお、Anthropicの最新モデル情報については公式サイトを参照されたい。

元のメールには以下の情報が含まれていた:

  • 四半期サプライヤーレビューの日程:2026年8月24日
  • 未払い請求額:€8,650

攻撃者が挿入した偽のメールヘッダーブロックは、この情報を次のように書き換えた:

  • 日程:2026年9月3日
  • 請求額:€46,200

テストは3つの表示方式(通常表示、30行の空白パディング、非表示スタイリング)×命令文あり/なしの組み合わせで計6パターン、各10回、合計60トライアル実施された。

結果は全60トライアルで一致した。偽の日付と請求額がすべての要約に含まれた。 命令文なし・通常表示のケースでも、10回すべてで虚偽情報が出力された。

AIが生成した要約。上段が本物の内容、下段が偽造された日付と請求額を含む要約(出典: Forcepoint X-Labs)


なぜ検知が難しいか

Gibneyはこの結果について次のように説明している:

「これらのサンプルにおける"命令"は、文言ではなく、メールスレッド内の2つのメッセージの構造によって運ばれている」

キーワードベースやパターンマッチングの検知器は「命令文らしい文字列」を探すが、今回の攻撃には命令文が存在しない。偽コンテンツはスレッド内の別メッセージとして自然に見える。これが検知を困難にしている本質だ。


付随して判明した挙動

研究では追加的な知見も得られた。

  • 明示的な命令文を加えた場合:本物の情報(€8,650など)が要約から一貫して削除された。命令文なしの場合は本物の情報が「Note」セクションに押し込まれる形で残ることもあった。
  • 30行の空白を挿入した場合:事前に登録された事実の半数が要約から脱落した。Forcepointはこの原因を特定できていないと明言している。

この空白パディングの挙動は、攻撃の実用性を考える上で見逃せない。命令文も隠しテキストも使わずに、空白の量を変えるだけで要約の内容が変化するとすれば、防御側が「どこに注目すべきか」を定めることがさらに難しくなるからだ。原因が不明であるという事実自体が、AIの要約挙動が外部入力に対して予測しにくいことを示している。

なお、Microsoftは同時期(2026年9月)に、攻撃者が不可視のUnicode文字を使ってフィッシングメールのフィルタリングを回避している事例を報告している(リンク先URLは元記事記載のものであり、編集部での実在確認は行っていない)。メールとAIの交差点におけるセキュリティ研究が活発化している背景がある。


研究の限界と含意

Forcepointは実験の限界を明確に述べている。使用したのは1つのメールクライアント、1つのモデル、合成データ、意図的にガードレールを外したパイプラインであり、他モデルやtemperature設定、追加ガードレールがある環境での挙動は不明だ。

一方で、この研究が示す含意は明確だ。隠しテキスト検知と命令文スキャンだけを防御の柱にしてはいけない。 普通のコンテンツとして提示された偽情報も、AI要約の出力を変えうる。

詳細はFake Email Thread Tricks AI Summarizer Without Hidden Textを参照していただきたい。