powered by TechFeed
表示モード
Google

Gemini 3.5 FlashがUIを自律操作する「Computer Use」を標準搭載 — 軽量モデルへの統合でエンタープライズ自動化が現実的なコストに

6月25日、GBHackersが「Gemini 3.5 Flash Now Supports Agentic Computer Use for Enterprise Automation Tasks」と題した記事を公開した。GoogleがGemini 3.5 FlashにComputer Use機能をネイティブ統合したことで、比較的軽量なモデルラインでエージェント型UI操作が可能となり、エンタープライズ自動化のコスト面での実用化ハードルが大きく下がった。なお本記事はセキュリティ系メディアGBHackersを出典としており、セキュリティ面の記述が詳しい一方、技術的事実そのものに問題はないものの、その観点から情報を読む必要がある。

6月25日、GBHackersが「Gemini 3.5 Flash Now Supports Agentic Computer Use for Enterprise Automation Tasks」と題した記事を公開した。GoogleがGemini 3.5 FlashにComputer Use機能をネイティブ統合したことで、比較的軽量なモデルラインでエージェント型UI操作が可能となり、エンタープライズ自動化のコスト面での実用化ハードルが大きく下がった。なお本記事はセキュリティ系メディアGBHackersを出典としており、セキュリティ面の記述が詳しい一方、技術的事実そのものに問題はないものの、その観点から情報を読む必要がある。


Gemini 3.5 FlashにComputer Use機能が統合された意味

Googleは2026年6月24日Gemini 3.5 Flashにコンピュータ操作(Computer Use)機能をネイティブ統合したと発表した。

ここでバージョン体系について補足しておく。従来、Computer Use機能は独立した専用モデル「Gemini 2.5 computer-useモデル」にのみ搭載されていた。今回の発表は、その機能をより軽量な「Gemini 3.5 Flash」のコアアーキテクチャに組み込んだというものだ。「2.5」と「3.5」という数字が混在するが、これはGoogleのモデル世代体系における別系統のモデルであり、3.5 Flashへの統合によって開発者は単一モデルで「見て・考えて・操作する」エージェントを構築できるようになった点が今回の核心である。

エンジニアにとって重要なのは、この機能が従来の関数呼び出し(Function Calling)やツール使用とは本質的に異なる点だ。Computer Useでは、エージェントがUIを視覚的に解釈し、クリック・テキスト入力・ナビゲーション・構造化データの抽出といった操作を文脈に応じて判断・実行する。APIが整備されていないレガシーシステムや、複数アプリをまたぐワークフローにも対応できるのはこのためであり、「APIなしでも動く」とはAPI連携が不要になったという意味ではなく、API連携できない既存システムへの適用余地が広がったという意味で理解されたい。APIによるアクセスは引き続き主要な利用経路のひとつである。

対応環境はWeb・デスクトップ・モバイルの三領域にわたる。想定ユースケースとして記事が挙げるのは以下のとおりだ。

  • 継続的なソフトウェアテスト
  • エンタープライズプロセスの自動化
  • 複数アプリにまたがるナレッジワークの自動化

セキュリティリスクと、Googleが講じた対策

「AIエージェントが本番環境で自律的に動く」となれば、セキュリティ上の懸念は避けられない。記事では特にプロンプトインジェクション(外部コンテンツに埋め込まれた悪意ある指示をエージェントが実行してしまう攻撃)、不正操作、データ露出の三点をリスクとして挙げている。

Googleはこれらに対し、複数の対策をモデルレベルとシステムレベルで実装した。

モデルレベル:

  • 正当な指示と悪意ある指示を区別するためのターゲット型敵対的学習をGemini 3.5 Flashに組み込み

システムレベル(オプションの企業向けセーフガード):

  • 重要操作・不可逆操作に対するユーザー確認の強制
  • 間接プロンプトインジェクションが検出された場合のタスク自動終了

さらにGoogleは、これらの機能単独ではなく、セキュアなサンドボックス・厳格なアクセス制御・ヒューマン・イン・ザ・ループ(Human-in-the-Loop)検証との組み合わせ、いわゆる多層防御(Defense-in-Depth)戦略の採用を推奨している。


開発者向けのアクセス方法

新機能は以下の経路で利用できる。

アクセス方法 概要
Gemini API 標準的なAPI経由での利用
Gemini Enterprise Agent Platform エージェントベースシステムの迅速なデプロイを支援
Browserbaseのデモ環境 ライブデモ環境として提供
GitHubのリファレンス実装 テスト・開発ワークフローの加速を目的とした参照実装

GitHubのリファレンス実装とBrowserbaseのデモ環境が公開されている点は、プロダクション投入前に動作を検証したい開発者にとって実用的だ。


整理:Gemini 3.5 Flash Computer Useの主要仕様

項目 内容
Computer Use統合 Gemini 3.5 Flashにネイティブ組み込み
エージェント能力 複数プラットフォームをまたいで「見る・考える・操作する」
自動化ユースケース 継続テスト、エンタープライズワークフロー、ナレッジ自動化
セキュリティ機能 重要操作の確認要求、タスク自動終了
敵対的学習 プロンプトインジェクション対策を内蔵

AIエージェントによるUI自律操作は、GoogleだけでなくAnthropicがClaude Computer Useとして先行して公開するなど、各社が競っている領域だ。今回の動きが特に注目されるのは、専用モデルではなくFlashという比較的軽量なモデルラインへの統合である点にある。推論コストが低いFlashに機能が乗ったことで、大規模なエンタープライズ展開における費用対効果が現実的な水準に近づいたと言える。レガシーシステムへの適用可能性とあわせて、エンタープライズ自動化の実用化を加速させる可能性がある。

詳細はGemini 3.5 Flash Now Supports Agentic Computer Use for Enterprise Automation Tasksを参照していただきたい。