powered by TechFeed
表示モード
Google

Google DeepMindが「歩いて・掴んで・連携する」ロボットAI 3モデルを公開 — 全身制御から複数台協調まで、成功率の実態も明かす

7月30日、MarkTechPostが「Google DeepMind Ships Three Physical AI Models For Whole Body Control, Dexterity And Multi Robot Collaboration」と題した記事を公開した。この記事では、Google DeepMindが発表した次世代ロボット向け知能基盤「Gemini Robotics 2」の3つのモデルと、全身制御・多指巧緻性・マルチロボット協調という3つの技術的進展について詳しく紹介されている。

7月30日、MarkTechPostが「Google DeepMind Ships Three Physical AI Models For Whole Body Control, Dexterity And Multi Robot Collaboration」と題した記事を公開した。この記事では、Google DeepMindが発表した次世代ロボット向け知能基盤「Gemini Robotics 2」の3つのモデルと、全身制御・多指巧緻性・マルチロボット協調という3つの技術的進展について詳しく紹介されている。


3モデルの構成と役割分担

**Gemini Robotics 2(VLA)、Gemini Robotics ER 2(Embodied Reasoning)、Gemini Robotics On-Device 2**(オンデバイスVLA)の3モデルがセットでリリースされた。

システム設計上の分業が明確に定義されている点がエンジニアとして押さえておきたいポイントだ。ER 2がタスクの計画・進捗管理を担い、モーター制御の実行をVLA(Vision-Language-Action model:視覚・言語入力をモーター命令に変換するモデル)に委譲する。開発者はVLAモデルやナビゲーションAPIといった低レベル制御インタフェースを「ツール」として登録し、マルチモーダルなビデオ・音声・テキストをモデルにストリーミングする構成だ。

アクセス面では、ER 2のみパブリックプレビューとして公開されており、VLAとオンデバイスモデルはゲート付きアクセスにとどまる。ER 2はAI Studioでモデル文字列 gemini-robotics-er-2-preview として利用可能で、入門用ノートブックはrobotics-samplesリポジトリで公開されている。


全身制御:テーブルトップから脱却

従来のGemini Roboticsは人型ロボットの上半身のみを制御対象としていた。Gemini Robotics 2では初めて足先まで含む全身制御に対応した。

デモではApptronik社のApollo 2に対して「緑のビンに水やりジョウロを入れてください」と指示。ロボットはテーブルまで歩行してジョウロを掴み、棚まで移動して指定場所に配置した。ただしGoogle DeepMind自身が「移動速度にはまだ改善の余地がある」と明示している。


巧緻性の実態:成功率のばらつきが課題

1つのモデルチェックポイントが3種類の異なるロボット形状(Apollo 2+Sharp Clawsハンド、Apollo 2+Inspireハンド、Franka Duo+Robotiqグリッパー)を制御するという設計は技術的に興味深い。ただし成功率のばらつきが大きく、マルチフィンガー巧緻性タスクでは**32%〜92%**と幅がある。

カテゴリ タスク 成功率
全身操作(Inspireハンド) 棚からのピックアップ 76.3%
全身操作(Inspireハンド) 床からのピックアップ 45.7%
多指巧緻性(多指ハンド) 電球の取り外し 92%
多指巧緻性(多指ハンド) ゴミ袋の結び 44%
多指巧緻性(多指ハンド) チリトリ操作 32%
グリッパー巧緻性(Franka Duo) 精密挿入タスク 89.6%

電球の取り外しは92%と高いが、ジップロック封入(40%)や電球の取り付け(36%)は低い。「結ぶ・封じる」系の操作がまだ難しい段階にある。


ER 2:「いつ完了したか」を測る

ER 2の中で特に技術的に面白いのが進捗分類(Progress Classification)モーメント検出(Moment Finding)の2つの能力だ。

進捗分類は、ビデオフィードの各フレームを0〜20%から80〜100%の5段階に分類するタスクで、ER 2の正解率は**57.4%。モーメント検出は「コーヒーを注ぐのをやめるべき瞬間」のような臨界フレームを特定するタスクで、91.3%**の精度・平均誤差0.96秒を達成し、4倍大きいモデルカテゴリと同等の精度を4倍の実行速度で実現したとしている。

ER 2はGemini Live APIと双方向ストリーミングで統合されており、マルチステップ実行中の「止まって考える」ポーズを排除することを目的としている。Boston DynamicsのSpotと連携させたデモのサンプルコードはrobotics-samplesリポジトリで公開されている。


On-Device 2:少量データでの新ボディ適応

Gemini Robotics On-Device 2の注目点は新しいロボット形状への適応速度だ。形状・センサ・自由度が大きく異なる新たな双腕ロボットに対して、通常200サンプル未満・数時間で適応できるとしている。

On-Device 1との比較では、SO101プラットフォームでOn-Device 1が0.0%→6.7%にとどまる一方、On-Device 2は6.7%→**53.3%**まで伸びており、差が顕著だ。ただしモデルカードでは「分布外タスクへの汎化」と「高自由度ロボットの制御」に限界があることを明示している。


安全性ベンチマーク「ASIMOV-Agentic」:3モデルと同時公開された理由

新たな安全性ベンチマーク「ASIMOV-Agentic」がCC-BY-4.0ライセンスのもとHugging Faceで公開された。ロボティクスのエージェント的な安全性評価に特化したデータセットで、研究者が再現実験を行う際の基準として利用できる。

このベンチマークが今回のモデルリリースと同時に公開された点は注目に値する。Gemini Robotics 2は全身制御・マルチロボット協調・オンデバイス展開という形で実世界への適用範囲を大きく広げており、それに伴いロボットが引き起こしうる安全上のリスクも多様化する。Google DeepMindは能力の拡張と安全性評価基盤の整備を同時に進めることで、外部研究者がモデルの安全特性を独立して検証できる環境を用意した格好だ。単なるオプションの付録ではなく、能力拡張と安全検証を対にして公開するという姿勢として読み取れる。


詳細はGoogle DeepMind Ships Three Physical AI Models For Whole Body Control, Dexterity And Multi Robot Collaborationを参照していただきたい。