この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • ビデオ理解で作業の進捗をリアルタイムに認識
  • 複数ロボットの協調作業を共有意味理解で実現
  • APIで公開、VLAモデルなどと組み合わせて利用可

発表の概要

Google DeepMindは、ロボット向けの新しいAIモデル「Gemini Robotics ER 2」を発表しました。これはロボットの「高レベルな頭脳」として、リアルタイムの空間推論や多段階のタスク計画を可能にします。ロボットのモーター制御は既存のVLAモデルなどが担い、ER 2は全体的な判断を担当します。

開発者はGemini API、Google AI Studio、Gemini Enterprise Agent Platformからこのモデルにアクセスでき、物理AIエージェントの構築を始められます。すでにコード例がGitHubで公開されており、導入ハードルを下げる工夫がなされています。

ビデオ理解と進捗追跡

ER 2の最大の進化は、連続ビデオを分析して作業の進捗を把握できる点です。評価では、ビデオの各フレームを0〜100%の5段階に分類する「進捗分類」で57.4%の精度を達成しました。また、「モーメント探索」では、コーヒーを注ぐのを止めるタイミングなど重要な瞬間を特定する際に91.3%の精度と0.96秒の誤差を記録しています。

この能力により、ロボットはタスクの途中で失敗しても最初からやり直すことなく、自己修正しながら作業を続けられます。さらに、ツール呼び出し機能を使えばGoogle検索など外部の情報も取得でき、状況に応じて柔軟に行動できます。

複数ロボットの協調作業

単一のロボットがすべてのタスクに適しているわけではなく、車輪型ローバーは屋内、人型ロボットは不整地に強いといった特性があります。ER 2は、異なるロボット同士が共有の意味理解を介して通信し、タスクを引き継ぎながら複雑な作業を完遂する「マルチロボット協調」を実現します。

具体例として、ApptronikのApollo 2とFranka F3 Duoが協調するデモが示されています。また、Boston DynamicsのSpotと組み合わせて、自然言語の指示で物を取りに行くデモも公開されました。

安全性と性能の両立

ER 2は安全性にも重点を置いており、Safety Instruction Following(安全指示追従)とHuman Proximity(人の近接検知)のベンチマークで先行モデルを上回りました。人が近くにいる場合はロボットを停止し、人が離れるまで作業を再開しないといった動作が可能です。

また、ER 1.6と比較して、実機のVLAモデルを使った場合でも一貫して高い性能を示しました。ER 2はより大きなモデルと同等の精度を、より低い計算コストと4倍の実行速度で達成しており、実時間での物理ロボット制御に必要な性能を備えています。

開発者への開放と今後の課題

ER 2は現在、Gemini APIなどで一般公開されており、開発者は低レベル制御のインターフェースをツールとして宣言し、ビデオや音声などのマルチモーダルデータを直接モデルに入力できます。この設計により、ロボットは作業の進行中に次の行動を並行して思考できます。

一方で、実際の物理環境で安全に運用するには、さらに安全性の検証や法規制への対応が求められます。Googleは今後、より複雑なタスクへの対応を進めるとしていますが、実用化への道のりはまだ長いと見られます。

原文からの引用
Gemini Robotics ER 2 represents a step change in powering robots with video understanding, task orchestration, and multi-robot collaboration — making it possible for robots to be more helpful in the physical world.

Gemini Robotics ER 2は、ビデオ理解、タスク調整、マルチロボット協調の分野でロボットを強化する画期的な進歩であり、ロボットが物理世界でより役立つことを可能にします。

日本の開発者・IT企業にとっての意味

日本の製造業や物流現場では、多段階の作業を自動化したいというニーズが高く、これまではロボットごとに専用のAIを開発する必要がありました。Gemini Robotics ER 2は、汎用の「頭脳」としてAPIで提供されるため、日本の企業も高度なロボット制御を短期間で実装できる可能性があります。特に、従来のロボットにビデオ理解と自己修正の能力を追加することで、品質管理やピッキング作業などの効率化が進むと期待されます。ただし、安全基準の策定や実証実験を通じた信頼性の確認が不可欠であり、業界全体での取り組みが求められます。

用語解説

embodied reasoning
ロボットが身体を使って実世界で推論すること。環境認識と行動計画を統合するAIの能力です。
VLAモデル
Vision-Language-Actionモデルの略。視覚と言語の入力からロボットの具体的な行動を生成するAIモデルです。
マルチモーダル
テキスト、画像、音声など複数の種類のデータを同時に処理・活用することを指します。
ベンチマーク
AIモデルの性能を標準化された条件で定量的に評価するためのテスト手法です。

出典

Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration

Google DeepMind / 2026年7月31日

https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration

企業のAI活用顧問を、いまなら無料で承っています

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて一緒に整理します。導入前の相談だけでも構いません。

無料でAI活用の相談をする