2026年7月30日、Google DeepMindはロボティクスAIの歴史における新たなマイルストーンとなる「Gemini Robotics 2」を発表しました。
これは、カメラからの視覚情報と自然言語による指示をロボットの物理的な動作へ直接変換するVLA(視覚・言語・行動)モデルであり、次世代の産業革命を牽引する中核技術として世界中から注目を集めています。

これまでの産業用ロボットの大部分は、あらかじめ設定された限定的な動作を反復するようにプログラムされており、環境の予期せぬ変化に適応する能力を持っていませんでした。
また、ある機体で学習したスキルを形状やセンサー構成が異なる別の機体へ移すことも極めて困難でした。
しかし、Gemini Robotics 2は「一つの頭脳であらゆるロボットを」という理念のもと、卓上型のアームから全身型のヒューマノイドまでを単一のモデルで制御可能にし、これらの課題を根本から解決する可能性を提示しています。
本記事では、この革新的なAIモデルがもたらす変化と、未来の社会実装について詳しく解説します。
物理AIを牽引する三位一体のコアモデル
今回のリリースでは、すべての処理を単一のモデルに依存するのではなく、役割と応答速度の要件に応じて明確に分割された3つのモデルが階層的に連携するシステムが採用されています。

第一に、システム全体の「高度な頭脳」として機能するのが Gemini Robotics ER 2 です。Gemini 3.5 Flashを基盤とするこの視覚言語モデルは、リアルタイムのビデオフィードを解析して環境を大局的に認識し、数分間にわたる複数ステップのタスクを計画・管理します。
第二に、上位モデルからの高次な指示を実際のモーター制御信号へと変換するのが中核モデルの Gemini Robotics 2 です。これにより、言語的な理解が即座に物理的なアクションへと結びつきます。
第三に、クラウドへのネットワーク接続が制限される環境や極めて低い遅延が要求されるエッジ環境向けに最適化された Gemini Robotics On-Device 2 が用意されています。このモデルは、わずか数時間、 200 件未満のデモンストレーションデータを与えるだけで、全く新しい形状やセンサー構成のロボットへ適応できる驚異的な学習効率を誇ります。
人型ロボットの全身制御と驚異的な高機巧性
これまで、ロボットAIの多くは卓上での単純な双腕操作などに限定されていました。しかし、Gemini Robotics 2は人型ロボットの「足先から指先まで」の全身協調制御を初めて実現し、大きな技術的ブレイクスルーを果たしています。
Apptronik社のヒューマノイドロボットApollo 2を用いた実証では、「一番下の棚の緑のビンにジョウロを置く」という一つの自然言語の指示に対し、ロボットが自律的に歩行し、対象物にリーチし、しゃがみ込んで重心を維持しながら精密に配置するという一連の複合的な全身運動をシームレスに生成しました。

また、高機巧性(器用さ)の面でも顕著な進歩が見られます。Apollo 2に人間の手と同等の自由度を持つ5本指ハンドを搭載したテストでは、電球を外すタスクで 92 %という極めて高い成功率を記録し、精密な部品挿入でも 89 %前後の精度を達成しています。一方で、ゴミ袋を結ぶ( 44 %)やジップロックを閉じる( 40 %)といった柔軟物の操作や、繊細な力覚フィードバックが求められるタスクには依然として課題が残されており、真の器用さの実現に向けた今後の改善が期待される領域です。
複数機体の動的協調と時間的知能の向上
さらに革新的なのは、複数の異なるロボットを連携させるマルチロボット協調の機能です。

従来はシステムインテグレーターが多大な工数をかけてネットワークインフラや通信ロジックを設計していましたが、上位モデルの推論を介することで、ロボット間で意味的な理解を共有し、自らを「プロジェクトマネージャー」としてタスクを動的に割り当てます。
ヒューマノイドと四足歩行ロボットなどが、互いの強みを活かしてシームレスに共同作業を行う未来が現実味を帯びています。
また、物理空間における「時間的知能」も大幅に向上しました。推論モデルは動画の連続的なフィードを監視し、コーヒーを注ぐのを止めるべき瞬間などのクリティカルなイベントを 91 %以上の精度で特定します。これにより、ロボットは作業全体を最初からやり直すのではなく、失敗した単一のステップだけを特定して自己修復できる柔軟性を獲得しました。
安全性評価のパラダイムシフトと新基準
ロボットが工場の安全柵から解放され、人間の作業員と同じ空間で活動するようになるにつれ、安全性は最も重要な課題となります。これに対処するため、Google DeepMindは新たに ASIMOV-Agentic と呼ばれる安全性ベンチマークをオープンソースで公開しました。
これは物理的な衝突回避にとどまらず、AI自身が「不確実性をどのように解決するか」というメタ認知的な安全性を評価する画期的な指標です。
下位のモデルから物理的安全性に違反する危険な行動が提案された際にそれを正確に識別して拒否できるか、また、タスクが物理的に不可能であったりAI自身の確信度が低い場合に、当てずっぽうに行動するのではなく人間にプロアクティブに介入を要請できるかを測定します。この指標は、今後のロボット開発における世界的なデファクトスタンダードになる可能性があります。
産業への波及効果とこれからの展望
Gemini Robotics 2の技術的進化は、ロボティクス産業全体の構造に多大な影響を及ぼします。
基盤モデルが汎用的なオペレーティングシステム(OS)として提供されれば、ロボット本体のコモディティ化が進み、メーカーは純粋なハードウェアの耐久性やモーター性能、バッテリー効率での競争を強いられることになるでしょう。

同時に、実環境で稼働するロボットが成功や失敗のデータを継続的にクラウドへフィードバックし、AIがさらに賢くなるという強力な「継続的学習ループ」が構築されつつあります。
Google DeepMindが提唱する「物理空間における汎用人工知能(Physical AGI)」の実現に向け、今回の発表は物流、製造インフラ、医療介護、そして社会全体に不可逆的な変革をもたらす重要な第一歩となります。これからのAIとロボティクスの融合から目が離せません。