【要約】Google DeepMind's updated robotics AI enables whole-body control and collaboration [Ars_Technica] | Summary by TechDistill
> Source: Ars_Technica
Execute Primary Source
// Problem
従来のロボット開発者は、特定の狭いタスクのみを実行するプログラムに依存していた。そのため、動的な環境変化への対応や、AIの誤動作による物理的な事故リスクが大きな課題となっていた。
- ・環境の変化(物体の移動等)に即座に対応できない。
- ・タスク失敗時に工程を最初からやり直す必要があり、効率が悪い。
- ・AIのハルシネーションが、人間との共有空間で重大な事故を招く恐れがある。
// Approach
Google DeepMindは、環境理解と動作生成を分離・統合した階層的なモデル構成を採用した。これにより、ロボットが視覚情報を基に自律的な判断と正確な動作を行えるようにした。
- ・Gemini Robotics ER 2 (VLM): ライブ映像から進捗や重要局面を認識する。
- ・Gemini Robotics 2 (VLA): 指示を具体的なロボットの動作へと変換する。
- ・Gemini Robotics On-Device 2: 低レイテンシを実現するオフライン版。
- ・ASIMOV-Agentic: 安全性を評価するための新しいベンチマークを導入。
// Result
新モデルの導入により、ロボットは高度な器用さと複数台での協調動作を実現した。これにより、人間のような汎用的な物理作業(Physical AGI)への道が開かれた。
- ・重要局面の識別精度が約90%に到達。
- ・約200個のデータで新しいロボット設計へ迅速に適応可能。
- ・Apptronik Apollo 2等を用いた複数台の協調動作を確認。
- ・安全ベンチマークにより、人間への接近時に停止する能力を強化。
Senior Engineer Insight
> 物理的なエッジ環境での推論において、On-Deviceモデルによる低レイテンシ化は極めて重要だ。VLAによる動作生成は、従来のルールベースでは不可能だった柔軟なエラーリカバリを可能にする。ただし、VLMのフレーム完結性精度(60%)には改善の余地がある。ミッションクリティカルな現場に投入する際は、AIの判断に依存しすぎず、物理的な安全装置との二重化を設計に組み込むべきである。