- Google發表Gemini Robotics 2系列,含三款模型
- 人形機器人首度具備全身移動與精細手部操作能力
- Gemini Robotics ER 2導入連續影片理解與任務進度分類
- 新增多機器人協作功能,可與波士頓動力Spot整合
- 空間理解涵蓋成功/失敗偵測、儀器讀值與視覺問答
- 安全機制可自動停止作業並在人員離開後恢復
(綜合ETtoday新聞雲、自由時報等2家媒體報導)
Google於30日正式發表新一代機器人AI系列Gemini Robotics 2,此次同步推出三款模型,分別負責動作、推理與裝置端運算。其中Gemini Robotics 2負責將相機畫面與語音指令直接轉換為機器人動作,可控制人形機器人與雙臂機器人;Gemini Robotics ER 2則負責理解環境、規劃任務流程,並與人互動;Gemini Robotics On-Device 2可直接在機器人本體運作,不必依賴網路。Gemini Robotics ER 2已開放Google AI Studio使用,其餘模型則提供合作夥伴搶先測試。
Gemini Robotics 2最大的突破在於讓機器人不再只會操作桌面物品,而是能配合整個身體完成工作。例如收到「把澆水壺放到架子下層的綠色箱子」指令後,機器人會自行走到桌邊拿起物品,再移動到指定位置完成放置,不需人工逐步控制每個動作。手部操作能力也同步提升,可完成打結、封夾鏈袋、整理物品、精密放置等更細緻的動作。
Gemini Robotics ER 2被定位為機器人的「高階大腦」,主要負責與人類對話、理解周遭物理環境、規劃多步驟任務,並可呼叫Google Search等工具取得資訊,或串接開發者自訂的函式與API。完成任務規劃後,再將實際動作交由底層的視覺-語言-動作模型(VLA)執行。
此次更新導入連續影片理解能力,機器人能持續觀看攝影機畫面,即時掌握任務完成進度、判斷執行過程是否出錯。新增的進度分類功能可將影片中的每一畫面依任務完成程度分為0至20%、20至40%等階段,官方測試顯示準確率約57.4%,優於前一代模型。關鍵時刻辨識功能可找出任務完成的關鍵時間點,準確率達91.3%,平均時間誤差僅0.96秒,推論速度約快4倍且運算成本更低。
多機器人協作功能也正式加入,不同類型的機器人可共享語意理解能力,彼此分工、交接任務。Google也展示與波士頓動力(Boston Dynamics)的合作成果,透過Gemini Robotics ER 2整合Spot四足機器人的導航API與機械手臂控制能力,使用者只需以自然語言下達「幫我拿爆米花」等指令,Spot便能自主導航、尋找目標物並完成取物。Google同步於GitHub公開相關範例程式。
空間理解能力全面提升,涵蓋三大核心功能:成功/失敗偵測方面,可直接分析原始影片串流,即時偵測液體灑出、物品滑落等失敗情況;儀器讀值方面,從過去主要支援類比儀表擴展至可辨識10種不同類型儀器,包括數位顯示器、直尺、液體溫度計等;視覺問答方面,機器人能更準確理解複雜的視覺資訊並回答空間環境相關問題。
安全性方面,Gemini Robotics ER 2在人員接近偵測及安全指令遵循兩項測試中表現均優於前一代。當有人靠近時,系統能自動停止作業、監測環境,並在確認人員離開後自主恢復工作。Google同步推出全新的安全評估基準,檢驗AI是否具備執行安全限制、持續監控環境、判斷動作是否符合物理可行性,以及在必要時主動向人類尋求確認等能力。
系統持續蒐集本事件新進文章,資訊充足時將整合至下一份追蹤報導