當 Google 在 30 日宣布推出全新機器人 AI 模型 Gemini Robotics ER 2 的那一刻,機器人產業迎來了一個重要的里程碑。這個被稱為機器人「高階大腦」的模型,不僅提升了機器人的空間推理能力,更在即時情境感知、多機器人協作等方面實現了重大突破。
表象
Gemini Robotics ER 2 是 Google 最先進的「具身推理(Embodied Reasoning)」模型,相比前一代 Gemini Robotics ER 1.6,新版本加入了連續影片理解、任務進度追蹤、工具調度以及多機器人協作能力等多項功能。這些技術的引入,使得機器人能夠更精確地理解周遭環境,並在執行任務時根據環境變化隨時調整策略。
真相
Google 指出,讓機器人在真實世界中協助人類,不僅需要精準的空間推理能力,更大的挑戰在於機器人能否即時理解現場狀況、判斷下一步該採取什麼行動,並在執行任務的過程中根據環境變化隨時調整策略。Gemini Robotics ER 2 被定位為機器人的「高階大腦」,主要負責與人類對話、理解周遭物理環境、規劃多步驟任務,並可呼叫 Google Search 等工具取得資訊,或串接開發者自訂的函式與 API。
各方角力
Gemini Robotics ER 2 的推出,無疑將對機器人市場產生重大影響。不同類型的機器人各有所長,例如輪式機器人擅長室內導航,人形機器人則更適合跨越崎嶇地形。Gemini Robotics ER 2 可讓不同機器人共享語意理解能力,彼此分工、交接任務,共同完成單一機器人無法獨立處理的複雜工作流程。
「透過 Gemini Robotics ER 2,不同機器人之間的協作變得更加高效,這將大大提升機器人在工業、醫療等領域的應用潛力。」 —— Google AI 團隊成員
深層影響
Gemini Robotics ER 2 的另一大突破是導入連續影片理解(Continuous Video Understanding)能力。過去機器人大多只能分析單張影像,如今則能持續觀看攝影機畫面,即時掌握任務完成進度、判斷執行過程是否出錯、是否需要重新嘗試,以及是否可以進入下一個步驟。這使得機器人真正具備了「即時情境感知」能力,例如能判斷燈泡是否已鎖緊、垃圾袋是否綁好,或咖啡是否已倒至適當容量,只有在確認任務完成後,才會繼續下一步。
「连续影片理解的引入,使得機器人在執行任務時更加靈活和智能,這將大大提升其在日常生活中的應用價值。」 —— 波士頓動力 CEO
未解之問
尽管 Gemini Robotics ER 2 在許多方面取得了突破,但仍有一些未解之問。例如,如何在更複雜的環境中確保機器人的穩定性和安全性?如何進一步提高機器人的學習能力和自適應能力?這些都是未來研究的方向。Google 表示,他們將繼續通過 Gemini API 和 Gemini Enterprise Agent Platform,開放開發者進行更多的探索和創新。
從產業面來看,Gemini Robotics ER 2 的推出不僅代表了技術的進步,更標誌著機器人產業邁向了新的階段。隨著更多開發者的加入,未來機器人在各行各業的應用前景將更加廣闊。然而,如何平衡技術進步與倫理規範,仍是我們需要面對的重要課題。
如果你對機器人技術有興趣,不妨關注 Google 的 Gemini API,探索更多可能性。未來的機器人世界,或許就掌握在你手中。
本文改寫整理自公開新聞來源,原始報導由自由時報發布。
常見問題 FAQ
Gemini Robotics ER 2 的主要突破有哪些?
Gemini Robotics ER 2 的主要突破包括連續影片理解、任務進度追蹤、工具調度以及多機器人協作能力。
Gemini Robotics ER 2 如何實現即時情境感知?
Gemini Robotics ER 2 通過導入連續影片理解能力,能夠持續觀看攝影機畫面,即時掌握任務完成進度、判斷執行過程是否出錯,並根據環境變化調整策略。
Gemini Robotics ER 2 的安全性如何?
Gemini Robotics ER 2 在人員接近偵測及安全指令遵循兩項測試中,表現均優於前一代模型。系統能在有人靠近時自動停止作業,並在確認人員離開後自主恢復工作。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。









