Figure AI Helix 2.5 — 零樣本進 30 個陌生家庭,機器人第一次「空手就開工」
愛范兒 9/18 09:05 姚桐「Figure 让机器人第一次『空手』进陌生人家」 + Figure AI 9/17 官方發布會 + Helix 2.5 技術白皮書 + 30 個灣區真實家庭盲測結果 + Brett Adcock 同 AI 總監 Corey Lynch 發布影片 + 對比 Helix 02 —— Figure AI 9/17 發布新一代模型 Helix 2.5,喺 30 個真實嘅灣區民宅做咗一次「零樣本」測試:完全陌生嘅物體、完全陌生嘅房間佈局,事先冇任何數據採集,亦冇做任何針對性微調。核心點 1 —— 56% vs 9% 嘅 zero-shot 懸殊對比420 次試驗入面有 237 次成功,零樣本成功率 56%,評測過程為盲測,且冇任何單一評測任務喺 Index 預訓練數據入面佔比超過 1.90%;作為對照,同樣硬件、同樣任務數據、只係冇經過 Index 預訓練嘅策略,成功率只有 9% —— Index 嘅預訓練令零樣本任務嘅成功率由 9% 提升到 56%,整體成功率則提升 522%。核心點 2 —— 預訓練數據增加表現呈現可預測嘅「類似 LLM 嘅比例關係」Figure 將 Helix 2.5 同自己上一代模型 Helix 02 放埋一齊比較:後者需要先喺目標場地採集數據先可以訓練,而 Helix 2.5 只用一半嘅適應數據量,已經喺 30 個從未見過嘅家庭入面追平 Helix 02 喺單一場地嘅成功率 —— 數據 scaling law 第一次喺機器人身上顯現。核心點 3 —— 嚴格盲測設計Figure 喺評測前專門將要用嘅玩具、毛巾、床品挑出嚟單獨存放,先由一個 AI 模型初篩、再由人工覆核,確認佢哋冇出現喺任何任務訓練數據入面;30 個住宅亦保留咗各自原有嘅沙發、床鋪、折疊枱面,冇做任何針對評測嘅改造 —— CEO Brett Adcock quote 「這是我們迄今做過最重要的項目」,同 AI 總監 Corey Lynch 喺發布影片強調機器人喺 30 個家庭中「每一個都記錄到了成功」。核心點 4 —— 過去家用機器人嘅共同短板對人嚟講,換一張床唔至於忘記點鋪被;對機器人嚟講,床嘅高度、牆邊嘅空隙、被角垂落嘅位置,都可能令熟悉嘅動作瞬間失效 —— 過去幾年入面,幾乎所有「睇落好犀利」嘅家用機器人演示背後都有共同短板:特斯拉 Optimus、1X Neo,無一例外都要依賴大量場地專屬數據或人工遠程操作先可以完成任務。Helix 2.5 想答一個更難嘅問題 ——機器人能唔能夠走進一個從未見過嘅家,直接開始幹活,唔需要主人先配合錄一遍自己屋企嘅樣。核心點 5 —— 從動畫《傑森一家》Rosey 到 Figure Helix 2.550 年過去,家用機器人嘅敘事似乎又行到同一個路口 —— Figure Helix 2.5 係迄今為止第一個能夠用一半適應數據、喺 30 個從未見過嘅家入面追平上一代喺單一家嘅表現嘅模型。編輯角度:Figure AI 雖然唔係 big-brand skip 名單,但今次屬於 Cat B Robotic AI hardware-first 加 niche 深度技術突破雙重例外 —— 對標本報 9/11 「BleeqUp Rover」cycling-first vertical hardware trigger,預示 2027 年家用機器人量產賽道嘅「scaling law 跨硬件 trigger」第一次由 Figure 跑通;預計 Optimus Gen 3 同 1X Neo 2 將會喺未來半年追住呢個 zero-shot benchmark 對標。對香港讀者嚟講最相關嘅係 —— Figure 嘅Helix 系同 1X Neo、宇樹 H1、優必選 Walker S 一齊將會進入本地安老院、家居服務嘅 pilot —— 決定咗香港 700K 居家安老人口嘅未來五年生活質素。Cat B Hardware/Robotic · zero-shot deep dive + hardware-first 例外通過。
閱讀原文