Physical Intelligence,這家成立兩年的舊金山機器人新創公司,已悄悄成為灣區最受關注的 AI 公司之一,周四發表新研究顯示,其最新模型可以指導機器人執行從未明確訓練過的任務——這項能力讓公司研究人員感到驚訝。這項新模型被稱為 π0.7,代表公司所描述的朝向長期追求的通用機器人腦的早期但有意義的進展:一種可以被指出陌生任務、用普通語言指導並實際完成的機器人腦。如果研究結果經得起檢驗,這意味著機器人 AI 可能正在接近類似大型語言模型所見過的轉折點——能力開始以超出基礎數據預測的方式累積。
但首先:論文中核心的主張是組合泛化能力——將不同情境中學習到的技能結合,解決模型從未遇過的問題。直到現在,機器人訓練的標準方法基本上是死記硬背——收集特定任務的數據,然後在該數據上訓練專用模型,再為每個新任務重複這個過程。Physical Intelligence 表示,π0.7 打破了這個模式。Sergey Levine,Physical Intelligence 的共同創辦人,也是 UC Berkeley 的 AI 機器人研究教授表示:「當它從只做你收集數據的任務,轉變成實際以新方式混搭時,能力會隨著數據量呈非線性成長。這種更為有利的擴展特性,我們在語言和視覺領域已經看過。」
論文中最驚人的一個演示涉及一個模型在訓練中幾乎從未見過的空氣炸鍋。當研究團隊調查時,他們發現整個訓練數據集中只有兩個相關的片段:一個是不同機器人只是將空氣炸鍋關閉,另一個則來自開源數據集,其中另一個機器人根據人類指令將塑料瓶放入其中。模型 somehow 將這些片段,加上更廣泛的網際網路預訓練數據,合成出對這台設備運作的實際理解。Physical Intelligence 研究員 Lucy Shi,也是史丹佛電腦科學博士生表示:「很難追蹤知識來自何處,或它會在哪裡成功或失敗。」
不過,模型在沒有指導的情況下,還是做出一個相當不錯的嘗試,使用這台設備來烤地瓜。當研究團隊用逐步的口頭指導——也就是像教新進員工一樣,逐步說明任務——模型成功執行。這種指導能力很重要,因為這意味著機器人可以在新環境中部署,並在實時中進行改進,而不需要額外的數據收集或模型再訓練。
這一切意味著什麼?研究人員並沒有掩飾模型的限制,也謹慎不急於過度推測。至少有一個案例,他們直接將問題歸咎於自己的團隊。Shi 表示:「有時失敗模式並不是出在機器人或模型上,而是出在我們身上。我們不擅長提示工程。」她描述了一個早期的空氣炸鍋實驗,成功率只有 5%。經過約半小時調整如何向模型說明任務後,成功率躍升至 95%。
模型目前還無法從單一高階指令中自主執行複雜的多步驟任務。Levine 表示:「你不能告訴它『嘿,給我做點吐司』。但如果你逐步說明——『對烤麵包機,打開這部分,按那個按鈕,做這個』——它實際上會做得相當好。」
團隊也承認目前還沒有標準化的機器人評估指標,這讓外部驗證他們的聲稱變得困難。他們將 π0.7 與公司之前專用模型——專為個別任務訓練的系統——進行比較,發現這個通用模型在一系列複雜工作中表現相當,包括做咖啡、摺衣服和組裝盒子。
如果採納研究人員的說法,這項研究最值得注意的可能不是任何單一演示,而是結果讓他們感到驚訝的程度——這對那些專門研究訓練數據、因此知道模型應該和不應該能做什麼的人來說,尤其如此。Physical Intelligence 研究科學家 Ashwin Balakrishna 表示:「我過去的經驗是,當我深入了解數據內容時,我基本上可以猜測模型會做什麼。我很少感到驚訝。但最近幾個月是第一次讓我真正感到驚訝。我隨機買了一組齒輪,問機器人『嘿,你能轉動這個齒輪嗎?』結果它就成功了。」
Levine 回憶當研究人員第一次遇到 GPT-2 產生出安第斯山傳說中獨角獸故事時的情景。他表示:「這台機器人怎麼會學會關於安第斯山獨角獸的知識?這是一個非常奇怪的組合。我認為在機器人領域看到這種情況非常特別。」
當然,批評者會指出這裡存在一個不適的對比:語言模型有整個網際網路可以學習,機器人則沒有,而且再多的巧妙提示也無法完全彌補這個差距。但當被問及預期會有什麼質疑時,Levine 的觀點則完全不同。他表示:「對任何機器人通用化演示的批評總是說任務太無趣,機器人沒有做翻筋斗。」他反駁這種說法,認為區分一個令人驚豔的機器人演示與實際能泛化的機器人系統,正是重點所在。他認為,泛化能力永遠看起來沒有精心設計的特技那麼戲劇化,但實際上更具用處。
論文本身在語言上謹慎,將 π0.7 描述為顯示「早期泛化跡象」和「新能力的初步演示」。這些是研究結果,而不是已部署的產品。當被問及基於這些發現的系統何時能準備好投入實際應用時,Levine 拒絕臆測。他表示:「我相信有理由對這項技術感到樂觀,而且它確實比兩年前我預期的進展更快。但很難回答這個問題。」
Physical Intelligence 到目前為止已籌集超過 10 億美元,最近估值為 56 億美元。公司受到投資者關注的部分原因與 Lachy Groom 有關,他是共同創辦人,曾多年擔任矽谷最受尊敬的天使投資人之一——曾投資 Figma、Notion 和 Ramp 等公司——之後決定 Physical Intelligence 是他一直在尋找的公司。這份聲譽幫助這家新創公司即使拒絕提供投資者商業化時間表,仍成功吸引到認真機構資金。據說公司現在正在討論一輪新資金,將估值幾乎翻倍至 110 億美元。團隊拒絕評論。