【導(dǎo)讀】世界機器人大會的一場主題演講里,Arm的Federico Pecora把話題拉回了一個老問題:機器人到底卡在哪兒了。他的判斷是,感知、操控這些單項能力這些年進步不小,但真正攔住機器人走進超市、商場這類開放場景的,已經(jīng)不是某個模型夠不夠好,而是整個系統(tǒng)能不能把一堆能力串起來,穩(wěn)定地跑起來。圍繞這個判斷,他拆解了四個層面的系統(tǒng)挑戰(zhàn),也講了Arm打算從計算底座入手做什么。

圖:Federico Pecora 發(fā)表主題演講
過去幾年,機器人在感知、認知和運動控制等領(lǐng)域取得了顯著進展。從工廠產(chǎn)線到倉儲物流,從零售服務(wù)到公共空間,機器人正在不斷拓展應(yīng)用邊界,部署越來越成熟。但當機器人脫離預(yù)設(shè)規(guī)則環(huán)境,進入人流密集、充滿隨機變量的真實世界時,單一感知、操控技能的突破不足以支撐商用落地。真正的挑戰(zhàn),是讓機器人能夠在未知場景中,自主完成多類能力的動態(tài)組合,構(gòu)建一套穩(wěn)定可靠、可自適應(yīng)調(diào)整的完整智能系統(tǒng)。
在 2026 世界機器人大會 (WRC) 開發(fā)者日主題演講中,Arm 物理 AI 機器人技術(shù)研究全球負責人 Federico Pecora 圍繞上述議題展開深度剖析,分享物理 AI 從“能力堆疊”走向“系統(tǒng)級自適應(yīng)”的行業(yè)洞察,引發(fā)業(yè)界對機器人產(chǎn)業(yè)未來發(fā)展的深度探討。
泛化能力是行業(yè)核心突破口

從產(chǎn)業(yè)發(fā)展趨勢來看,機器人能力演進正在經(jīng)歷三個階段。第一階段是跨對象泛化,即機器人能夠在同一任務(wù)流程中處理不同類型的對象,而無需針對每個對象重新訓(xùn)練或編程。這一能力目前已在分揀、物流、零售等結(jié)構(gòu)化場景中得到驗證。第二階段是多任務(wù)智能。統(tǒng)一智能平臺支持多種任務(wù)執(zhí)行,機器人不再服務(wù)于單一固定工作流,而是能夠根據(jù)任務(wù)需求切換不同能力組合。第三個階段則是實現(xiàn)系統(tǒng)級自適應(yīng)。屆時,無論是終端用戶還是機器人自身,都能夠根據(jù)環(huán)境變化完成能力調(diào)整,而無需重新開發(fā)、訓(xùn)練或部署系統(tǒng)。
泛化能力的商業(yè)價值在于能夠顯著降低機器人適配和部署到新場景、新流程及新任務(wù)的成本與復(fù)雜性。因此,泛化能力被視為推動機器人技術(shù)實現(xiàn)規(guī)?;涞氐年P(guān)鍵能力,而如何以高效計算支撐這種能力,也成為 Arm 重點聚焦的核心挑戰(zhàn)之一。
一個日常場景便可以直觀體現(xiàn)泛化能力的現(xiàn)實價值。想象一名用戶帶著人形機器人去超市購物,并下達指令:“推輛購物車,跟我來”“你去取一袋 10 公斤的大米,我去挑選蔬菜,稍后在乳制品區(qū)會合?!边@類指令在日常生活中并不復(fù)雜,卻會給機器人系統(tǒng)帶來極高要求。公共場所人流密集、無預(yù)先構(gòu)建的環(huán)境地圖,機器人也未必接受過“推購物車”這類專項訓(xùn)練。要完成任務(wù),機器人必須在執(zhí)行過程中實時構(gòu)建或調(diào)整自己的能力結(jié)構(gòu),而不是調(diào)用一個提前訓(xùn)練好的固定方案。
如今,許多單項能力已經(jīng)可以通過針對性的訓(xùn)練、模型優(yōu)化和工程化實現(xiàn)。然而,真正的挑戰(zhàn)在于如何讓機器人自主地將這些能力協(xié)調(diào)和組合起來,在真實世界中完成復(fù)雜任務(wù)。例如,在購物場景中,它不僅要能夠推車跟隨用戶、無地圖自主尋路、識別商品、搬運重物,還要能夠?qū)崟r調(diào)整自身行為和運動模型,在與人協(xié)作時遵守既定行為約束,并在動態(tài)變化的環(huán)境中持續(xù)提供可靠、穩(wěn)定的結(jié)果。
機器人規(guī)模化落地面臨的四大系統(tǒng)級挑戰(zhàn)
隨著機器人從技術(shù)演示走向現(xiàn)實世界部署,產(chǎn)業(yè)需要解決的問題已經(jīng)不再是單個模型是否足夠先進,而是如何讓大量異構(gòu)能力在同一系統(tǒng)中高效協(xié)同。
Arm 認為,下一階段機器人規(guī)?;渴饘@四大系統(tǒng)級挑戰(zhàn)展開。

第一, 能力如何實現(xiàn)
機器人無法依靠單一模型完成所有任務(wù),而是需要為不同環(huán)節(jié)匹配合適的模型、策略、規(guī)劃器和控制器。例如,視覺語言動作模型可以用于生成試探性動作,視覺語言模型用于識別環(huán)境中的可操作對象,大語言模型可以輔助生成控制器邏輯,而參數(shù)化控制器則負責輸出安全可靠的動作。這些模塊需要共駐運行、共享內(nèi)存與帶寬資源,并協(xié)同生成最終行為。
第二, 不同能力如何在運行過程中持續(xù)協(xié)同
真實世界中的機器人工作負載具有不同時間尺度:碰撞檢查必須即時響應(yīng),導(dǎo)航和操控需要持續(xù)更新,而“定位大米位置”這樣的高層推理則往往以突發(fā)、異步的方式出現(xiàn)。如果缺乏明確的時序結(jié)構(gòu)和優(yōu)先級調(diào)度,這些能力就可能相互爭搶計算資源,導(dǎo)致響應(yīng)延遲,不僅影響系統(tǒng)效率,甚至可能帶來安全風險。
第三, 能力如何映射到計算資源
在沒有預(yù)先構(gòu)建環(huán)境地圖的情況下,機器人需要依靠本地智能完成感知、場景理解和路徑規(guī)劃,同時逐步構(gòu)建可供多個模型共享的語義地圖。雖然邊緣和云計算資源能夠為設(shè)備端處理提供補充,但現(xiàn)實部署中的機器人不能依賴周邊基礎(chǔ)設(shè)施始終在線、能夠?qū)崟r響應(yīng)且適用于當前任務(wù)場景。對于機器人而言,實時響應(yīng)能力、自主性和安全性往往都需要依賴強大的本地計算能力。因此,系統(tǒng)架構(gòu)面臨的核心挑戰(zhàn)在于,如何在 CPU、專用加速器、內(nèi)存和通信鏈路之間合理劃分計算負載,使數(shù)據(jù)傳輸帶來的開銷不會抵消異構(gòu)計算所帶來的性能和能效優(yōu)勢。
第四, 能力如何管控
隨著機器人具備更強自適應(yīng)能力,行業(yè)需要關(guān)注的不再只是碰撞規(guī)避、速度限制和力控制等基礎(chǔ)安全問題,還包括空間與時間規(guī)則、任務(wù)偏好以及特定場景下的行為規(guī)范等更高層次的約束。黑盒策略往往難以對機器人行為進行檢查、診斷和約束。因此,即使系統(tǒng)持續(xù)演進,安全屏障、運行時保障、控制問題建模和備用控制器必須能夠隨系統(tǒng)變化保持有效,這就要求定制化開發(fā)從依賴經(jīng)驗和臨時性工程實現(xiàn),轉(zhuǎn)變?yōu)榍逦陕涞亍⒕邆鋸娭萍s束力的行為防護框架。
Arm 為機器人系統(tǒng)能力提供統(tǒng)一計算基礎(chǔ)
機器人產(chǎn)業(yè)面臨的,不只是技術(shù)與系統(tǒng)難題,同樣存在創(chuàng)新側(cè)重點與產(chǎn)業(yè)需求之間的落差。長期以來,學術(shù)界傾向于拆解課題開展專項研究,推動感知、規(guī)劃、控制、學習等單項能力持續(xù)突破;產(chǎn)業(yè)界則更加關(guān)注產(chǎn)品落地與商業(yè)價值驗證,優(yōu)先集成滿足當前業(yè)務(wù)需求的功能。這使得能力創(chuàng)新與可部署的機器人系統(tǒng)之間存在一道鴻溝。行業(yè)需要一個通用的計算基礎(chǔ),能夠在大規(guī)模部署場景下連接、組織和協(xié)調(diào)這些能力。Arm 正在這一關(guān)鍵環(huán)節(jié)發(fā)揮作用。通過提供開放的計算平臺和強大的生態(tài)系統(tǒng)支持,Arm 致力于幫助產(chǎn)業(yè)將單項技術(shù)突破轉(zhuǎn)化為可靠的系統(tǒng)級智能,加速機器人技術(shù)從實驗室走向規(guī)模化落地。
說到底,機器人行業(yè)現(xiàn)在不缺單項突破,缺的是能把各種能力裝在一起、還能不出亂子的系統(tǒng)框架。誰先把這個框架搭好,誰就有機會把機器人從演示樣品變成真正能用的產(chǎn)品。Arm在這個節(jié)點強調(diào)計算基礎(chǔ)的統(tǒng)一性和可擴展性,瞄準的正是這個缺口。對中國市場來說,產(chǎn)業(yè)鏈夠全、場景夠多,但要在系統(tǒng)層面追上,可能得在調(diào)度、約束、資源管理這些“看不見的地方”多下功夫。



