【導(dǎo)讀】智能耳機(jī)能夠抑制列車駛過(guò)的噪音,同時(shí)清晰保留對(duì)面交談?wù)叩娜寺暎慌渌蜋C(jī)器人穿行于人來(lái)人往的人行道,當(dāng)行人突然闖入行進(jìn)路線時(shí),在距離對(duì)方半米處平穩(wěn)剎停;無(wú)人機(jī)檢測(cè)到陣風(fēng)信號(hào)后,僅用時(shí)三毫秒就完成姿態(tài)調(diào)整,穩(wěn)定保持懸停位置。

以上案例均屬于物理AI的成果。但究其本質(zhì),這些成果并不單純依靠AI模型實(shí)現(xiàn)。
量產(chǎn)產(chǎn)品與讓人眼花繚亂的演示樣機(jī)的差距不在于電路板載智能本身的先進(jìn)程度。關(guān)鍵在于一套硬性約束:智能運(yùn)算的輸出必須次次準(zhǔn)時(shí)到達(dá)物理世界,且全程需控制在固定功耗預(yù)算之內(nèi)。時(shí)序是物理AI的核心承載約束——一旦時(shí)序指標(biāo)失守,再高的模型精度也無(wú)法彌補(bǔ)缺陷。簡(jiǎn)而言之,物理AI首先是時(shí)序問(wèn)題,其次才是人工智能問(wèn)題。
時(shí)延范圍跨越多個(gè)數(shù)量級(jí)
“物理AI”精準(zhǔn)概括了一類產(chǎn)品,這類產(chǎn)品面臨共同的工程難題:智能指令必須在不可變通的時(shí)限內(nèi)作用于物理世界。該領(lǐng)域覆蓋的應(yīng)用場(chǎng)景十分廣泛。無(wú)人機(jī)避障系統(tǒng)可接受50毫秒的端到端時(shí)延;搭載實(shí)時(shí)語(yǔ)音增強(qiáng)功能的智能耳機(jī)的時(shí)延目標(biāo)需控制在10毫秒以內(nèi);而同一款耳機(jī)內(nèi)的主動(dòng)降噪模塊,時(shí)延指標(biāo)則達(dá)到微秒級(jí)別。物理AI不同應(yīng)用領(lǐng)域的時(shí)延要求差距可達(dá)三個(gè)數(shù)量級(jí)。
這種差異至關(guān)重要。時(shí)序約束不能簡(jiǎn)單歸結(jié)為單一數(shù)值,而是一套設(shè)計(jì)準(zhǔn)則,需要針對(duì)不同產(chǎn)品各自的響應(yīng)時(shí)限量身制定。為直觀闡釋該觀點(diǎn),接下來(lái)將以搭載端側(cè)語(yǔ)音增強(qiáng)功能的智能眼鏡作為實(shí)例展開分析,并從中提煉具備通用性的設(shè)計(jì)原則。
案例詳解:智能眼鏡中的語(yǔ)音增強(qiáng)
一款搭載機(jī)器學(xué)習(xí)拾音降噪算法的真無(wú)線耳機(jī)有明確的端到端時(shí)延指標(biāo):從麥克風(fēng)采集聲音到輸出增強(qiáng)音頻,時(shí)延約10毫秒。該指標(biāo)由人耳聽覺(jué)感知特性與應(yīng)用底層的低功耗藍(lán)牙音頻(BLE LE Audio)幀結(jié)構(gòu)共同決定——一旦時(shí)延超出該范圍,佩戴者會(huì)感覺(jué)對(duì)話聲音不自然。
這10毫秒的預(yù)算由一連串處理環(huán)節(jié)分?jǐn)?,每一個(gè)環(huán)節(jié)都必須以確定性完成運(yùn)算:
處理階段 | 最高預(yù)算 |
ADC捕獲和直接內(nèi)存存取傳輸(DMA) | ~200 μs |
雙麥克風(fēng)波束成形與預(yù)處理 | ~300 μs |
模型推理(降噪運(yùn)算) | 3–4 ms |
后處理(殘余噪聲抑制,自動(dòng)增益控制) | ~200 μs |
通過(guò)DMA實(shí)現(xiàn)DAC輸出 | ~200 μs |
BLE協(xié)議棧交互任務(wù)+時(shí)序裕量 | 剩余時(shí)序資源 |
模型的最高時(shí)延預(yù)算為3~4毫秒。若一個(gè)模型平均運(yùn)行耗時(shí)2毫秒,但最壞工況下達(dá)到6毫秒,則無(wú)法量產(chǎn)落地。問(wèn)題不在于模型精度不足,而是頻繁超出時(shí)延上限,產(chǎn)生能夠被人體感知到的異常。在評(píng)估模型精度之前,時(shí)序預(yù)算已成為模型選型的前置約束條件。
單只藍(lán)牙耳機(jī)電池容量約60毫安時(shí),目標(biāo)續(xù)航時(shí)長(zhǎng)為5至8小時(shí)。所有端側(cè)運(yùn)算模塊——音頻鏈路、藍(lán)牙射頻、傳感器、系統(tǒng)開銷,整體平均功耗須控制在約10毫安。因此,AI模型不僅需要滿足時(shí)序預(yù)算要求,功耗也必須控制在限定范圍內(nèi),還需預(yù)留功耗資源供給其他功能模塊。
這正是時(shí)序優(yōu)先產(chǎn)品工程理念在實(shí)際項(xiàng)目中的體現(xiàn):一系列硬性指標(biāo)形成約束規(guī)范,指標(biāo)依據(jù)產(chǎn)品需要適配的物理?xiàng)l件與人體感知特性制定,且必須在模型架構(gòu)最終敲定之前就已確定。
除了上述案例,目前已有越來(lái)越多物理AI產(chǎn)品實(shí)現(xiàn)了落地,例如XMOS新一代VocalFusion? XVF3620 AI語(yǔ)音處理器,是嚴(yán)格遵循物理AI時(shí)序優(yōu)先準(zhǔn)則的典型量產(chǎn)產(chǎn)品。該芯片內(nèi)置高確定性音頻處理鏈路,不僅集成了AI降噪、快速自適應(yīng)聲學(xué)回聲消除(AEC)、雙麥克風(fēng)波束成形與自動(dòng)增益控制(AGC)等功能,而且全程嚴(yán)控最壞工況時(shí)延、超低時(shí)序抖動(dòng),完美適配語(yǔ)音交互10ms級(jí)嚴(yán)苛?xí)r延預(yù)算。XVF3620不僅可以用于消費(fèi)電子產(chǎn)品,也可用于機(jī)器人、工業(yè)控制和大語(yǔ)言模型輸入等多種場(chǎng)景。

案例揭示:時(shí)序的三大核心特征
通過(guò)上述案例,可以總結(jié)出適用于所有物理AI產(chǎn)品的三條通用規(guī)律。
關(guān)注最壞情況時(shí)延,而非平均時(shí)延。3~4毫秒的推理預(yù)算指的是最壞工況指標(biāo)。如果一款加速器平均推理僅1.5毫秒,但尾部時(shí)延高達(dá)8毫秒,即便基準(zhǔn)測(cè)試數(shù)據(jù)非常優(yōu)異,依然無(wú)法滿足預(yù)算要求。硬實(shí)時(shí)系統(tǒng)的核心特征是每次運(yùn)行都達(dá)標(biāo),而非僅半數(shù)工況達(dá)標(biāo)。無(wú)論設(shè)計(jì)者是否意識(shí)到,物理AI產(chǎn)品本質(zhì)上都屬于硬實(shí)時(shí)系統(tǒng)。
時(shí)序抖動(dòng)至關(guān)重要,時(shí)延并非唯一指標(biāo)。閉環(huán)處理流程——BLE編解碼幀、主動(dòng)降噪鏈路、無(wú)人機(jī)控制環(huán)路等,都要求相鄰采樣點(diǎn)之間的時(shí)序具備可預(yù)測(cè)性。一套平均時(shí)延僅有5毫秒,但時(shí)序抖動(dòng)達(dá)到3毫秒的數(shù)據(jù)鏈路,其實(shí)際性能反而弱于平均時(shí)延7毫秒、時(shí)序抖動(dòng)控制在亞微秒級(jí)別的方案。通用處理器中用來(lái)提升平均吞吐率的架構(gòu)機(jī)制,例如緩存、分支預(yù)測(cè)、亂序執(zhí)行,都會(huì)損害最壞工況下的可預(yù)測(cè)性,而這恰恰是物理AI最為看重的特性。
多模態(tài)之間的時(shí)序一致性。藍(lán)牙耳機(jī)配備兩枚麥克風(fēng),可穿戴設(shè)備可能還搭載了慣性測(cè)量單元(IMU),機(jī)器人則搭載視覺(jué)傳感器。各路數(shù)據(jù)流必須實(shí)現(xiàn)采樣精度級(jí)別的時(shí)序?qū)R,這樣多傳感器融合算法才能基于一致的環(huán)境信息運(yùn)行。時(shí)序錯(cuò)位的輸入數(shù)據(jù),并不會(huì)只帶來(lái)輕微錯(cuò)誤輸出效果,系統(tǒng)將會(huì)基于錯(cuò)誤信息,生成看似合理、可信度很高的錯(cuò)誤結(jié)論。
更大的挑戰(zhàn):子系統(tǒng)之間的時(shí)序協(xié)同
倘若時(shí)序問(wèn)題僅局限于“模型運(yùn)算耗時(shí)多久”,對(duì)應(yīng)的工程實(shí)現(xiàn)難度相對(duì)而言還尚且可控。然而更為棘手、也最常被低估的現(xiàn)實(shí)挑戰(zhàn)是跨系統(tǒng)邊界的時(shí)序協(xié)同。
在智能眼鏡中,音頻處理鏈路并非唯一運(yùn)行的任務(wù)。BLE射頻協(xié)議棧必需以固定周期處理鏈路層事件。倘若這些任務(wù)與推理運(yùn)算共用同一顆處理器,并以搶占式中斷形式處理,將會(huì)給音頻處理鏈路引入時(shí)序抖動(dòng)。電容觸控、電池監(jiān)測(cè)、熱管理功能,各自都需要滿足其對(duì)應(yīng)的時(shí)序指標(biāo)要求。
真正的硬性約束很少來(lái)源于推理耗時(shí)本身,而在于如何協(xié)調(diào)推理任務(wù)與系統(tǒng)內(nèi)其他并發(fā)任務(wù)之間的時(shí)序關(guān)系。通用架構(gòu)依靠?jī)?yōu)先級(jí)策略和盡力調(diào)度機(jī)制實(shí)現(xiàn)任務(wù)管理,這意味著系統(tǒng)的最壞工況表現(xiàn)取決于任意時(shí)刻其他任務(wù)的運(yùn)行狀態(tài)。而面向確定性執(zhí)行設(shè)計(jì)的架構(gòu),通過(guò)為各子系統(tǒng)配置獨(dú)立內(nèi)核、硬件級(jí)隔離及可預(yù)測(cè)的輸入輸出(I/O),就需要從硬件設(shè)計(jì)開始對(duì)跨子系統(tǒng)干擾進(jìn)行約束,而非單純依靠軟件調(diào)度規(guī)則。
這正是物理AI與云端AI最顯著的分水嶺。云端不存在類似無(wú)線協(xié)議棧在不合時(shí)宜的時(shí)刻搶占推理任務(wù)資源的情況。挑戰(zhàn)不在于實(shí)現(xiàn)更快的推理速度,而是打造具備隔離能力的推理單元,無(wú)論系統(tǒng)的其他任務(wù)如何運(yùn)行,推理都能以確定的時(shí)序穩(wěn)定運(yùn)行。
作為物理AI的落地產(chǎn)品,XVF3620依托XMOS確定性并行實(shí)時(shí)架構(gòu),從硬件層面實(shí)現(xiàn)子系統(tǒng)時(shí)序隔離與任務(wù)獨(dú)立調(diào)度。不同于傳統(tǒng)芯片依賴軟件優(yōu)先級(jí)調(diào)度、無(wú)法規(guī)避突發(fā)中斷搶占的缺陷,XVF3620通過(guò)硬件級(jí)資源隔離、固定時(shí)序I/O與可預(yù)測(cè)任務(wù)執(zhí)行機(jī)制,讓語(yǔ)音AI推理、音頻編解碼、回聲處理等高實(shí)時(shí)任務(wù),與系統(tǒng)監(jiān)測(cè)、觸控、射頻等并發(fā)任務(wù)互不干擾。在車流噪音、雷雨環(huán)境、空調(diào)設(shè)備噪音以及嘈雜的酒店商超等復(fù)雜真實(shí)場(chǎng)景中,既保障多模態(tài)音頻數(shù)據(jù)高精度時(shí)序?qū)R,又兼顧低功耗穩(wěn)定運(yùn)行,真正實(shí)現(xiàn)了物理AI「先守時(shí)序、再談智能」的量產(chǎn)落地標(biāo)準(zhǔn)。
關(guān)鍵衡量指標(biāo):加載負(fù)載時(shí)每焦耳能耗對(duì)應(yīng)的可持續(xù)運(yùn)算能力
各類宣傳材料中的性能指標(biāo)——每秒萬(wàn)億次運(yùn)算(TOPS)、每秒浮點(diǎn)運(yùn)算次數(shù)(FLOPS)、峰值吞吐率,描述的僅是處理器在理想工況下短時(shí)爆發(fā)所能達(dá)到的峰值性能。對(duì)于電池供電的物理AI設(shè)備而言,這類指標(biāo)雖然很重要,但并不充分,因?yàn)檎鎸?shí)產(chǎn)品不會(huì)在空閑工況下運(yùn)行,而是在真實(shí)干擾、持續(xù)加載負(fù)載和散熱約束條件下運(yùn)行。
能夠真正預(yù)判產(chǎn)品實(shí)際表現(xiàn)的衡量指標(biāo)是在真實(shí)環(huán)境中受到最多干擾的工況下,每焦耳能量對(duì)應(yīng)的可持續(xù)運(yùn)算能力。一款處理器峰值能效可達(dá)4 TOPS/W,但在持續(xù)推理、射頻模塊開啟與外設(shè)頻繁調(diào)度的工況下,能效可驟降至1.2 TOPS/W;在產(chǎn)品實(shí)際工作場(chǎng)景中,其有效能效僅為標(biāo)稱指標(biāo)的30%左右。與之對(duì)比,一款處理器峰值能效為1.5 TOPS/W,并在同等并發(fā)工況下仍可維持1.4 TOPS/W,其性能表現(xiàn)更貼近真實(shí)應(yīng)用場(chǎng)景。
對(duì)于智能眼鏡而言,該指標(biāo)直接決定電池續(xù)航水平。兩款產(chǎn)品即便采用性能相近的AI模型、標(biāo)稱芯片資源預(yù)算相當(dāng),最終的實(shí)際續(xù)航表現(xiàn)依然可能存在顯著差距,而造成差異的關(guān)鍵變量,幾乎總是取決于加載真實(shí)負(fù)載后的持續(xù)能效與峰值能效的吻合程度。在這類產(chǎn)品中,電池續(xù)航時(shí)間長(zhǎng)短本質(zhì)上是時(shí)序特性衍生的結(jié)果:每一微秒的低效運(yùn)算或計(jì)算中斷,最終都會(huì)轉(zhuǎn)化為毫安時(shí)的電量損耗。
該衡量指標(biāo)目前尚未成為行業(yè)通用公開參數(shù),但理應(yīng)普及。負(fù)責(zé)電池供電型物理AI產(chǎn)品的芯片選型團(tuán)隊(duì)在做決策時(shí),相比一輪一輪的TOPS或GOPS算力對(duì)比,更需要參考這一指標(biāo)。
從固定順序到?jīng)Q策準(zhǔn)則
時(shí)序預(yù)算、執(zhí)行架構(gòu)與模型選型,三者并非需要嚴(yán)格按順序來(lái)依次做出決策。在實(shí)際開發(fā)中,三者從項(xiàng)目初期就相互制約。沒(méi)有團(tuán)隊(duì)在制定時(shí)序預(yù)算時(shí)完全不考慮現(xiàn)有模型,也不存在團(tuán)隊(duì)在選擇模型時(shí)全然無(wú)視其承載硬件??陀^來(lái)講,這套設(shè)計(jì)方法論屬于優(yōu)先級(jí)決策準(zhǔn)則,而非線性執(zhí)行流程。
核心權(quán)衡準(zhǔn)則為:當(dāng)時(shí)序與模型選型需求產(chǎn)生沖突時(shí),時(shí)序優(yōu)先。模型必須適配預(yù)算;硬件架構(gòu)必須確保滿足預(yù)算;而預(yù)算本身源自產(chǎn)品需要滿足的物理?xiàng)l件與人機(jī)交互感知特性,這些硬件約束不存在協(xié)商妥協(xié)的空間。
對(duì)于嵌入式工程師而言,這套邏輯并不新鮮,他們對(duì)此早已了然于心。這套邏輯的價(jià)值在于提供一套清晰完整的理論依據(jù),幫助工程師在企業(yè)內(nèi)部與其他部門爭(zhēng)取話語(yǔ)權(quán)——例如,產(chǎn)品路線圖錨定模型榜單,機(jī)器學(xué)習(xí)團(tuán)隊(duì)的考核指標(biāo)側(cè)重精度指標(biāo)而非時(shí)延特性——這類導(dǎo)向最終決定了打造什么產(chǎn)品。
開篇問(wèn)題
決定一款物理AI產(chǎn)品成敗最核心的、在任何模型定型之前就需要提出的問(wèn)題:時(shí)序預(yù)算如何設(shè)定?包含最壞工況下的時(shí)序、抖動(dòng)、單次推理的功耗、子系統(tǒng)間的相互干擾等指標(biāo);以及采用何種執(zhí)行架構(gòu)能夠保障指標(biāo)落地。一旦為上述基礎(chǔ)問(wèn)題找到答案,模型選型工作才有合理依據(jù)和實(shí)際意義。
物理AI是近十年中影響最為深遠(yuǎn)的前沿工程領(lǐng)域之一。能夠引領(lǐng)行業(yè)發(fā)展的產(chǎn)品必然建立在一個(gè)清晰認(rèn)知之上:部署于物理世界的智能,首要前提是每次都能準(zhǔn)時(shí)輸出結(jié)果,且始終維持在有限的預(yù)算之內(nèi)。時(shí)序規(guī)則是實(shí)現(xiàn)物理AI的根基,人工智能算法需建立在此基礎(chǔ)之上。
探秘GenSoC?:開啟硬件可編程性的全新未來(lái)
XMOS正在定義一個(gè)全新的芯片品類——生成式系統(tǒng)級(jí)芯片(Generative System-on-Chip,GenSoC)。借助GenSoC,開發(fā)者能夠通過(guò)使用自然語(yǔ)言去描述系統(tǒng)行為,同時(shí)保障時(shí)序精度與實(shí)時(shí)運(yùn)行性能。



