【導(dǎo)讀】8 月 20 日,第六屆集成電路設(shè)計(jì)創(chuàng)新會(huì)議暨應(yīng)用展(ICDIA 2026)在南京順利舉辦,Imagination E 系列 GPU IP 憑借領(lǐng)先的端側(cè) AI 與圖形融合架構(gòu)創(chuàng)新,成功入選 “2026 強(qiáng)芯 TOP100” 并斬獲架構(gòu)創(chuàng)新獎(jiǎng)。同期的具身智能生態(tài)論壇上,Imagination 進(jìn)一步分享了面向機(jī)器人領(lǐng)域的 GPU 融合計(jì)算加速方案。針對(duì)當(dāng)前物理 AI、具身智能設(shè)備普遍存在的算法迭代快、數(shù)據(jù)搬運(yùn)功耗高、算力調(diào)度沖突、硬件空間散熱受限等行業(yè)難題,Imagination 創(chuàng)新性提出 GPU 融合可編程 AI 架構(gòu),打破傳統(tǒng) GPU、NPU 獨(dú)立異構(gòu)的設(shè)計(jì)模式,以統(tǒng)一可編程算力底座,適配新一代機(jī)器人、自動(dòng)駕駛等端側(cè)智能系統(tǒng)的長(zhǎng)期迭代需求。

在同期舉辦的具身智能生態(tài)論壇上,Imagination技術(shù)經(jīng)理孫千喆以《面向機(jī)器人領(lǐng)域的GPU融合計(jì)算與加速解決方案》為題發(fā)表演講,指出隨著機(jī)器人等物理AI系統(tǒng)的自主化程度不斷提高,提供支撐的相關(guān)端側(cè)芯片的計(jì)算架構(gòu)已超越傳統(tǒng)GPU或?qū)S肁I加速器的范疇,需要在一顆晶粒(die)上用一個(gè)可編程單元來(lái)將感知、世界模型、推理和圖形處理融合(converge)在一起,以幫助系統(tǒng)用戶打破在新一代系統(tǒng)中遇到的計(jì)算和物理制約因素。

一場(chǎng)獎(jiǎng)項(xiàng)認(rèn)可,一場(chǎng)技術(shù)演講,看似各有側(cè)重,實(shí)則指向同一個(gè)正在浮出水面的產(chǎn)業(yè)判斷:物理AI和一部分端側(cè)AI正在推動(dòng)新一代計(jì)算架構(gòu)走出“專用加速器”的舒適區(qū),轉(zhuǎn)而要求一個(gè)能夠同時(shí)承載場(chǎng)景信息處理、圖形處理、AI計(jì)算與智能的融合算力單元,Imagination的E系列GPU是業(yè)界首個(gè)采用此類架構(gòu)并可編程的融合處理器,此次獲獎(jiǎng)與被討論也使其成為這一趨勢(shì)的縮影:其“GPU融合可編程AI架構(gòu),面向未來(lái)系統(tǒng)設(shè)計(jì)”的產(chǎn)品定位,回應(yīng)的恰恰是當(dāng)下物理AI系統(tǒng)設(shè)計(jì)面臨的結(jié)構(gòu)性挑戰(zhàn)。
物理AI系統(tǒng)設(shè)計(jì)的三重矛盾
機(jī)器人這樣的物理AI系統(tǒng)的工作負(fù)載正以令硬件設(shè)計(jì)者焦慮的速度演進(jìn)。從感知、世界建模、推理、人機(jī)交互到生成式AI應(yīng)用,幾乎每年都會(huì)涌現(xiàn)出新的算法。與之相對(duì),專用加速器的性能增長(zhǎng)往往依賴一條固定流水線,以兌現(xiàn)單一代際的性能承諾,這導(dǎo)致了軟件棧日趨割裂,使研發(fā)工程師不得不隨加速器的每次換代重寫(xiě)算子,系統(tǒng)架構(gòu)的擴(kuò)展性被一次次透支。

具身智能正在引起廣泛的關(guān)注和參與,圖為人頭攢動(dòng)的“2026世界機(jī)器人大會(huì)”(圖片來(lái)源:華興萬(wàn)邦)
比算法迭代更隱蔽的成本,藏在數(shù)據(jù)搬運(yùn)里。在典型的異構(gòu)SoC中,CPU、GPU、NPU與編解碼器各自掛載獨(dú)立的SRAM(靜態(tài)隨機(jī)存取存儲(chǔ)器),每一次數(shù)據(jù)交換都要跨越內(nèi)存邊界,而跨內(nèi)存邊界移動(dòng)數(shù)據(jù)的能耗,據(jù)估算可達(dá)計(jì)算本身的數(shù)十倍,延遲與抖動(dòng)也隨之累積。與此同時(shí),功能安全要求關(guān)鍵路徑獲得隔離,能效優(yōu)化又要求算力共享,混合關(guān)鍵性帶來(lái)的矛盾讓單一固定架構(gòu)難以兩全。
算法演進(jìn)與固定流水線的矛盾、數(shù)據(jù)搬運(yùn)的隱性能耗、安全隔離與算力共享的沖突——這三重矛盾共同構(gòu)成了端側(cè)系統(tǒng)設(shè)計(jì)的基本約束,再加上機(jī)器人這樣的物理AI許多工作負(fù)載都并發(fā)進(jìn)行使情況更加令人焦慮。同時(shí),阻礙物理AI前進(jìn)的因素還有物理和化學(xué)問(wèn)題,電池容量并不能快速提升,而且在機(jī)器人十分寶貴的腔體空間,不能無(wú)限制添加硬件,還會(huì)遇到散熱問(wèn)題。也正因?yàn)槿绱?,如何以一套架?gòu)用GPU融合計(jì)算與AI,不再是一個(gè)可選項(xiàng),而是下一代系統(tǒng)設(shè)計(jì)繞不開(kāi)的命題。
Neural Cores與Burst Processors:可編程底座上的兩項(xiàng)創(chuàng)新
Imagination的E系列GPU IP專為端側(cè)AI與圖形系統(tǒng)而設(shè)計(jì),依托高效的并行處理架構(gòu),在實(shí)現(xiàn)卓越圖形性能的同時(shí),可支持從2 TOPS(每秒萬(wàn)億次運(yùn)算)到200 TOPS的INT8 AI工作負(fù)載,覆蓋圖形渲染、桌面應(yīng)用、智能手機(jī)自然語(yǔ)言處理、工業(yè)視覺(jué)以及自動(dòng)駕駛等場(chǎng)景。因此,E系列GPU是開(kāi)發(fā)用于機(jī)器人和自動(dòng)駕駛汽車等物理AI應(yīng)用的絕佳底層IP產(chǎn)品。

支撐E系列特有的GPU融合AI加速器架構(gòu)創(chuàng)新是兩項(xiàng)深度集成于GPU中的創(chuàng)新。Neural Cores(神經(jīng)核)作為GPU內(nèi)置的AI加速單元,最高可擴(kuò)展至200 TOPS(INT8),在顯著提升AI與計(jì)算性能的同時(shí),與GPU及異構(gòu)計(jì)算的軟件生態(tài)體系全面融合;GPU中集成的Burst Processors(爆發(fā)處理器)則通過(guò)架構(gòu)層面的設(shè)計(jì),使邊緣應(yīng)用的平均功耗效率提升25%,在不犧牲性能的前提下,為端側(cè)設(shè)備爭(zhēng)取到更長(zhǎng)的續(xù)航與更充裕的散熱余量。
而貫穿這兩項(xiàng)創(chuàng)新的共同底座是可編程性。GPU作為可編程處理器,能夠有效應(yīng)對(duì)圖形、計(jì)算與AI算法的不斷演進(jìn);開(kāi)發(fā)者既可以通過(guò)Vulkan、OpenCL等主流API直接解鎖AI能力,也可以借助基于開(kāi)放標(biāo)準(zhǔn)的軟件棧,將現(xiàn)有代碼輕松遷移至神經(jīng)核。Imagination提供的高效計(jì)算庫(kù)與圖編譯器進(jìn)一步釋放GPU潛能,使每一次算法迭代都不必等待新的硬件流片。
AI進(jìn)入計(jì)算路徑:融合架構(gòu)如何省掉每一次內(nèi)存往返
如果說(shuō)可編程性是E系列的方向,融合計(jì)算就是它的實(shí)現(xiàn)路徑。這一架構(gòu)由四個(gè)要素共同支撐:共享內(nèi)存層級(jí),以一套SRAM/緩存結(jié)構(gòu)同時(shí)服務(wù)感知、推理、世界建模與圖形;共享調(diào)度器,在SIMT(單指令多線程)管理下對(duì)計(jì)算、矩陣乘、采樣器與DMA流水線進(jìn)行在線細(xì)粒度調(diào)度。共享編程模型,則以O(shè)penCL、PyTorch、llama.cpp、ONNX、Vulkan等一套工具鏈打通各計(jì)算平面;靈活架構(gòu),以統(tǒng)一的ISA、DDK與產(chǎn)品家族,從單瓦級(jí)設(shè)備覆蓋到多芯粒系統(tǒng)。

這一思路與傳統(tǒng)“外掛式”(Bolt-on)NPU模式形成鮮明對(duì)照。在Bolt-on模式下,NPU與GPU各自持有獨(dú)立的存儲(chǔ)與流水線,每層推理都要發(fā)生內(nèi)存往返,不支持的算子還需回退到CPU;而E系列將矩陣乘加速器(MMA)直接集成進(jìn)統(tǒng)一著色簇(USC),與其余計(jì)算共享內(nèi)存、調(diào)度與編程模型,中間結(jié)果留在片上,數(shù)據(jù)搬運(yùn)與調(diào)度抖動(dòng)同步下降。
在更細(xì)的執(zhí)行粒度上,tile-local SRAM實(shí)現(xiàn)局部執(zhí)行,微分塊(micro-tiling)讓層間折疊為單一內(nèi)核,imgGC圖編譯器把相鄰算子融合進(jìn)同一個(gè)著色器,PVRIC無(wú)損幀緩沖壓縮與ASTC/HDR紋理壓縮進(jìn)一步削減帶寬需求。
如果說(shuō)共享內(nèi)存與調(diào)度解決的是數(shù)據(jù)“搬不搬”的問(wèn)題,數(shù)據(jù)通路的設(shè)計(jì)則回答了數(shù)據(jù)“怎么算”的問(wèn)題。FP32、FP16/BF16、FP8、INT8與MXFP4共享同一條數(shù)據(jù)通路,吞吐最高可達(dá)FP32的16倍,精度格式混用不產(chǎn)生額外的格式轉(zhuǎn)換開(kāi)銷——感知骨干網(wǎng)絡(luò)、世界模型、VLA(視覺(jué)—語(yǔ)言—?jiǎng)幼鳎┎呗耘c量化CNN各取所需,系統(tǒng)設(shè)計(jì)不必為單一精度提前站隊(duì)。
同一套可編程架構(gòu),覆蓋從機(jī)器人到汽車的算力曲線
當(dāng)前,機(jī)器人正在走下舞臺(tái),走進(jìn)生產(chǎn)和生活。對(duì)機(jī)器人與具身智能而言,融合架構(gòu)的收益最為直觀。一顆芯片需要同時(shí)承載四個(gè)計(jì)算平面:負(fù)責(zé)傳感器接入與融合、計(jì)算機(jī)視覺(jué)與DNN推理的感知平面,負(fù)責(zé)SLAM(同步定位與建圖)、VLA與場(chǎng)景推理的世界模型平面,負(fù)責(zé)渲染、手勢(shì)識(shí)別與遙操作的HMI平面,以及負(fù)責(zé)實(shí)時(shí)驅(qū)動(dòng)與監(jiān)督的控制安全平面。確定性控制環(huán)與感知—行動(dòng)環(huán)兩條閉環(huán)在同一芯片上并存,恰好是共享調(diào)度與共享內(nèi)存所擅長(zhǎng)的場(chǎng)景。

然而,對(duì)機(jī)器人廠商而言,融合架構(gòu)的價(jià)值不止于把四個(gè)計(jì)算平面塞進(jìn)一顆芯片,更在于它能否跨越從原型到量產(chǎn)的那道坎。原型到量產(chǎn)之間,橫亙著一道“硅缺口”。實(shí)驗(yàn)室里用基于通用GPU的開(kāi)發(fā)模塊驗(yàn)證算法是正確路徑,但量產(chǎn)機(jī)器人必須裝進(jìn)密封殼體、靠電池供電、把BOM壓到消費(fèi)或工業(yè)級(jí)可接受的范圍,還要支撐長(zhǎng)達(dá)十年的軟件迭代與升級(jí)。
出貨只有50臺(tái)時(shí),開(kāi)發(fā)模塊的成本微不足道;出貨5萬(wàn)臺(tái)時(shí),它就成了整機(jī)BOM清單上的絕對(duì)主角,這推動(dòng)市場(chǎng)競(jìng)爭(zhēng)變成誰(shuí)先把成本降到比基于通用GPU開(kāi)發(fā)模塊遠(yuǎn)遠(yuǎn)更低的程度。于是問(wèn)題變成了:量產(chǎn)需要一顆真正的芯片,而這顆芯片一旦流片就固定了,因此,如果它是專用NPU或者其他加速器,算法每演進(jìn)一代就可能需要重新流片,其巨大的經(jīng)濟(jì)性挑戰(zhàn)已經(jīng)在智能駕駛芯片企業(yè)難以盈利中得到了體現(xiàn)。
如果它是通用GPU,雖然可以通過(guò)軟件實(shí)現(xiàn)更新,但是復(fù)雜系統(tǒng)和應(yīng)用顯然還需要(外掛)AI加速器,從而帶來(lái)了物理AI的空間、功耗和電池續(xù)航等物理化學(xué)問(wèn)題。
如果它是Imagination E系列這樣GPU融合可編程AI加速器,不僅新算法通過(guò)軟件更新即可落地,同時(shí)還能提供可根據(jù)需求設(shè)定的AI加速器,用同一顆硅片能撐過(guò)整個(gè)產(chǎn)品生命周期。

當(dāng)機(jī)器人要走下舞臺(tái)時(shí),對(duì)于物理AI,除了解決算力問(wèn)題,還需要解決一系列物理(和化學(xué))問(wèn)題(圖片來(lái)源:華興萬(wàn)邦拍攝于WRC2026)
安全能力也為這條算力曲線提供了縱深。Imagination GPU 所承載的分布式安全機(jī)制(DSM),包括ECC(糾錯(cuò)碼)與Parity奇偶校驗(yàn)、CRC(循環(huán)冗余校驗(yàn))、Safety Pairs安全對(duì)、雙核鎖步固件、調(diào)度器聯(lián)鎖與Tile區(qū)域保護(hù),以不翻倍芯片面積為代價(jià)實(shí)現(xiàn)持續(xù)故障覆蓋,支持ISO 26262(汽車功能安全標(biāo)準(zhǔn)ASIL-B, ASIL-D)安全標(biāo)準(zhǔn),并已在車規(guī)場(chǎng)景完成驗(yàn)證,可以快速移植到機(jī)器人和其他物理AI領(lǐng)域。
面向消費(fèi)與桌面市場(chǎng),Imagination E系列硬件級(jí)虛擬化支持每核最多16個(gè)虛擬機(jī)或者操作系統(tǒng)且內(nèi)存完全隔離,多核去中心化擴(kuò)展與固件管理調(diào)度則讓同一架構(gòu)平滑覆蓋AI PC與桌面計(jì)算。作為規(guī)?;?yàn)證,基于Imagination GPU架構(gòu)的設(shè)備全球累計(jì)出貨已達(dá)110億臺(tái)。
架構(gòu)是曲線,芯片是曲線上的點(diǎn)
一顆芯片只是曲線上的一個(gè)點(diǎn),一個(gè)架構(gòu)才是曲線本身——這是Imagination反復(fù)強(qiáng)調(diào)的判斷,也是理解其E系列GPU的正確坐標(biāo)。從單瓦級(jí)延伸到多芯粒,從機(jī)器人延伸到汽車,Imagination E系列GPU以同一套標(biāo)準(zhǔn)軟件棧與工具鏈,把圖形、計(jì)算與AI收斂到同一個(gè)可編程平臺(tái)之上。
回到ICDIA的獎(jiǎng)項(xiàng)與具身智能論壇的演講,它們之所以值得被放在一起討論,是因?yàn)槎吖餐_認(rèn)了一件事:在端側(cè)AI與圖形、計(jì)算、感知和AI加速持續(xù)融合的趨勢(shì)下,能夠跟上長(zhǎng)周期算法演進(jìn)的架構(gòu),同時(shí)又能更好地適配物理AI的各種物理化學(xué)約束,而不是某一款固定功能的加速器,不是純粹的通用GPU,而是一種GPU融合可編程加速的算力底座。
Imagination E系列GPU以“GPU融合可編程AI架構(gòu)”回應(yīng)“面向未來(lái)物理AI系統(tǒng)設(shè)計(jì)”,不綁定單一工作負(fù)載,讓系統(tǒng)設(shè)計(jì)有能力跟上算法的下一次演進(jìn),也讓芯片設(shè)計(jì)公司開(kāi)發(fā)的物理AI SoC有更長(zhǎng)的生命周期,有更多芯片出貨來(lái)攤銷研發(fā)成本并早日盈利。
結(jié)論
本次獲獎(jiǎng)與技術(shù)分享,印證了 Imagination E 系列融合 GPU 架構(gòu),精準(zhǔn)契合物理 AI 與具身智能產(chǎn)業(yè)的發(fā)展趨勢(shì),有效解決了當(dāng)前端側(cè)智能系統(tǒng)設(shè)計(jì)的核心痛點(diǎn)。傳統(tǒng)異構(gòu)算力架構(gòu)存在算法適配性差、跨單元數(shù)據(jù)搬運(yùn)能耗高、安全隔離與算力共享難以兼顧等結(jié)構(gòu)性矛盾,且專用加速器架構(gòu)固化、迭代成本高,無(wú)法適配機(jī)器人 AI 算法快速更新的行業(yè)節(jié)奏。



