最新免费电影_热门电影在线观看_久热超碰影院 国产高清久久?v_在线观看午夜亚洲一区_亚洲成av人在线影院_国自产拍视频在线网站_成人黄色在线观看网址_亚洲第一精品一区二区三区_国产精品日韩av在线播放_日韩国产亚洲欧美高清视频播放

你的位置:首頁(yè) > 互連技術(shù) > 正文

摩爾線程發(fā)布《MTT S5000 Prefill-as-a-Service技術(shù)白皮書(shū)》,給了一個(gè)算力分層方案

發(fā)布時(shí)間:2026-08-24 來(lái)源:轉(zhuǎn)載 責(zé)任編輯:Lily

【導(dǎo)讀】摩爾線程最近發(fā)布了一份技術(shù)白皮書(shū),圍繞MTT S5000智算卡提出了一個(gè)叫“Prefill-as-a-Service”的方案。核心邏輯不復(fù)雜:大模型推理有兩個(gè)階段,Prefill算力密集型,Decode訪存密集型,放在同一套硬件上跑必然互相浪費(fèi)。摩爾線程的做法是把兩者拆開(kāi),各跑各的資源池,MTT S5000專門負(fù)責(zé)Prefill這一端,用高稠密算力和原生FP8支持來(lái)壓榨首字時(shí)延。


202608240441089016.png


背景:長(zhǎng)上下文時(shí)代,“算力錯(cuò)配”成為推理成本的核心瓶頸


隨著大模型輸入上下文規(guī)模快速邁入數(shù)百K到1M 級(jí)別,長(zhǎng)文本輸入帶來(lái)的算力消耗與首字時(shí)延壓力持續(xù)攀升,正日益成為制約企業(yè)推理服務(wù)效率與總擁有成本(TCO)的關(guān)鍵瓶頸。傳統(tǒng)同構(gòu)集群的算力部署模式,已難以應(yīng)對(duì)不同計(jì)算階段對(duì)硬件資源的差異化需求。


核心痛點(diǎn)在于結(jié)構(gòu)性錯(cuò)配:在大模型在線推理中,輸入階段的Prefill(預(yù)填充)屬計(jì)算密集型任務(wù),受浮點(diǎn)算力約束;輸出階段的Decode(解碼)屬訪存密集型任務(wù),受顯存帶寬約束。兩者在同一物理資源池中混跑,必然導(dǎo)致雙向浪費(fèi)——按Decode帶寬選型,則Prefill的大容量顯存長(zhǎng)期低效;按Prefill算力選型,則Decode計(jì)算單元大面積空轉(zhuǎn)。


破局:Prefill-Decode異構(gòu)解耦,重構(gòu)推理資源池


《白皮書(shū)》指出,突破這一瓶頸的關(guān)鍵在于將Prefill與Decode徹底解耦,使二者各自運(yùn)行在最契合自身計(jì)算特性的硬件資源池上: 


Prefill算力池:專攻高算力利用率與極低首字延遲(TTFT); 


Decode資源池:專攻高并發(fā)與穩(wěn)定的每Token延遲(ITL)。 


通過(guò)硬件分層投入,算力配置從“通用冗余”轉(zhuǎn)向“按需匹配”,在滿足服務(wù)質(zhì)量(SLO)約束的前提下,實(shí)現(xiàn)單位Token基礎(chǔ)設(shè)施成本大幅下降。


底座:MTT S5000構(gòu)筑高吞吐Prefill專屬算力池


作為一款全功能通用AI加速卡,MTT S5000在硬件特性上與Prefill任務(wù)高度契合,展現(xiàn)出出色的工程適配與規(guī)?;涞啬芰Γ?/p>

高計(jì)算密度,壓縮首字時(shí)延。針對(duì)Prefill的計(jì)算密集型特征,MTT S5000提供高稠密算力,有效壓縮首Token生成時(shí)延(TTFT);在長(zhǎng)上下文場(chǎng)景下,以GLM-5.2為例,單機(jī)8卡可實(shí)現(xiàn)接近十萬(wàn)級(jí)Prefill吞吐,為Agent、長(zhǎng)文檔分析等業(yè)務(wù)提供確定性的SLO承諾與容量規(guī)劃能力。


原生FP8支持,消除格式轉(zhuǎn)換開(kāi)銷。支持FP8至FP64全精度計(jì)算,天然適配主流大模型原生精度,Prefill過(guò)程不引入額外精度損耗;原生FP8 KV Cache與Decode池保持高度兼容,消除跨節(jié)點(diǎn)傳輸前的格式轉(zhuǎn)換成本,顯著降低KV Cache傳輸時(shí)延。


生態(tài)成熟兼容,降低落地門檻。依托MUSA軟件生態(tài),全面兼容CUDA及PyTorch、SGLang、vLLM等主流推理框架,企業(yè)可基于現(xiàn)有代碼資產(chǎn)實(shí)現(xiàn)平滑遷移與快速適配。


實(shí)測(cè)驗(yàn)證:嚴(yán)苛SLO約束下,64K上下文場(chǎng)景單機(jī)吞吐可達(dá)到5.8 MTokens TPM


《白皮書(shū)》基于超大參數(shù)模型智譜GLM-5.2-FP8,在90%前綴緩存命中率、首字時(shí)延P50 TTFT ≤ 6,000ms的嚴(yán)苛硬性SLO約束下,完成了64K至400K序列的極限壓測(cè)。


以智譜官網(wǎng)API定價(jià)為基準(zhǔn)(輸入8元/百萬(wàn)Token、緩存命中2元/百萬(wàn)Token,綜合單價(jià)2.6元/百萬(wàn)Token)進(jìn)行測(cè)算,基于實(shí)測(cè)性能,在理想狀態(tài)下的商業(yè)價(jià)值表現(xiàn)如下:


ScreenShot_2026-08-24_173506_362.png


在典型Agent混合上下文負(fù)載下,單機(jī)更具確定性算力變現(xiàn)能力與清晰的投資回收周期。


結(jié)語(yǔ):以“推理效率+商業(yè)回報(bào)”重構(gòu)產(chǎn)業(yè)競(jìng)爭(zhēng)邏輯


大模型產(chǎn)業(yè)競(jìng)爭(zhēng)的下半場(chǎng),本質(zhì)上是推理效率與商業(yè)回報(bào)的較量。摩爾線程通過(guò)MTT S5000與Prefill-as-a-Service方案,不僅重塑了長(zhǎng)上下文推理的性能與成本邊界,更幫助企業(yè)在萬(wàn)億參數(shù)與Agent時(shí)代牢牢掌握TCO主動(dòng)權(quán)。


完整白皮書(shū)請(qǐng)參見(jiàn):《MTT S5000 Prefill-as-a-Service技術(shù)白皮書(shū)》

https://developer-hscdn.mthreads.com/public/MTT-S5000-Prefill-as-a-Service-%E6%8A%80%E6%9C%AF%E7%99%BD%E7%9A%AE%E4%B9%A6.pdf


總結(jié)

從技術(shù)路徑來(lái)看,Prefill和Decode解耦不是什么新概念,業(yè)內(nèi)早有討論,但真正拿出具體硬件方案和實(shí)測(cè)數(shù)據(jù)的還不多。摩爾線程這次把MTT S5000卡在Prefill這個(gè)節(jié)點(diǎn)上,等于給算力分層提供了一個(gè)可落地的參考。實(shí)測(cè)數(shù)據(jù)說(shuō)明在長(zhǎng)上下文場(chǎng)景下,這套打法能在SLO約束下跑出穩(wěn)定的吞吐,而且用FP8精度跑起來(lái)沒(méi)有額外的格式轉(zhuǎn)換開(kāi)銷,生態(tài)上也兼容了主流框架和CUDA代碼。


gg_20260512171736_266_20260622170931_179.png

特別推薦
技術(shù)文章更多>>
技術(shù)白皮書(shū)下載更多>>
熱門搜索

關(guān)閉

?

關(guān)閉