最新免费电影_热门电影在线观看_久热超碰影院 国产高清久久?v_在线观看午夜亚洲一区_亚洲成av人在线影院_国自产拍视频在线网站_成人黄色在线观看网址_亚洲第一精品一区二区三区_国产精品日韩av在线播放_日韩国产亚洲欧美高清视频播放

你的位置:首頁 > RF/微波 > 正文

GLM-5.3-Flash開源即適配,摩爾線程助力國產多模態(tài)模型高效運行

發(fā)布時間:2026-08-28 來源:轉載 責任編輯:Lily

【導讀】近日,智譜正式開源GLM-5.3-Flash(320B-A18B),這款在匿名公測中登頂OpenCode與OpenRouter雙平臺調用量榜首的原生多模態(tài)模型,以57分的AA綜合智能指數進入全球前沿模型區(qū)間。模型發(fā)布當日,摩爾線程即基于AI訓推一體智算卡MTT S5000及MUSA軟件棧完成極速適配與高效運行,針對模型中KDA線性注意力機制等創(chuàng)新架構,實現了從算子定制到推理全鏈路的深度打通。


全球前沿性能,匿名公測登頂雙榜


作為GLM-5系列的首個原生多模態(tài)模型,GLM-5.3-Flash總參數為320B,激活參數僅18B,在全球權威的Artificial Analysis Intelligence Index(AA綜合智能指數)中取得57分,進入全球前沿模型能力區(qū)間,與Anthropic最受歡迎的模型Claude Opus 4.8得分持平。在自研Z.ai Code Bench體感評估中,其編程表現與Claude Opus 4.8相當。


202608281152435582.png


此前,該模型以代號Ox-Alpha(社區(qū)昵稱“牛來”)在OpenCode和OpenRouter進行匿名公測,憑借出色的推理速度與智能表現,迅速成為當周最受歡迎的模型,創(chuàng)下雙平臺調用量新高。


全棧技術閉環(huán),極速打通推理全鏈路


GLM-5.3-Flash發(fā)布當日,摩爾線程工程團隊迅速完成模型架構拆解、核心技術分析與典型算子梳理。針對其混合架構中線性注意力采用的KDA機制,團隊基于MATE算子優(yōu)化引擎,快速完成了狀態(tài)矩陣更新、分塊并行掃描等全新算子形態(tài)的定制實現與深度調優(yōu),并與SGLang-MUSA緩存管理體系深度協同、無縫打通,充分釋放了KDA在長上下文推理中的效率優(yōu)勢。


202608281152446170.png


KDA機制的核心創(chuàng)新在于,將傳統注意力中隨推理長度線性增長的KV Cache,轉化為固定規(guī)模狀態(tài)矩陣的增量更新——顯存占用不再隨序列變長而膨脹,從根本上大幅緩解了長上下文的顯存壓力。這一前沿架構特性與MTT S5000的高算力密度形成深度協同,為GLM-5.3-Flash超長上下文能力在國產算力平臺上的高效、穩(wěn)定運行提供了堅實支撐。


軟硬協同,夯實國產算力底座


本次極速適配充分驗證了MTT S5000智算卡的高算力密度與穩(wěn)定性,展現了MUSA架構“適配—部署—優(yōu)化”工程體系的高效成熟。摩爾線程以自主軟硬件協同能力,為國產AI算力底座建設提供了有力支撐。


GLM-5.3-Flash開源地址:

https://huggingface.co/zai-org/GLM-5.3-Flash


開發(fā)者可下載鏡像進行開箱體驗:

registry.mthreads.com/mcconline/inference/sglang:v0.5.17-s5000-4.3.5-torch2.9.1-20260827-glm 


結論

從GLM-5.3-Flash發(fā)布到摩爾線程完成全鏈路適配,這場“發(fā)布即適配”的高效協同,展現了國產AI產業(yè)鏈日益成熟的協同能力。MTT S5000的高算力密度與MUSA軟件棧的工程效率,成功承載了KDA機制在長上下文推理中的顯存優(yōu)化優(yōu)勢,使320B參數的超級模型能夠在國產算力平臺上穩(wěn)定、高效運行。這不僅是一次技術驗證,更是一次產業(yè)信心的建立——當頂尖大模型與自主算力底座之間的適配周期從“數月”壓縮至“當日”,AGI的產業(yè)化規(guī)模普惠便不再是遙遠的愿景。



gg_20260512171736_266_20260622170931_179.png


特別推薦
技術文章更多>>
技術白皮書下載更多>>
熱門搜索

關閉

?

關閉