【導(dǎo)讀】過去一周,一個代號為Ox-Alpha的神秘模型橫掃AI圈,以匿名之姿同時沖上OpenCode和OpenRouter調(diào)用量榜首,終結(jié)了DeepSeek連續(xù)56天的霸榜紀錄。開發(fā)者們驚呼“它在屠殺我們的內(nèi)部基準(zhǔn)”,全網(wǎng)競猜其身份——谷歌?海外神秘團隊?昨天,答案終于揭曉:它正是智譜剛剛開源的GLM-5.3-Flash,GLM-5系列首個原生多模態(tài)模型。但比“牛來”爆火更值得關(guān)注的,是一個正在浮出水面的關(guān)鍵信號:在匿名測試期間,所有推理請求均由國產(chǎn)芯片集群支撐,訓(xùn)練端或由海光DCU等國產(chǎn)芯片支持。
不到一天時間,Ox-Alpha 同時沖上 OpenRouter 和 OpenCode 的調(diào)用量榜首,刷新了 OpenRouter 的模型發(fā)布紀錄,也結(jié)束了 DeepSeek 連續(xù)56天霸榜的局面。短時間內(nèi),用戶累計調(diào)用量達到62T Token。
Hermes Agent 創(chuàng)始人在測試后直言:“This model is slaughtering all our internal benchmarks. What the actual fuck is it??”——這個模型幾乎在“屠殺”他們所有的內(nèi)部測試基準(zhǔn)。
于是,全網(wǎng)開始猜:這到底是誰家的模型?有人猜是谷歌 Gemini,有人懷疑是某個海外大廠偷偷放出來測試的新模型,甚至還有人拿出各種截圖對比,稱它的表現(xiàn)疑似已經(jīng)明顯超過 Fable 5。一時間,關(guān)于 Ox-Alpha 的身份猜測幾乎席卷了整個AI圈。
直到昨天,答案終于揭曉。Ox-Alpha,正是智譜的 GLM-5.3-Flash。而“Flash”這個名字,反而很容易讓人低估它。這里的 Flash,并不意味著能力上的“輕量版”或“降檔版”。
前沿智能進入普惠時代
總結(jié)一下,智譜的GLM-5.3-Flash有什么關(guān)鍵點:
第一,GLM首個原生多模態(tài)模型。GLM-5.3-Flash(320B-A18B)正式上線并開源,是GLM-5系列首個原生多模態(tài)模型,支持1M上下文,重點面向Coding、Agent及復(fù)雜專業(yè)任務(wù)。
第二,能力進入全球第一梯隊。模型在AA綜合智能指數(shù)中獲得57分,與Claude Opus 4.8持平;在編程能力測試中表現(xiàn)對標(biāo)Opus 4.8,同時全面超過參數(shù)量更大的GLM-5.2。
第三,同等能力,價格大幅下降。GLM-5.3-Flash價格僅為GLM-5.3的1/10,限時優(yōu)惠低至1/20,約為Claude Opus 4.8的1/40,主打“前沿能力+低成本”。
第四,匿名測試期間直接爆火。正式發(fā)布前,模型以匿名身份Ox-Alpha登陸OpenCode和OpenRouter進行大規(guī)模測試,迅速成為雙平臺熱門模型并創(chuàng)下調(diào)用量新高,相關(guān)請求全部由國產(chǎn)芯片提供算力支持。
第五,架構(gòu)、Coding和專業(yè)Agent全面升級。模型采用稀疏注意力與線性注意力混合架構(gòu),并引入mHC等新技術(shù),將注意力計算量和KV緩存顯著降低;原生視覺能力則讓模型可以“觀察—驗證—改進”自己的輸出,不僅能用于前端、游戲、3D等視覺Coding,也進一步拓展到金融、法律、Office文檔等專業(yè)工作場景。



國產(chǎn)芯片正在扛起大旗
這次GLM-5.3-Flash最值得關(guān)注的,可能不只是模型本身,而是它背后的算力——國產(chǎn)芯片開始真正扛起前沿模型的大規(guī)模推理服務(wù)。
過去一周,智譜首次嘗試讓大規(guī)模真實流量跑在國產(chǎn)芯片集群上。國產(chǎn)芯片單卡算力和內(nèi)存容量相對有限,而GLM-5.3-Flash又支持最長1M上下文,長上下文帶來的內(nèi)存容量和帶寬壓力非常大。因此,智譜圍繞國產(chǎn)芯片的底層架構(gòu)進行了大量針對性優(yōu)化,甚至采用“以算力換帶寬、以通信換顯存”等策略。
在軟件棧上,團隊基于SGLang打造了專用推理引擎,并結(jié)合節(jié)點內(nèi)張量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合緩存量化以及Layer Split等技術(shù),盡可能把有限的硬件資源榨干。集群層面,則采用生產(chǎn)級的Encode–Prefill–Decode(EPD)分離架構(gòu),把多模態(tài)編碼、Prompt預(yù)填充和逐Token解碼拆成可以獨立調(diào)度、獨立擴縮容的工作池,從而提升整個推理集群的利用率和穩(wěn)定性。
最終的結(jié)果相當(dāng)直接:相比同一硬件上的初始基線,端到端服務(wù)性能提升了3倍,硬件效率和單Token成本已經(jīng)達到與主流英偉達GPU相當(dāng)?shù)乃健?/p>
而在訓(xùn)練端,同樣值得關(guān)注。訓(xùn)練或由海光DCU等國產(chǎn)芯片支持。以海光DCU為代表的國產(chǎn)GPGPU,不僅提供訓(xùn)練所需要的通用并行算力,還通過DTK軟件棧、算子庫和集群互聯(lián)能力,盡可能降低從主流GPU生態(tài)遷移過來的成本。換句話說,國產(chǎn)芯片正在從“能不能跑大模型”,走向“能不能把大模型規(guī)?;?xùn)練起來”
結(jié)論
GLM-5.3-Flash的爆火,不只是智譜在模型能力上的又一次躍升,它更是一份關(guān)于“國產(chǎn)算力能不能扛住前沿模型”的實戰(zhàn)報告。匿名測試一周,真實流量跑在國產(chǎn)芯片集群上,端到端服務(wù)性能比初始基線提升3倍,硬件效率和單Token成本對標(biāo)主流英偉達GPU——這組數(shù)據(jù)說明,國產(chǎn)芯片正在從“能跑”走向“能規(guī)?;芷饋怼?。訓(xùn)練端或由海光DCU支撐,推理端以混合架構(gòu)與EPD分離調(diào)度榨干硬件資源,智譜與國產(chǎn)芯片的這次深度協(xié)同,為“國產(chǎn)大模型+國產(chǎn)算力”的組合提供了一個極具說服力的實戰(zhàn)樣本。



