GLM5.3發布 已有kimiK3等級編程能力
https://x.com/Zai_org/status/2088132965922476159
https://pbs.twimg.com/media/HPqGDYVXAAEtyrV?fo…
GLM-5.3 介紹文
基礎資訊
GLM-5.3 是智譜 AI(Z.ai / Zhipu AI)於 2026年8月14日 正式發布的旗艦模型。它與前代 GLM-5.2 使用相同基座模型(約 743B–744B 參數的 MoE 架構),所有能力提升完全來自後訓練(post-training)Scaling——包括更大規模、更多樣化的長程任務環境、更豐富的 RL 訓練,以及基於 slime 框架的大規模異步訓練。
官方定位:Frontier Coding with Emergent Cyber Capabilities(前沿編程 + 湧現的網絡安全能力)。
核心亮點:
編程能力大幅提升:官方宣稱是目前最優的開源權重模型**。在內部 Z.ai Code Bench上較 GLM-5.2 提升約 50%。公開基準中,Terminal Bench 3.0 從 4.6 → 28.3、
DeepSWE v1.1 從 46.2 → 66.9、Agents’ Last Exam (CLI) 從 23.8 → 28.5,均取得開源 SOTA。
Token 效率更高**:同樣努力等級下,結果更好且輸出 token 更少。例如 High 檔位下,約 50K token 達到 31.4%(超過 Claude Opus 4.8 的 29.5% / 120K token)。湧現網絡安全能力**:在漏洞發現與利用鏈上表現突出。CyberGym 84.5%(開源/對比組中最高),ExploitBench 從 24.4 → 54.4(翻倍以上),ExploitGym 2h/6h 從 29/39→ 105/130。團隊與國內安全團隊合作,已在真實開源項目中發現 2,436 個漏洞(含1,097 個中高危),並建立公開披露台帳。
Agent 與長程任務**:Toolathlon、AutomationBench、HLE w/ Tools、GDPval-AA 等均有明顯提升。
可用性:
即日起通過 GLM Coding Plan 與 ZCode 提供服務。
API 與開源權重將在約 兩週後(完成安全評估與加固後)分階段放出。
思維模式:僅支持 low / high / max 三檔(不再支持關閉 thinking),建議編程任務使用 max。
官方技術博客:https://z.ai/blog/glm-5.3
官方 X 公告:@Zai_org
優點
編程與 Agent 能力強:真實複雜工程場景(終端、長程軟件工程、跨工具協作)表現突出,效率更高(少 token 做更多事)。
後訓練 Scaling 示範成功:不換基座就能大幅提升,證明環境合成 + 長程 RL(SAO、slime 等)的有效性。
網絡安全「湧現」:不只是找漏洞,還能規劃完整利用鏈,對防禦方有實際價值(已發現大量真實漏洞)。
即將開源:權重預計兩週內放出,對本地部署與研究友好。
與閉源模型拉近差距:在部分編程體感與效率上已能挑戰甚至超過 Claude Opus 4.8,接近更高階閉源模型。
缺點 / 局限
權重尚未開放:目前僅通過官方平台可用,本地部署需再等約兩週。
仍落後部分閉源前沿:在 ExploitBench / ExploitGym 等高階利用任務上,與 Mythos 5 / Fable 5 / GPT-5.6 Sol 等仍有明顯差距。
基座未升級:參數規模與 GLM-5.2 相同,純靠後訓練,潛力上限可能受基座限制。無原生視覺:社區此前強烈希望加入 vision,但本次未提及。
安全雙刃劍:強大的漏洞利用能力需要嚴格安全評估與使用政策,否則存在濫用風險。官方已強調正在進行安全加固與合作評估。
目前網友意見(發布當天,2026-08-14)
發布僅數小時,討論熱度高,整體偏正面興奮:
高度評價編程與後訓練**:許多人驚嘆「同一基座靠後訓練就能跳這麼大」,Terminal Bench 3.0 從 4.6 到 28.3 被視為巨大進步。有人稱「post-training 可能才是真正的護城河」。
「開源最強 / Opus-class」聲音多**:部分用戶直接說「已經在多項基準上打贏幾乎所有模型」「Opus-class」,並迫不及待等待開源權重與更小版本(方便本地跑)。網絡安全能力引發討論**:有人覺得「湧現」很酷,像訓練出一個能理解系統如何失效的助手;也有人提醒「很容易轉用到攻擊」,建議作為防禦基準線使用。官方與合作夥伴強調防禦導向與安全評估。
期待後續**:Unsloth 等表示期待 quant 與更小模型;有人問「現在該用 GLM-5.3、DeepSeek 還是 Grok?」;整體氣氛是「這週 AI 又狂刷存在感」。
總結:GLM-5.3 是一次「不換基座、只靠後訓練就大幅躍升」的成功案例,尤其在真實編程 Agent 與網絡安全方向上表現亮眼。它強化了開源陣營在 coding 領域的地位,同時也提醒業界後訓練 + 環境 Scaling 的重要性。權重開放後,實際用戶體感與社區評測將會更豐富。
(資料來源:官方博客、X 公告與發布當天中英文討論,數據以官方為準。)
--
Grok整理
似乎是看DeepseekPRO樣子怪怪的時候趕緊丟出來補刀? (這幾天有夠忙
跟kimi k3的比較擷取一段貼:
總結趨勢:編程與長程 Agent 任務:兩者非常接近,互有勝負。GLM-5.3 在 Terminal Bench 3.0、後訓練相關、效率(更少 token 做出更好結果)和**網絡安全(Cyber)**上明顯更強。
Kimi K3 在部分經典 SWE 任務上略佔優勢。
其他重要差異(不能忽略)
模型規模:Kimi K3 是 2.8T 總參數(約 100B 級激活)的巨型 MoE,GLM-5.3 是與 5.2 相同的約 743B 基座。Kimi 規模大很多。多模態:Kimi K3 原生支援視覺;GLM-5.3 目前看起來仍是純文字。
定位:GLM-5.3 高度聚焦「真實工程級編程 + 長程 Agent + 湧現網路安全」;Kimi K3更偏通用前沿智能(推理、知識、Agent、多模態都強)。
開放狀態:Kimi K3 權重已開放;GLM-5.3 預計兩週後開放。
成本/部署:GLM 系列通常更輕、更便宜部署(相對 Kimi 這種 2.8T 巨獸)。
--