GLM5.3發布 已有kimiK3等級編程能力
影片概覽與核心重點
本影片測試並介紹了 ZAI 團隊推出的最新開源大語言模型 GLM 5.3。該模型在多項任務上達到了頂尖(Frontier)水平,性能可媲美 Claude Fable 與 GPT 最新模型。其最大亮點在於 智能體編程(Agentic Coding)、長任務推理、網路安全漏洞挖掘 以及 後訓練(Post-training)技術的突破。
---
章節內容摘要
1. GLM 5.3 簡介 (0:00 - 0:30)
新一代開源王者:ZAI 發佈 GLM 5.3,在多數場景下的表現比肩最佳的 GPT 模型與Claude Fable。
測試目標:透過一系列高難度的實際提示詞(Prompts)測試其極限能力與侷限性。
2. & 3. 實測 1:ZCode 與 Windows 11 網頁版複製 (0:30 - 6:44)
ZCode Harness:ZAI 推出的 Agent 框架(類似 CodeEx 或 Claude Code),支援多Agent 同時於本機運作。
Windows 11 模擬任務:
挑戰:要求建立包含 Word、Excel、PowerPoint、Discord、Slack、Spotify、商店與檔案總管等功能的網頁版 Win11。
執行過程:思考約 22 分鐘,自主拆解任務並生成多個專屬 Agent 處理不同應用,自動以瀏覽器加載、截圖除錯並修復 Bug。
結果:生成高度可用的 Windows 介面,支援夜用模式、壁紙變換、基本 Word 編輯存檔與 Excel 公式計算;Slack 可模擬自動回覆,Spotify 可透過合成器播放音效。PPT 編輯功能較為簡陋。
4. 實測 2:Blender MCP 建立 V8 引擎 3D 動畫 (6:44 - 8:52)
自主控制工具:透過 Blender MCP 插件連接本機,要求生成精細且帶有動畫的 V8 引擎。成果:歷時約 1 小時,經過提示詞修正修正浮動零件後,成功生成包含 100 多個獨立組件、具備複雜機械聯動與燈光渲染的 animated V8 引擎 3D 模型。
5. 實測 3:3D 格鬥遊戲開發 (8:52 - 11:52)
複雜任務:需自行至 SketchFab 下載角色模型,並透過 Playwright 瀏覽器擴充功能登入 Mixamo 下載對應動作動畫(跳躍、攻擊、閃避)進行綁定。
成果:雖然過程經歷多次除錯與手把手引導,最終成功做出具備戰鬥特效、打擊感動畫與希臘競技場場景的瀏覽器 3D 格鬥遊戲。
6. AI 模型選擇指南組合包(贊助內容) (11:52 - 13:05)
與 HubSpot 合作提供免費 AI 模型速查表與任務決策矩陣,協助使用者快速挑選最適合的 LLM。
7. 實測 4:DAW 音樂創作 (13:05 - 16:22)
任務:自主搜尋並控制 Waveform DAW,創作一首歐式電子舞曲(Eurodance)《Neon Skyline》。
成果:思考約 53 分鐘,成功編排打擊樂節奏、合成器音色、升降音特效(
Risers/Impacts),並自主掛載 EQ、壓限器等進行 Master 母帶處理。
8. 實測 5:財務報告分析與簡報影片生成 (16:22 - 19:11)
任務:聯網分析騰訊、阿里巴巴、百度最新財報,生成帶語音旁白與動態圖表的影片。成果:耗時 45 分鐘,自主呼叫 Hen 的開源工具 Hyperframes 製作 Motion Graphics影片,並串接 Gemini TTS API 生成英文語音旁白,精準對比三家巨頭的 AI 投資與財務數據。
9. 實測 6:商業創意發想 (19:11 - 20:00)
提供 5 個預估 1 年內可達 1,000 萬美元 ARR 的全新科技創業構想(如:醫療保險拒賠自動化處理、AI 僱傭法合規平台等)。
10. & 12. 視覺與圖形短板實測:尋找青蛙與腫瘤識別 (20:00 - 20:40, 21:43 -22:54)局限性:GLM 5.3 原生不具備視覺(Vision)能力,需調用 Python 或外掛視覺工具來處理圖片。
Find the Frog 測試:失敗,將圖片中的青蛙誤認為貓。
腦腫瘤掃描識別:6 張圖中答對 1 張(達到當前 SOTA 水平,媲美 Kimi K3,優於Opus 5/Fable 5)。
11. 實測 7:深度研究(Deep Research) (20:48 - 21:43)
耗時 11 分鐘完成動脈粥樣硬化的病理生理學與降脂/抗炎策略分析報告,並附帶數據圖表與對比表格,表現優於 Opus 5。
13. 模型規格與性能基準(Specs & Performance) (23:14 - 26:16)
架構與後訓練:模型規模與 GLM 5.2 相同(744B 參數 MoE,激活參數 40B),但純粹透過更強大的強化學習後訓練(Post-training) 獲得巨大的性能提升。
基準測試成績:
在 GDPval(衡量真實經濟價值知識工作)與 Automation Bench 上奪得世界第一。Slime 框架:ZAI 開源了其 RL 後訓練框架「Slime」,大幅提升長推理 RL 效率達2.3 倍。
性能分級:提供 Low, High, Max 三種思考等級,Low 版本的表現即超越 GLM 5.2 Max,接近 Claude Fable 5。
14. 網路安全能力與 OpenVulnerability (26:16 - 28:40)
安全測試第一:在 CyberGym、Exploit Bench 等測試中高居榜首。
漏洞挖掘成就:GLM 5.3 已在 Linux Kernel、Apple Safari (WebKit)、FreeBSD 等知名開源項目中發現超過 2,400 個隱藏漏洞(其中 1,972 個為高危/臨界風險),最古老的漏洞已存在長達 43 年(1981 年至今)。
Open Vulnerability 平台:ZAI 在 Hugging Face 推出了免費的安全掃描工具,開源項目維護者可免費提交 GitHub 連結進行漏洞檢測(檢測結果加密僅維護者可見)。
15. 開源計畫與使用方式 (28:40 - 30:54)
訂閱與使用:目前僅限訂閱 GLM Coding Plan 並透過 ZCode 等 Harness 介面使用(API 與線上 Chat 稍後推出)。
開源預告:官方計畫在發佈 2 週內開放模型權重(包含全量 1.5TB、FP8 756GB、以及Unsloth GGUF 量化版本,最小量化版約 217GB)。
總結:GLM 5.3 在編程與網路安全領域極強,綜合能力與 Kimi K3 相當,是目前最強大的開源 LLM 之一。
--
Gemini整理
擅長找bug漏洞 不擅長找青蛙
可以做為公司資安守護用 抱抱臉都說讚
--