Kimi K3開放日:模型權重、技術報告和關鍵Infra技術同步開放
原文標題: Kimi K3開放日:模型權重、技術報告和關鍵Infra技術同步開放
原文連結:https://news.futunn.com/hk/post/76650176/
發布時間: 2026/07/28
記者署名:stephen (文章來源為月之暗面)
原文內容:
今天是 Kimi K3 開放日,我們發佈 Kimi K3 的模型權重、技術報告,並開源支撐 Kimi K3模型訓練的關鍵 Infra 技術:MoonEP、FlashKDA和AgentEnv。希望以此加速前沿智能的部署與普及,促進 AGI 研究。
Kimi K3 是我們能力最強的模型:這是一個擁有 2.8 萬億參數的混合專家(MoE)模型,具備原生視覺理解能力,並支持 100 萬 token 的上下文窗口。
Kimi K3 參數規模是 Kimi K2.5 的 3 倍左右,但是規模化並不僅僅是參數的堆疊,在並不寬裕的算力條件下,我們憑藉 Kimi Delta Attention、Attention Residuals 以及 MoonEP等一系列技術創新,規模化效率提升了 2.5 倍(即在算力最優意義下,單位算力產出智能約等於原來 2.5 倍)。
現在,每個人都可以下載並部署 Kimi K3 模型——無論是用於內部研發,還是嵌入到面向終端用戶的產品中,均可自由使用(其他使用情形,詳見Kimi K3 許可證)。
今天,與 Kimi K3 模型權重一起公開的,還有我們的模型訓練方法——Kimi K3 技術報告已同步上線。
從技術報告中,你可以了解這些技術細節:
KDA + AttnRes:以 3:1 比例混合 KDA 與 Gated MLA,實現高效長上下文建模,並通過塊級注意力殘差增強跨層信息流動。
Stable LatentMoE:每個 token 從 896 個路由專家中激活 16 個,並通過 SiTU-GLU 與 Q uantile Balancing 保持極高稀疏度下的訓練穩定。
MoonViT-V2:視覺編碼器從零開始使用 next-token prediction 訓練,無需對比預訓練,在達到 SigLIP 初始化基線效果的同時獲得更穩定的優化過程。
後訓練與評估:在通用推理、通用 Agent 和編程 Agent 三大領域進行大規模任務合成,百萬 token 上下文的強化學習基建,近 20 個內部評測集的完整評估結果。
以上幾點只是概覽,詳細論述與消融實驗,都已在技術報告中展開。
模型能力背後,離不開訓練系統,即 Infra 基礎設施層的穩定支撐。今天,我們向大家介紹支撐 Kimi K3 訓練的三項 Infra 技術:MoonEP、FlashKDA 和 AgentEnv,覆蓋從高性能通信、高性能算子到分佈式 RL 環境的關鍵鏈路。其中 FlashKDA 此前已開源,MoonEP 和AgentEnv 則隨本次發佈正式開源。
MoonEP:MoonEP 是我們爲超大的細粒度 MoE 打造的高性能通信庫,讓專家並行(expert-p arallel)的通信在不均衡的情況下仍然實現極致效率。
FlashKDA:FlashKDA 是我們實現的 Kimi Delta Attention 高性能算子(kernel)。在英偉達 H20 上,相比 flash-linear-attention 基線,它的 prefill 速度提升 1.72-2.22倍,可以直接作爲 flash-linear-attention 的替換後端。
AgentEnv:AgentENV 是我們與 KVCache.ai 合作開發的沙箱系統,用於大規模運行 Agent環境。它爲 Kimi K3 的後訓練提供高保真、強隔離沙箱,靈活支持快速快照、恢復和分叉(fork)等,可以應對大規模並行的 Agent 工作流與訓練任務。
這三項技術是支撐 Kimi K3 訓練效率與穩定性的關鍵。現在將它們開放出來,希望也能爲你訓練下一代模型提供幫助。
我們堅信開放權重模型的價值。它們能降低獲取智能的門檻,推動創新,並賦予用戶對數據更大的控制權、隱私保護和所有權。在過去幾周裏,我們很高興聽到了許多來自 AI 社區,以及與我們有着共同願景的技術領袖的支持聲音。
我們相信,對於 AGI 這樣具有深遠影響的技術,一個廣泛、開放的生態系統是最適合承載它的土壤。爲此,我們將繼續貢獻自己的力量。
心得/評論:
Kimi K3今天正式開源,已經有多家服務商上線了
只要近乎Sonnet的價格就能享受部分跑分超越Fable的模型
不想花錢的也沒關係,只要有6TB記憶體你也能在家跑
記憶體又要不夠了...
--