← 回熱門
📌 AI_Art 💨 剛冒煙 💬

Mage-Flow 4B微軟輕量開源圖片模型

👤 error405 (流河=L) 🕐 Thu Jul 23 11:18:59 2026
▲ 0 推 ▼ 0 噓 → 10 回應
分享
🔔 追這個瓜,別錯過後續
挑下面的關鍵字追蹤——只要 爆了有後續延燒,第一時間通知你

https://huggingface.co/microsoft/Mage-Flow

https://x.com/wildmindai/status/20798505277775…

https://pbs.twimg.com/media/HN0cGSxXEAAf2Zq?fo…

https://pbs.twimg.com/media/HN0cIDEXQAAujAO?fo…

Mage-Flow(微軟 4B 原生解析度影像生成與編輯模型)介紹

基礎資訊

Mage-Flow 是微軟(Microsoft Asia)於 2026 年 7 月 22 日左右正式釋出的開放權重影像生成與編輯模型家族,核心為 4B(40 億)參數規模的精巧堆疊。模型名稱來自「Mage」(微軟的輕量多模態系列)與「Flow」(整流流 Rectified Flow 訓練)。

核心設計理念:不追求極大參數規模,而是透過 Tokenizer(Mage-VAE)– Backbone(NR-MMDiT)– System 共同設計,在有限算力下達到與數十億參數模型競爭的品質,同時具備高效、低記憶體與易微調特性。

主要組成

Mage-VAE:輕量高保真潛空間 Tokenizer(單步擴散式 encode/decode),重建品質接近 FLUX.2-VAE,但 encode/decode 每像素 MACs 減少約 **12× / 22×,大幅降低高解析度瓶頸。

NR-MMDiT(Native-Resolution Multimodal Diffusion Transformer):4B 原生解析度多模態 DiT,使用 Rectified Flow Matching 訓練。支援 **512~2048 任意長寬比(含極端 4:1),透過原生解析度 packing + 融合 kernel,大幅提升訓練與推論效率。

模型變體(均以 Diffusers 格式釋出):

生成系列**(Text-to-Image):Base(30 步)、RL-aligned(20 步,主推薦)、Turbo(4 步蒸餾)。

編輯系列**(Instruction-based Image Editing):同樣有 Base、RL-aligned、Turbo三種。

Hugging Face 主要連結:

主模型:https://huggingface.co/microsoft/Mage-Flow

其他變體與集合:https://huggingface.co/collections/microsoft/m…

授權:MIT(極為開放,可商用與研究)。

性能亮點(10242 解析度,單張 A100):

Turbo 生成:0.59 秒 / 圖,峰值記憶體 18–20 GB。

Turbo 編輯:1.02 秒 / 編輯。

訓練加速:原生 packing + 融合 kernel 讓單步訓練時間從 1.93s 降至 0.78s(約 2.5× 加速)。

性能與基準測試

在多個公開基準上,4B 規模的 Mage-Flow 達到或超越多個更大開放模型(如 FLUX.2 32B、Qwen-Image 20B、Z-Image 6B 等):

生成:GenEval 高達 **0.90(RL 版),Turbo 版仍有 0.88;在 DPG、TIIF、OneIG(中英)、LongText 等指標上表現優異,尤其文字渲染(英/中)能力強。

編輯**:在 ImgEdit-Bench、GEdit-Bench(中英)、TextEdit-Bench 上具競爭力,支援語意內容編輯、外觀轉換、結構保留、修復等多種指令。

整體在 品質–效率–記憶體 三維度形成極佳前沿,尤其適合本地部署與互動使用。

網路評價與社群反應

模型剛釋出不久(約 1 天內),但已在 Reddit、X(Twitter)、LinkedIn 等平台獲得正面關注:

優點被廣泛提及**:

參數小、速度快、記憶體低,適合個人 GPU(甚至部分 AMD 硬體已成功運行)。

輸出自然、細節好、文字渲染能力突出(中英文皆佳)。

Turbo 版實現真正「互動級」延遲,編輯功能多樣且實用。

開源 + MIT 授權 + Diffusers 相容,方便整合與微調(LoRA 等)。

早期使用者反饋**:

Reddit /r/StableDiffusion 有實際生成範例與速度測試(Apple Silicon 上也有運行紀錄)。

X 上有人在 DGX Spark 等硬體測試,讚賞品質與 Turbo 版表現。

https://x.com/ivanfioravanti/status/2079910018…

https://pbs.twimg.com/media/HN1OO20WMAAmCyS?fo…

https://pbs.twimg.com/media/HN1POCMWMAAvPbf?fo…

https://pbs.twimg.com/media/HN1Sz-2XEAA-BoO?fo…

https://pbs.twimg.com/media/HN1S9n5W4AAFyuU?fo…

部分人認為在自然度上優於某些更大模型,適合本地 Agent 整合。

潛在注意事項**:早期測試提到 Turbo 版可能較「柔和」、某些 NSFW 內容有過濾/白盒現象(常見於對齊模型);完整功能需正確安裝 flash-attn 等依賴。

適合對象

追求高效本地部署的研究者與開發者。

需要快速生成 + 強大指令編輯的創作者。

硬體資源有限但想跑高解析度模型的使用者。

對模型微調、LoRA 訓練有需求的社群。

總結:Mage-Flow 是 2026 年開放影像模型領域的一大亮點,展現「小而精」共同設計的威力,在效率與品質間取得優秀平衡。推薦直接到 Hugging Face 頁面查看詳細技術報告、展示圖庫與程式碼範例。

--

Grok整理

我也拿DEMO試了一下 要loli elf出來卡通版 要比基尼美女就空白了 看來是有審查https://huggingface.co/spaces/hugging-apps/mag…

--

看 PTT 原文 ↗ 接著看下一篇 ▶ Fw: [新聞] 數學界天翻地覆,代數幾何 87 年懸案「 📌 AI_Art · ▲146▼3看下一篇 →

🍉 更多相關的瓜

同板/同主題,繼續吃
⚾ 棒球 今日李灝宇 ▲263▼19 🎮 C洽 同居後發現男朋友早上都不刷牙洗臉 ▲147▼5 📌 LoL 更新一下lpl轉會喜劇的乳摸 ▲158▼2 🎮 C洽 為什麼活俠傳在中國反而沒有爆紅? ▲102▼5