Mage-Flow 4B微軟輕量開源圖片模型
https://huggingface.co/microsoft/Mage-Flow
https://x.com/wildmindai/status/20798505277775…
https://pbs.twimg.com/media/HN0cGSxXEAAf2Zq?fo…
https://pbs.twimg.com/media/HN0cIDEXQAAujAO?fo…
Mage-Flow(微軟 4B 原生解析度影像生成與編輯模型)介紹
基礎資訊
Mage-Flow 是微軟(Microsoft Asia)於 2026 年 7 月 22 日左右正式釋出的開放權重影像生成與編輯模型家族,核心為 4B(40 億)參數規模的精巧堆疊。模型名稱來自「Mage」(微軟的輕量多模態系列)與「Flow」(整流流 Rectified Flow 訓練)。
核心設計理念:不追求極大參數規模,而是透過 Tokenizer(Mage-VAE)– Backbone(NR-MMDiT)– System 共同設計,在有限算力下達到與數十億參數模型競爭的品質,同時具備高效、低記憶體與易微調特性。
主要組成
Mage-VAE:輕量高保真潛空間 Tokenizer(單步擴散式 encode/decode),重建品質接近 FLUX.2-VAE,但 encode/decode 每像素 MACs 減少約 **12× / 22×,大幅降低高解析度瓶頸。
NR-MMDiT(Native-Resolution Multimodal Diffusion Transformer):4B 原生解析度多模態 DiT,使用 Rectified Flow Matching 訓練。支援 **512~2048 任意長寬比(含極端 4:1),透過原生解析度 packing + 融合 kernel,大幅提升訓練與推論效率。
模型變體(均以 Diffusers 格式釋出):
生成系列**(Text-to-Image):Base(30 步)、RL-aligned(20 步,主推薦)、Turbo(4 步蒸餾)。
編輯系列**(Instruction-based Image Editing):同樣有 Base、RL-aligned、Turbo三種。
Hugging Face 主要連結:
主模型:https://huggingface.co/microsoft/Mage-Flow
其他變體與集合:https://huggingface.co/collections/microsoft/m…
授權:MIT(極為開放,可商用與研究)。
性能亮點(10242 解析度,單張 A100):
Turbo 生成:0.59 秒 / 圖,峰值記憶體 18–20 GB。
Turbo 編輯:1.02 秒 / 編輯。
訓練加速:原生 packing + 融合 kernel 讓單步訓練時間從 1.93s 降至 0.78s(約 2.5× 加速)。
性能與基準測試
在多個公開基準上,4B 規模的 Mage-Flow 達到或超越多個更大開放模型(如 FLUX.2 32B、Qwen-Image 20B、Z-Image 6B 等):
生成:GenEval 高達 **0.90(RL 版),Turbo 版仍有 0.88;在 DPG、TIIF、OneIG(中英)、LongText 等指標上表現優異,尤其文字渲染(英/中)能力強。
編輯**:在 ImgEdit-Bench、GEdit-Bench(中英)、TextEdit-Bench 上具競爭力,支援語意內容編輯、外觀轉換、結構保留、修復等多種指令。
整體在 品質–效率–記憶體 三維度形成極佳前沿,尤其適合本地部署與互動使用。
網路評價與社群反應
模型剛釋出不久(約 1 天內),但已在 Reddit、X(Twitter)、LinkedIn 等平台獲得正面關注:
優點被廣泛提及**:
參數小、速度快、記憶體低,適合個人 GPU(甚至部分 AMD 硬體已成功運行)。
輸出自然、細節好、文字渲染能力突出(中英文皆佳)。
Turbo 版實現真正「互動級」延遲,編輯功能多樣且實用。
開源 + MIT 授權 + Diffusers 相容,方便整合與微調(LoRA 等)。
早期使用者反饋**:
Reddit /r/StableDiffusion 有實際生成範例與速度測試(Apple Silicon 上也有運行紀錄)。
X 上有人在 DGX Spark 等硬體測試,讚賞品質與 Turbo 版表現。
https://x.com/ivanfioravanti/status/2079910018…
https://pbs.twimg.com/media/HN1OO20WMAAmCyS?fo…
https://pbs.twimg.com/media/HN1POCMWMAAvPbf?fo…
https://pbs.twimg.com/media/HN1Sz-2XEAA-BoO?fo…
https://pbs.twimg.com/media/HN1S9n5W4AAFyuU?fo…
部分人認為在自然度上優於某些更大模型,適合本地 Agent 整合。
潛在注意事項**:早期測試提到 Turbo 版可能較「柔和」、某些 NSFW 內容有過濾/白盒現象(常見於對齊模型);完整功能需正確安裝 flash-attn 等依賴。
適合對象
追求高效本地部署的研究者與開發者。
需要快速生成 + 強大指令編輯的創作者。
硬體資源有限但想跑高解析度模型的使用者。
對模型微調、LoRA 訓練有需求的社群。
總結:Mage-Flow 是 2026 年開放影像模型領域的一大亮點,展現「小而精」共同設計的威力,在效率與品質間取得優秀平衡。推薦直接到 Hugging Face 頁面查看詳細技術報告、展示圖庫與程式碼範例。
--
Grok整理
我也拿DEMO試了一下 要loli elf出來卡通版 要比基尼美女就空白了 看來是有審查https://huggingface.co/spaces/hugging-apps/mag…
--