← 回熱門
📌 AI_Art 💨 剛冒煙 💬

LTX-2.5更新 比MiniMax小點快點

👤 error405 (流河=L) 🕐 Wed Aug 12 08:48:22 2026
▲ 4 推 ▼ 0 噓 → 1 回應
分享
🔔 追這個瓜,別錯過後續
挑下面的關鍵字追蹤——只要 爆了有後續延燒,第一時間通知你

https://x.com/ltx_io/status/2087255203489755243

LTX-2.5:開源世界模型的重大升級,專為電影、即時應用與實體 AI 打造

2026 年 8 月 11 日,LTX(由 Lightricks 分拆出的開源世界模型公司)正式發布LTX-2.5。這是目前市場上最強力的開源權重(open weights)世界模型之一,延續並大幅強化 LTX-2 系列在電影製作、機器人與即時生成領域的應用基礎。官方將其定位為「世界建構於其上的世界模型」(the world model the world builds on),強調不是「租用工具」,而是「可自由建置、微調的基礎模型」。

核心定位與背景

LTX 系列已累積超過 3300 萬次下載,是使用最廣泛的開源世界模型。LTX-2.5 在LTX-2 / 2.3 的 22B 參數非對稱雙流擴散 Transformer(asymmetric dual-stream DiT)架構上,幾乎重建了整個生成管線,而非簡單疊加功能。它支援同步音訊與視訊生成、原生多鏡頭(native multishot)、更高像素保真度,並可運行於從資料中心 GPU 到Mac、甚至較低 VRAM(約 16GB 起)的硬體。

授權方面,採社群授權(Community License):年營收低於 1000 萬美元的組織可免費使用、修改與自架;更高營收需洽談商業授權。支援 Hugging Face 開源權重、ComfyUI原生整合(發布日即支援)、LTX API,以及本地 PyTorch / Diffusers 管線。

主要升級重點

根據官方部落格與新聞稿,關鍵改進包括:

Diffusion Fidelity Rendering(擴散保真渲染)**:先在 8 倍時間壓縮的潛在空間建構運動與結構,同時生成高保真關鍵幀來錨定細節,再依場景複雜度動態分配算力。最終以擴散解碼器重建精細細節(如臉部、文字),大幅減少高運動場景的視覺偽影,使輸出在電影螢幕上仍能保持幀對幀品質。

原生多鏡頭一致性**:一次生成多個鏡頭(遠景、中景、特寫),角色、環境、光線與聲音跨鏡頭保持一致,解決過去分開生成導致漂移的問題。

更強的提示理解**:採用客製化 Gemma 4 語言骨幹 + 專用提示增強器,更精準處理複雜、多主體提示。

專業製作支援**:完整 HDR ACES 工作流(EXR 輸入輸出,保留動態範圍)、更高畫質的擴散視訊解碼器、自動時長預測、以及針對實體 AI / 機器人的預訓練檢查點,方便領域微調。

效率與本地優化**:與 NVIDIA 合作,優化 RTX GPU 與 DGX Spark 的本地推理,降低記憶體需求。蒸餾模型在保持近全模型品質的同時,成本與時間大幅下降。

官方宣稱在雙 NVIDIA GB200 上,10 秒 720p 圖生視訊僅需約 6.8 秒(快於即時);透過 API 約 23.7 秒。人類盲測偏好測試中,LTX-2.5 獲得約 67% 勝率(略高於

Seedance 2.5 的 65%)。這些為廠商自行數據,獨立基準(如 Artificial Analysis)尚未完全納入,需自行驗證。

目前網路評價與社群反應

發布僅約一天(截至 2026 年 8 月 12 日),評價以正面與期待為主,但也有務實比較

正面觀點**:速度與本地可部署性被高度讚賞,尤其對電影與機器人團隊。官方合作夥伴 Asteria(電影)、Reactor(即時應用)、Markov Robotics 等公開背書其生產可用性與微調靈活性。ComfyUI 共同創辦人強調開放模型能讓開發者快速從實驗走向自架生產管線。社群分享測試影片,稱多鏡頭一致性與畫質提升明顯,多數 LTX-2.3 的 LoRA /IC-LoRA 可直接轉移。

比較與保留**:部分用戶指出它是對 2.3 的實質升級(而非直接對標最新封閉模型如MiniMax H3),在特定提示或本地硬體上仍有限制(例如部分 Mac MPS 錯誤、某些動作生成較弱)。速度優勢在高端硬體上突出,但一般用戶透過 API 或消費級 GPU 的實際體驗會有差距。授權並非完全 OSI 定義的開源(有營收門檻與使用限制),也被部分評論提及。

整體社群氣氛積極:X 上官方貼文觀看近 30 萬,開發者快速分享 ComfyUI 工作流、量化版本與測試結果,認為「用途可依需求與其他模型互補」。

適用場景與取得方式

適合電影預視 / 製作、廣告、即時互動世界、機器人模擬與領域微調團隊。可透過Hugging Face LTX-2.5 集合、ComfyUI 原生節點、LTX API 或本地安裝取得。更多細節見官方 新聞稿 與 部落格。

LTX-2.5 延續了 LTX「開放權重 + 生產級效率」的策略,在封閉模型主導的市場中,為需要掌控資料、IP 與成本的團隊提供了強力選項。隨著社群更多真實工作流測試出爐,其在實際生產中的表現將更清晰。

--

LTX-2.5 與 MiniMax H3 比較(2026 年 8 月)

兩者皆為近期釋出的開源權重(open weights)多模態影音生成模型,支援原生同步音訊與視訊,並可在 ComfyUI 等環境本地運行。LTX-2.5(2026 年 8 月 11 日由 LTX /Lightricks 發布)強調生產級效率、電影工作流與實體 AI;MiniMax H3(2026 年 7月 31 日宣布、8 月 3 日開源權重,亦稱 Hailuo 3.0)則主打全模態統一理解與豐富參考輸入。兩者無絕對勝負,適合場景不同。

基本規格對照

| 項目 | LTX-2.5 | MiniMax H3 |

|------|---------|------------|

| 參數規模 | 約 22B(非對稱雙流 DiT)

| 約 33.1B dense Omni Transformer(推理約 20B active) |

| 文字編碼器 | 客製 Gemma 4

| Qwen3-VL-32B |

| 最長時長 | Pro 約 2–10 秒;Fast 可至 20 秒(依解析度)

| 4–15 秒(整數) |

| 解析度 | 最高原生 4K HDR,支援 EXR / ACES 工作流

| 預設 768p 短邊;2K 需 H3-Regenerate-2K(部分模組尚未完全開源) |

| 幀率 | 支援 24/25 等,部分模式更高

| 24 FPS |

| 音訊 | 原生同步音訊(雙聲道)

| 原生 32 kHz 立體聲音訊(同一遍生成) |

| 多鏡頭 | 原生多鏡頭一致性(一次生成跨鏡頭保持角色/場景/聲音)

| 原生多鏡頭建模 |

| 輸入模式 | 文生視訊、圖生視訊、編輯真實素材、IC-LoRA 等;LoRA 生態成熟| 文生、首/尾幀、豐富參考(最多 9 圖 + 3 影片 + 3 音訊,總共 2 檔) |

| 硬體需求 | 優化後約 16GB VRAM 起,支援 Mac、RTX、DGX;量化友善

| 完整版較大,量化後約 24GB VRAM 可跑(社群有更低報告) |

| 授權 | 社群授權,年營收 <1000 萬美元免費

| MiniMax H3 Community License(有地域限制等細節) |

| 取得方式 | Hugging Face 完整權重 + ComfyUI 原生 + API

| Hugging Face 權重(Base 開源,部分模組 API)+ ComfyUI + API |

核心優勢差異

LTX-2.5 的強項:

速度與效率**:官方數據在雙 NVIDIA GB200 上,10 秒 720p 圖生視訊約 6.8 秒(快於即時);API 約 23.7 秒。社群在消費級硬體(如 RTX 5090)上也顯示明顯快於 H3。適合高迭代、即時與生產管線。

電影與專業工作流**:Diffusion Fidelity Rendering、HDR ACES / EXR 支援、真實素材編輯、實體 AI / 機器人預訓練檢查點、成熟的 LoRA / IC-LoRA 生態(多數 2.3 版本可直接轉移)。

本地可控性與成本**:強調自架、資料與 IP 不離開設備,適合電影、廣告、機器人與需要長期微調的團隊。

MiniMax H3 的強項:

全模態參考能力**:可同時輸入多圖、多段影片與音訊,並用自然語言描述它們與目標的關係(例如「參考影片 1 的鏡頭運動、圖片 2 的人物、音訊 3 的歌聲」)。在角色一致性、動作遷移(V2V)、品牌文字渲染與複雜指令遵循上表現突出。

品質與編輯**:獨立基準(Artificial Analysis)顯示在 Video Editing 常居前列,Text-to-Video 與 Image-to-Video 也排名靠前。原生立體聲與多語言對話(穩定支援11 種語言)較完整。

商業短內容**:廣告、電商、品牌、產品展示等需要精確參考與音畫同步的場景優勢明顯。

速度與品質的直接比較

速度**:LTX 官方與社群一致認為 LTX-2.5 明顯更快(尤其本地部署)。LTX 自行測試中,H3 API 生成同類任務約需 180 秒,遠高於 LTX。社群在相同硬體上的實測也顯示LTX 迭代效率更高。

品質**:LTX 自行盲測偏好測試中,LTX-2.5 約 67% 勝率,H3 約 50%。但這是廠商數據,且獨立排行榜上 H3 在編輯與部分生成任務更強。社群實測常指出:H3 在複雜人體運動、表情與多參考一致性上更佳;LTX 在像素保真、高運動偽影控制與電影感上有優勢。兩者在「用途互補」的共識較高。

生態與部署

LTX-2.5**:ComfyUI 發布日即原生支援,NVIDIA 優化,電影工作室(如 Asteria)與機器人團隊已有實際採用案例。本地生態更成熟、量化與工作流更豐富。

MiniMax H3**:ComfyUI 同步支援,權重開源後社群快速量化(INT8、NVFP4 等)。API與 Hailuo 產品線完整,但完整 2K 管線部分仍依賴官方服務。

選擇建議

選 LTX-2.5**:需要高速迭代、本地自架、電影級 HDR / 專業後期、長時間生產管線、或機器人 / 實體模擬。重視成本可控與資料隱私時更佳。

選 MiniMax H3**:需要豐富多模態參考(多圖 + 影片 + 音訊同時控制)、角色/動作/聲音精準遷移、短片廣告 / 品牌內容、或較強的指令遵循與編輯能力時更適合。

實務建議**:多數創作者會兩者並用——用 LTX 快速出草稿與控制管線,用 H3 處理需要多參考一致性的最終鏡頭。兩者皆可本地運行,可依硬體與專案需求切換。

目前(2026 年 8 月中)兩者都仍在快速迭代,社群測試持續增加。建議直接在

ComfyUI 用相同提示與素材做 side-by-side 比較,以實際專案為準。

--

Grok整理

推特有不少測試能看了https://x.com/search?q=LTX%202.5

開源模型那是越多越好

--

看 PTT 原文 ↗ 接著看下一篇 ▶ 2026/08/12 盤中閒聊 📈 股票 · ▲1003▼128看下一篇 →

🍉 更多相關的瓜

同板/同主題,繼續吃
⚾ 棒球 MLB 皇家 vs 道奇 Wacha-Snell ▲415▼4 🍵 八卦 台股「風電國家隊」爆下市危機!獨董跑光又欠一屁股債 ▲124▼16 🍵 八卦 吳乃仁欠台糖1.7億僅月還5萬惹議 綠委緩頰:他不會去賴這筆帳 ▲160▼100 🍵 八卦 海巡疏失 2陸男偷渡上岸玩6天 ▲212▼30