LTX-2.5更新 比MiniMax小點快點
https://x.com/ltx_io/status/2087255203489755243
LTX-2.5:開源世界模型的重大升級,專為電影、即時應用與實體 AI 打造
2026 年 8 月 11 日,LTX(由 Lightricks 分拆出的開源世界模型公司)正式發布LTX-2.5。這是目前市場上最強力的開源權重(open weights)世界模型之一,延續並大幅強化 LTX-2 系列在電影製作、機器人與即時生成領域的應用基礎。官方將其定位為「世界建構於其上的世界模型」(the world model the world builds on),強調不是「租用工具」,而是「可自由建置、微調的基礎模型」。
核心定位與背景
LTX 系列已累積超過 3300 萬次下載,是使用最廣泛的開源世界模型。LTX-2.5 在LTX-2 / 2.3 的 22B 參數非對稱雙流擴散 Transformer(asymmetric dual-stream DiT)架構上,幾乎重建了整個生成管線,而非簡單疊加功能。它支援同步音訊與視訊生成、原生多鏡頭(native multishot)、更高像素保真度,並可運行於從資料中心 GPU 到Mac、甚至較低 VRAM(約 16GB 起)的硬體。
授權方面,採社群授權(Community License):年營收低於 1000 萬美元的組織可免費使用、修改與自架;更高營收需洽談商業授權。支援 Hugging Face 開源權重、ComfyUI原生整合(發布日即支援)、LTX API,以及本地 PyTorch / Diffusers 管線。
主要升級重點
根據官方部落格與新聞稿,關鍵改進包括:
Diffusion Fidelity Rendering(擴散保真渲染)**:先在 8 倍時間壓縮的潛在空間建構運動與結構,同時生成高保真關鍵幀來錨定細節,再依場景複雜度動態分配算力。最終以擴散解碼器重建精細細節(如臉部、文字),大幅減少高運動場景的視覺偽影,使輸出在電影螢幕上仍能保持幀對幀品質。
原生多鏡頭一致性**:一次生成多個鏡頭(遠景、中景、特寫),角色、環境、光線與聲音跨鏡頭保持一致,解決過去分開生成導致漂移的問題。
更強的提示理解**:採用客製化 Gemma 4 語言骨幹 + 專用提示增強器,更精準處理複雜、多主體提示。
專業製作支援**:完整 HDR ACES 工作流(EXR 輸入輸出,保留動態範圍)、更高畫質的擴散視訊解碼器、自動時長預測、以及針對實體 AI / 機器人的預訓練檢查點,方便領域微調。
效率與本地優化**:與 NVIDIA 合作,優化 RTX GPU 與 DGX Spark 的本地推理,降低記憶體需求。蒸餾模型在保持近全模型品質的同時,成本與時間大幅下降。
官方宣稱在雙 NVIDIA GB200 上,10 秒 720p 圖生視訊僅需約 6.8 秒(快於即時);透過 API 約 23.7 秒。人類盲測偏好測試中,LTX-2.5 獲得約 67% 勝率(略高於
Seedance 2.5 的 65%)。這些為廠商自行數據,獨立基準(如 Artificial Analysis)尚未完全納入,需自行驗證。
目前網路評價與社群反應
發布僅約一天(截至 2026 年 8 月 12 日),評價以正面與期待為主,但也有務實比較
正面觀點**:速度與本地可部署性被高度讚賞,尤其對電影與機器人團隊。官方合作夥伴 Asteria(電影)、Reactor(即時應用)、Markov Robotics 等公開背書其生產可用性與微調靈活性。ComfyUI 共同創辦人強調開放模型能讓開發者快速從實驗走向自架生產管線。社群分享測試影片,稱多鏡頭一致性與畫質提升明顯,多數 LTX-2.3 的 LoRA /IC-LoRA 可直接轉移。
比較與保留**:部分用戶指出它是對 2.3 的實質升級(而非直接對標最新封閉模型如MiniMax H3),在特定提示或本地硬體上仍有限制(例如部分 Mac MPS 錯誤、某些動作生成較弱)。速度優勢在高端硬體上突出,但一般用戶透過 API 或消費級 GPU 的實際體驗會有差距。授權並非完全 OSI 定義的開源(有營收門檻與使用限制),也被部分評論提及。
整體社群氣氛積極:X 上官方貼文觀看近 30 萬,開發者快速分享 ComfyUI 工作流、量化版本與測試結果,認為「用途可依需求與其他模型互補」。
適用場景與取得方式
適合電影預視 / 製作、廣告、即時互動世界、機器人模擬與領域微調團隊。可透過Hugging Face LTX-2.5 集合、ComfyUI 原生節點、LTX API 或本地安裝取得。更多細節見官方 新聞稿 與 部落格。
LTX-2.5 延續了 LTX「開放權重 + 生產級效率」的策略,在封閉模型主導的市場中,為需要掌控資料、IP 與成本的團隊提供了強力選項。隨著社群更多真實工作流測試出爐,其在實際生產中的表現將更清晰。
--
LTX-2.5 與 MiniMax H3 比較(2026 年 8 月)
兩者皆為近期釋出的開源權重(open weights)多模態影音生成模型,支援原生同步音訊與視訊,並可在 ComfyUI 等環境本地運行。LTX-2.5(2026 年 8 月 11 日由 LTX /Lightricks 發布)強調生產級效率、電影工作流與實體 AI;MiniMax H3(2026 年 7月 31 日宣布、8 月 3 日開源權重,亦稱 Hailuo 3.0)則主打全模態統一理解與豐富參考輸入。兩者無絕對勝負,適合場景不同。
基本規格對照
| 項目 | LTX-2.5 | MiniMax H3 |
|------|---------|------------|
| 參數規模 | 約 22B(非對稱雙流 DiT)
| 約 33.1B dense Omni Transformer(推理約 20B active) |
| 文字編碼器 | 客製 Gemma 4
| Qwen3-VL-32B |
| 最長時長 | Pro 約 2–10 秒;Fast 可至 20 秒(依解析度)
| 4–15 秒(整數) |
| 解析度 | 最高原生 4K HDR,支援 EXR / ACES 工作流
| 預設 768p 短邊;2K 需 H3-Regenerate-2K(部分模組尚未完全開源) |
| 幀率 | 支援 24/25 等,部分模式更高
| 24 FPS |
| 音訊 | 原生同步音訊(雙聲道)
| 原生 32 kHz 立體聲音訊(同一遍生成) |
| 多鏡頭 | 原生多鏡頭一致性(一次生成跨鏡頭保持角色/場景/聲音)
| 原生多鏡頭建模 |
| 輸入模式 | 文生視訊、圖生視訊、編輯真實素材、IC-LoRA 等;LoRA 生態成熟| 文生、首/尾幀、豐富參考(最多 9 圖 + 3 影片 + 3 音訊,總共 2 檔) |
| 硬體需求 | 優化後約 16GB VRAM 起,支援 Mac、RTX、DGX;量化友善
| 完整版較大,量化後約 24GB VRAM 可跑(社群有更低報告) |
| 授權 | 社群授權,年營收 <1000 萬美元免費
| MiniMax H3 Community License(有地域限制等細節) |
| 取得方式 | Hugging Face 完整權重 + ComfyUI 原生 + API
| Hugging Face 權重(Base 開源,部分模組 API)+ ComfyUI + API |
核心優勢差異
LTX-2.5 的強項:
速度與效率**:官方數據在雙 NVIDIA GB200 上,10 秒 720p 圖生視訊約 6.8 秒(快於即時);API 約 23.7 秒。社群在消費級硬體(如 RTX 5090)上也顯示明顯快於 H3。適合高迭代、即時與生產管線。
電影與專業工作流**:Diffusion Fidelity Rendering、HDR ACES / EXR 支援、真實素材編輯、實體 AI / 機器人預訓練檢查點、成熟的 LoRA / IC-LoRA 生態(多數 2.3 版本可直接轉移)。
本地可控性與成本**:強調自架、資料與 IP 不離開設備,適合電影、廣告、機器人與需要長期微調的團隊。
MiniMax H3 的強項:
全模態參考能力**:可同時輸入多圖、多段影片與音訊,並用自然語言描述它們與目標的關係(例如「參考影片 1 的鏡頭運動、圖片 2 的人物、音訊 3 的歌聲」)。在角色一致性、動作遷移(V2V)、品牌文字渲染與複雜指令遵循上表現突出。
品質與編輯**:獨立基準(Artificial Analysis)顯示在 Video Editing 常居前列,Text-to-Video 與 Image-to-Video 也排名靠前。原生立體聲與多語言對話(穩定支援11 種語言)較完整。
商業短內容**:廣告、電商、品牌、產品展示等需要精確參考與音畫同步的場景優勢明顯。
速度與品質的直接比較
速度**:LTX 官方與社群一致認為 LTX-2.5 明顯更快(尤其本地部署)。LTX 自行測試中,H3 API 生成同類任務約需 180 秒,遠高於 LTX。社群在相同硬體上的實測也顯示LTX 迭代效率更高。
品質**:LTX 自行盲測偏好測試中,LTX-2.5 約 67% 勝率,H3 約 50%。但這是廠商數據,且獨立排行榜上 H3 在編輯與部分生成任務更強。社群實測常指出:H3 在複雜人體運動、表情與多參考一致性上更佳;LTX 在像素保真、高運動偽影控制與電影感上有優勢。兩者在「用途互補」的共識較高。
生態與部署
LTX-2.5**:ComfyUI 發布日即原生支援,NVIDIA 優化,電影工作室(如 Asteria)與機器人團隊已有實際採用案例。本地生態更成熟、量化與工作流更豐富。
MiniMax H3**:ComfyUI 同步支援,權重開源後社群快速量化(INT8、NVFP4 等)。API與 Hailuo 產品線完整,但完整 2K 管線部分仍依賴官方服務。
選擇建議
選 LTX-2.5**:需要高速迭代、本地自架、電影級 HDR / 專業後期、長時間生產管線、或機器人 / 實體模擬。重視成本可控與資料隱私時更佳。
選 MiniMax H3**:需要豐富多模態參考(多圖 + 影片 + 音訊同時控制)、角色/動作/聲音精準遷移、短片廣告 / 品牌內容、或較強的指令遵循與編輯能力時更適合。
實務建議**:多數創作者會兩者並用——用 LTX 快速出草稿與控制管線,用 H3 處理需要多參考一致性的最終鏡頭。兩者皆可本地運行,可依硬體與專案需求切換。
目前(2026 年 8 月中)兩者都仍在快速迭代,社群測試持續增加。建議直接在
ComfyUI 用相同提示與素材做 side-by-side 比較,以實際專案為準。
--
Grok整理
推特有不少測試能看了https://x.com/search?q=LTX%202.5
開源模型那是越多越好
--