Seedance2.5/MiniMaxH3測評影片摘要
音樂錄影帶(Music Video):
MiniMax 表現驚艷,能精準將鏡頭剪輯、角色對嘴、文字特效與歌曲節奏(Beat)進行同步。
Seedance 生成結果較為奇怪,因此在音樂影片與文字特效合成上 MiniMax 獲勝。
昨晚程式寫完告一段落 想試點新東西於是就挑了這個
既然評測說MV是強項 那就用它來做一隻完整的音樂MV試試
成品: https://youtu.be/ivAZLdRb-ac
材料準備: 我的avatar照x1, 音樂MVx1
平台: ComfyUI DeskTop
模型: MiniMax H3官方模型(無越獄) ref2va_pruned_int8_convrot
問題在於我在影片生成這領域是小白
軟體工程方面還行 於是請出Opus5 把要做的事和他討論了下
目標是可工程化 把音樂MV中的歌手換成我
且我不想要做任何影片編輯或後製: 一隻完整的MV進去 就一隻完整的MV出來
我先在ComfyUI下把Demo workflow拉完會動, 然後匯出API
接著Opus5就開工了 它做了幾個我覺得不錯的開始
1.先測5s和15s影片所花的時間: 相差6倍, 於是決定都以5s來切片
2.再測ref_video的解析度造成的速度差異: 低解析度快非常多 480p比720p快3倍
3.step用10和20和30各測一小段,產出無明顯差異,但速度當然是10最快,於是選10
4.驗證階段先求快,所以輸出也選最小的0.2mp
5.切片方式: Opus5解釋說必須切在鏡頭轉場處才不會太奇怪 且需要考慮關鍵幀
於是它寫了一隻程式呼叫ffmpeg來偵測轉場以及自動切片
6.試跑了幾段之後,我發現每一段的開頭常會換人失敗,Opus5試了很多方法都無法解決於是我跟他解釋了先導幀的概念 它很快實作完成並驗證有效
接著我就交給他處理先去睡了 早上起來已經產出完整MV
看了下其中幾段有瑕疵 但由於都是切片好的 換個seed只跑那幾段 替換後解決
到這裡整個過程基本已完成自動化 換張照片和MV 就可以產出下一首
速度: 每一段切片運算時間小於2分鐘 共23段
產出完整MV共花費: 約50分鐘
下一階段會再測試用Lora 4步加速 在時間節省和品質上的取捨
以及把0.2mp提高到0.4或0.7mp 畢竟現在這樣有點糊
用來做概念驗證求快而已
--