MiniMax H3 Ref2VA
先說結論 MMH3 原則上就是要像寫劇本那樣寫提示詞
不管你是文生影 圖生影 參考生影 還是要換角色都是
我昨晚研究超久.看了二個大陸人和幾個reddit範例
並且參考圖他們使用的都是角色卡
而大陸人二個案例中
案例一是codex在本地部屬 這部分我比較不懂
反正它就只是工作流 寫了大意 後 把工作流截圖丟給本地LLM
它是怎麼透過你一張截圖就分析你工作流影片中內容我就不知道了
和代理人之類有關?
總之它就在本地分析後 寫了一長串的提示詞你複製貼上
案例二是工作留有LLM模型 使用API提取
單純寫了簡單一句 參考視頻1.圖片1取代視頻1的人物
然後點插件上的AI分析 它幫你分析後寫出來

但是我不知道為何RH海外版 openai/gpt5.6/sol寫出來的提示詞並沒有寫出劇情
只有類似這種內容

所以即便我用了AI分析去寫 我運行後的替換人物還是失敗
但是大陸人本地分析用的Qwen3 VL-4B
生成的就有詳細描寫影片中的人物與動作和場景之類
而reddit中3周前的人物替換示範都如同我上面說的
要寫很詳細的那種腳本提示詞+角色卡三視圖
但其中也有人說
確實有時候只寫了 "圖片1的人物替換影片1中的人物"也會成功
https://www.reddit.com/r/StableDiffusion/comme…
https://i.meee.com.tw/cVMgyvl.jpg 留言處的提示詞翻譯

https://app.notion.com/p/CHARACTER-SWAP-V2V-PR…
3b663c2a7548802a8143d3ac8cb23373
其他人範例
所以目前看起來提示詞是第一最大種點 尤其是最好要透過AI分析去寫
並且是要寫出整個原影片中的內容例如人物站起來了 旋轉之類
不能只單純寫
"在影片片段的中間部分,重現目標女性表演中的每一個手勢、重心轉移、手部動作、互動以及臉部表情。透過動作模糊、部分遮蔽、側面視角和鏡頭比例的變化,保持清晰的時間一致性。確保(S1)的外觀保持可辨識度,且不發生偏移,同時眼神、表情強度和唇部動作與原始素材完全一致。保持所有其他人物、物體、環境運動和空間關係不變。"
這種內容 失敗率極高
而三視圖是否一定要用我不知道
然後我剛才測試了另外一種方式寫提示詞
就是把死侍那段提示詞作成記事本
然後準備影片一則 替換人物圖一個
丟給grok(目前大概可能只有grok對nsfw能描寫?
我就說 參考記事本內的寫法 描述影片中10秒內容 死侍部分替換成圖片中人物
生成的結果是詳細的 非籠統的
等等拿這段去測試再來回報看看
我是線上派 本地設備不行
所以本底部屬 codex那些 還請會的人分析
點回原題 MMH3需要講解很詳細給模型聽 需要透過LLM去分析
或許未來有人會升級插件一次完成
像以前對grok或是seedance那樣
直白一句+@就解決你要做的事
--