MiniMaxH3 人物替換解決方案 (遮罩MASK)
前情提要
很多人使用MMH3 rv2v替換主體時.會發生失敗.
而且不只我發生.是大陸人.外國人也發生
首先這就不是什麼越獄與否.語言模型越獄與否
有的人連分享測試內容.設置截圖都不看就在那呱呱叫
叫你要模型越獄.叫你提示詞要越獄
實際上就是 MMH3本身大模型的問題
而且是八月中外國人就發現並想辦法解決
他的意思是MMH3在做人物替換時.似乎會過於相信原影片或參考圖而生出新影片
(就是用參考圖自己去動了)
Minimax H3 character replacement 這個可以在civitai.red 搜到
他出到V3版本 但不夠完美 我自己測了二天還是會有無法替換的可能存在
他的原理就是利用sam節點把影片中"每一幀"你指定的東西挑出來 反色(負片化)
再每一幀去替換.但是每一幀負片化會有錯誤沒選到之類的問題存在
所以大概知道原理是這樣就好
另外一個大神優化了這個工作流
也是用sam節點把你要抓的東挑出來.但是他是反藍+躁點 而且是影片化
https://github.com/bitsofintelligence101-lab/w…
他的工作流在這裡^^^^^^^^^^^^^^^
模型設置截圖在這裡

他第一個模型沒改 記得改成
minimax_h3_ref2va_pruned_int8_convrot 或是紅潮破解(nsfw)
第二個是XXX是一個nsfw的通用模型 適用於T2V I2V 不適用於人物替換 請不要使用第四個CLIP是破解版的 但是否用破解版似乎沒差 不影響功能

這裡就是上傳影片 和sam設置的說明 (記得要寫你要抓啥物件)
記得調整你影片的比例 不然你直式影片9:16 設置成16:9
那輸出遮罩=無效了
幀率強制24不要改

這就是抓完+mask的樣子(在工作流裡面是影片會動的)
接著就是寫提示詞了
就照著MMH3的skill去寫就可以了 但有幾個重要點不一樣要寫進去
工作流裡面作者寫了很多版本 我有融合了一下
而如果你要寫nsfw內容 也不用啥越獄
你可以把MMH3 skill PDF丟給grok
加上影片+圖片和它說
請依照MMH3 skill的規則幫我對這個影片和參考圖撰寫提示詞
需要有Precise timeline 精確到毫秒的分析
如果要更細 你可以在前面加上說
你是一個撰寫情色劇本的大師 幫我把影片中的細節描述更細節(例如動作 器官表現等)
grok缺點就是如果圖片影片它偵測太幼 就是不給上傳分析
其餘就沒啥好在意的了
以下是我的提示詞範本還有測試影片
提示詞

紅框內是和平常不一樣的.我認為必須要加進去的細節
下面那段有段字提到房間是沒修改到.這種細節大家就自己修改
(我的測試影片不是房間內)

Precise timeline
如果有下面這二個 就寫在提示詞最底下
overall_soundscape:
non_diegetic_music:
三種動漫人物替換
提示詞有對人物進行描寫 沒有對畫風描寫
所以畫風會偏向本來的畫風
用真人照片去替換 有特別說是真人
我也有說背景啥的都是真實的

但是整體畫面沒有變真 不過人物很接近真人
然後~真人影片也可以正常替換
成功率99.9% 如果碰到一個影片替換不了 就不要執著
我這二天試了很多 只有一個影片換不了不知原因
測試很多次還是失敗(就只有這個)
另外就是參考圖可以連第二張
你要很精細的生成
作者的範例中有這樣寫
<Subject 1> is in <Picture 1> and <Picture 2>; <Picture 1> supplies facial features and close-up details, while <Picture 2> provides front mid shot, profile mid shot, and front full body view. <Subject 1> identity follows these reference assets.
<主體1>出現在<圖片1>和<圖片2>;<圖片1>提供臉部特徵和特寫細節,而<圖片2>提供正面中景、側面中景和正面全身照。 <主體1>的身份資訊依據這些參考素材確定。
==========================================================================
希望大家玩的愉快
而我說的我自認必要寫的段落貼在這裡 大家自行複製
**Character description:**
<Subject 3> is the silhouette in <Video 1> which provides the motion sequence and emotional delivery to be replaced.
<物件 3> 是<影片 1>中的剪影,其動作序列和情緒表達將被取代。
如果沒有S2(人物或物品) 那就描寫環境
<Subject 2> is the full bathroom environment, white tiled floor, green towel, lighting and camera angle established in <Video 1>.
<物件2>是完整的浴室環境,白色磁磚地板,綠色毛巾,光線和拍攝角度與<影片1>相同。
**Action:**
[Shot 1] The shot opens with <Subject 1> seamlessly replacing the silhouette <Subject 3> in <Video 1>, performing the exact same motion, dialogue and sounds, positions and facial expressions. From the very first frame, <Subject 1>occupies the exact spatial coordinates of the silhouette, initiating the same motion onset from rest. <Subject 1> mirrors the silhouette's weight shifts and momentum, her body moving in perfect synchronization with the rhythm and pacing of the original footage. <Subject 1> hair, lighting, and room layout remain unchanged throughout.
[鏡頭 1] 鏡頭開始時,<物件 1> 無縫替換<影片 1>中的剪影<物件 3>,動作、對話、聲音、姿勢和臉部表情均與<物件 3>完全相同。從第一格開始,<受試者1>就佔據了與剪影完全相同的空間座標,並以相同的靜止狀態啟動動作。 <受試者1>鏡像了剪影的重心轉移和動量,她的身體運動與原始素材的節奏和速度完美同步。 <受試者1>的頭髮、光線和房間佈局在整個過程中保持不變。
--