GPT Image 2.0正式推出
繼續用Codex測試,使用Plan模式
"使用S__50716685.jpg 裡面的角色作為模板。設計一個final fantasy 赤魔導士(Red mag)外觀,產生三視圖及裝備解說。及世界觀設定為Final fantasy 14,以Limsa
Lominsa為主要出生地。設計四張他在Limsa Lominsa內四處觀光照片,其中需包含主水晶。"
這邊他問了四個問題,每個問題各三個選項
全部無腦點推薦

第一次的Plan 第二次後面都是細修就不貼了



第一次的結果 (V1)





一看就是服裝變形的有點嚴重,最後一張甚至變露胸
這時候他跳出這個
"目前成品都已在這個對話中生成。如果你要,我下一步可以直接幫你做第二輪微調,例如統一角色帽飾、把武器和外套再收斂得更一致,或改成更接近 FF14 遊戲內建模/宣傳圖的版本。"
哇~你還知道那邊不一致? 還要主動檢查XDDDDD
這邊一樣開Plan 要Codex進行帽飾、把武器和外套收斂。順便問弄一個Sub agent檢查會不會好一點?
然後他回答
"我看過設定板與場景圖後,現在的漂移主要集中在三個點:帽飾從「羽飾耳側飾件」變成了不同形狀的耳飾、外套領口與毛邊份量不一致、武器在部分圖裡更像刺劍與法器混合件。這種情況可以靠一輪更嚴格的主提示修正;sub agent 比較適合拿來做「生成後一致性核對」,不是必要,但如果你想把返工率壓低,它有幫助。"
OK~既然Sub agent可以審核比對 那就弄吧
這是Sub agent檢查是否都一致,通過還會標記PASS XDD

這是第二輪成果(V2)





恩...雖然帽飾、服裝、武器都一致了....但是怎麼連角色姿勢也都一致?
連臉的方向也固定住
要Codex檢討的結果是
1. 角色一致性約束 被寫得太靠近「整體外觀 + 鏡頭語言一起固定」
2. 場景 prompt 缺少「姿勢與臉部朝向必須變化」的反向要求
3. 基準圖本身 也在強化同一種角色展示方式
推薦下一輪規格要改成「分層鎖定」:
硬鎖定:臉型、髮色、帽飾位置、外套結構、武器組合
軟變化:臉部朝向、視線方向、站姿、手勢、鏡頭遠近、情緒
強制分配:四張圖各自指定不同 pose / face direction
所以這就是第三輪(V3) 依據他的plan微調的成果





恩...真要說大概剩下手套不一致 還有耳飾在第一張主水晶是固定在左耳
到這邊進行三輪
花費一小時,以及33%的5小時token量 (20美)

結論
用Codex plan模式會問問題進行微調
出產後Codex自己也會發現哪邊要改善跟提出建議
這幾點很不錯,比起單純GPT APP丟啥產啥好多了
還可以弄另外Agent檢查是否符合要求,節省微調時間(但就多燒token)
爾且產圖速度真的比較慢
--