GPT Image 2.0正式推出
感謝偉大的Tibo 剛剛又送了一次重置
既然他都繼續送了,就拿來弄些有的沒的
看看Ultra自動判斷生成的子代理會不會有甚麼加分
用跟之前Imagen 2.0出來時一樣的prompt跟Plan模式
那時候是5.4 medium
這次改用GPT5.6 SOL 的Utral模式


現在會優先檢查同計畫資料夾內的內容,然後"猜"你想要甚麼?
因為原本資料夾內已經留有上次的擬人型,所以這次猜想要保留老鼠外觀
以前主代理大概問三個問題,現在還會動用兩個子代理去設計plan
第一個子代理點進去看是評估之前圖片問題在哪?
第二個子代理則是規畫場景細節

接著追問我兩個細節問題
Plan表


Plan最大差別大概是自己追加驗收的步驟,已經寫明如何中文嵌字
而且Plan表的場景設計沒有到子代理說的那麼細節
跑的時候他自己追加三個子代理去"平行算圖",加速圖的產出速度
那三個點進去就是簡單的單一畫圖任務

嵌字部分是使用系統內中文字形產生後"嵌"進去,不是用"畫"的
這點好像是與其他AI不同點?
全部完成的驗收環節是主代理進行,沒有另外call子代理是有點訝異
驗收發現手指色系會被認為是人類還會自動加筆,把手變手套
三視圖 (我覺得跟當初比起來沒那麼華麗?)

主水晶廣場

冒險者公會

步伐練習 (黑白魔力軌跡好像是他跑去抓官方網站資訊)

夕照港灣

感覺很微妙?
因為跑完看5h使用量還在100%。
想說怎麼可能?? 就追加說改為優雅女性人形
"正常人類臉型、約七頭身,保留原倉鼠的銀灰配色、圓形毛耳
黑亮眼睛、淡粉鼻尖與短圓尾"
這次跑完顯示用掉 20%的5小時跟3%的週用量
但我覺得強制改好像讓它有點怪怪的?
或者是它有讀取原本記憶區內固定人頭角度





詢問後這是他的解釋,看起來是因為三視圖被當基本圖,變成後面圖都要符合三視
但plan裡面並沒有寫強制使用三視圖,不知道為何它就直接當reference了???
"頭部角度趨同主要有三個原因:v5 三視圖中,正面臉資訊最完整,側面只有一張,背面沒有臉;模型因此偏向用正面臉維持身份。四景都強調 identity-preserve 與「保持同一張臉」,造成身份鎖定過強,連角度也一起被保守複製。場景提示多半要求面向或回望鏡頭,進一步讓結果集中在正面至輕微 3/4 角度。"
"建議把限制改成「保留身份,但允許頭部、頸部與視線自然旋轉」"
Anyway 就讓他自由發揮。 於是他就畫了多角度圖去局部修改

三個subagent各自去修臉的角度

最後成果




頭的角度修正,也連帶修正上半身角度。可是...腳沒檢查到XD

而且這張出錯圖是主代理畫的,不是平行運算又加詳細檢查的子代理
到這邊用掉 30% 5h, 5%週。每批(5張)時間大概22-25分鐘
要他檢查港灣那張身體角度後,洋洋灑灑列了各種動作解說
最後說要修正成
"保持右側面望向夕陽,骨盆與雙腿同步朝港灣旋轉;靠近鏡頭的腿承重、腳尖朝船艦方向,另一腳退後半步且只外開約 15–20°,雙膝與腳尖保持同軸。"

光修這張就花了12分鐘,裡面有六分鐘花在生圖後的檢查。
但Token用量掉了1% 5h而已
--