Gemini真的有那麼糟嗎
雖然 Gemini 可能已經不是部分使用者的首選模型,不過 Gemini 的「影片理解」能力我認為是它與競品不同的地方。
如果有人想研究 AI 剪輯,但沒有什麼頭緒的話,分享一些我近期結合了雲
端 Gemini 與地端模型的實驗與想法。
【影像】
最近有時間就會研究怎麼讓 AI 輔助剪片,而 Gemini 的影片與圖片解讀能力
確實幫了我很多。
例如,手上有一整批拍攝毛片時,可以先用 FFmpeg 將影片轉成比較輕量的
proxy,再讓 Gemini 看完並整理成簡單的 Clip Card,記錄每支素材拍到
了什麼以及可能適合放在影片的哪個段落等資訊。這些 Clip Card 做好後就
可以保存在本機。
之後想把同一批素材剪成不同主題或長度的影片時,不需要再讓 Gemini 重
看全部毛片,只要先從 Clip Card 找出可能適合的片段,再回到原始影片確
認畫面即可。
如果只是一般接片,找到素材後其實就可以開始剪了。但如果想將橫式毛片
重新構圖成 9:16,或是讓畫面持續跟著人物、手機與產品移動,就還需要知
道物件在每個影格中的位置。
這時就利用 Gemini 的「圖片理解」與「物件偵測」能力,找出指定物件的
定界框。根據 Gemini 回傳的座標換算為影片內的實際位置。不過圖片是靜
態的,Gemini 找到的座標只能代表單一時點,所以接著又用了 SAM 2.1 來
協助追蹤物件的移動。
【音訊】
受 Palmier Pro 用 Apple SpeechTranscriber 做字幕的啟發,我實驗了一套
讓「字幕準確度」跟「細粒度時間軸」可以盡量兼得的轉錄方式。
Apple SpeechTranscriber 語音辨識的強項是時間,每個字都有自己的起訖
時間碼,但是中文辨識不夠準確,會掉字或者同音錯字。
所以我的做法是找了 Gemini 的「影片理解」能力來補強,讓 Gemini 獨立
看一次影片,並回覆逐字稿,接著再修正回去 Apple SpeechTranscriber 的
時間去。
然後也讓 Gemini 回覆時一併輸出判斷符號,讓程式判斷這個是要用來斷行
、術語還是要剪掉的贅詞。
--