作者alljerry04 (Jas)
看板C_Chat
標題Re: [閒聊] Gemini真的有那麼糟嗎
時間Thu Jul 23 11:30:44 2026
雖然 Gemini 可能已經不是部分使用者的首選模型,不過 Gemini 的「影片理解」
能力我認為是它與競品不同的地方。
如果有人想研究 AI 剪輯,但沒有什麼頭緒的話,分享一些我近期結合了雲
端 Gemini 與地端模型的實驗與想法。
【影像】
最近有時間就會研究怎麼讓 AI 輔助剪片,而 Gemini 的影片與圖片解讀能力
確實幫了我很多。
例如,手上有一整批拍攝毛片時,可以先用 FFmpeg 將影片轉成比較輕量的
proxy,再讓 Gemini 看完並整理成簡單的 Clip Card,記錄每支素材拍到
了什麼以及可能適合放在影片的哪個段落等資訊。這些 Clip Card 做好後就
可以保存在本機。
之後想把同一批素材剪成不同主題或長度的影片時,不需要再讓 Gemini 重
看全部毛片,只要先從 Clip Card 找出可能適合的片段,再回到原始影片確
認畫面即可。
如果只是一般接片,找到素材後其實就可以開始剪了。但如果想將橫式毛片
重新構圖成 9:16,或是讓畫面持續跟著人物、手機與產品移動,就還需要知
道物件在每個影格中的位置。
這時就利用 Gemini 的「圖片理解」與「物件偵測」能力,找出指定物件的
定界框。根據 Gemini 回傳的座標換算為影片內的實際位置。不過圖片是靜
態的,Gemini 找到的座標只能代表單一時點,所以接著又用了 SAM 2.1 來
協助追蹤物件的移動。
【音訊】
受 Palmier Pro 用 Apple SpeechTranscriber 做字幕的啟發,我實驗了一套
讓「字幕準確度」跟「細粒度時間軸」可以盡量兼得的轉錄方式。
Apple SpeechTranscriber 語音辨識的強項是時間,每個字都有自己的起訖
時間碼,但是中文辨識不夠準確,會掉字或者同音錯字。
所以我的做法是找了 Gemini 的「影片理解」能力來補強,讓 Gemini 獨立
看一次影片,並回覆逐字稿,接著再修正回去 Apple SpeechTranscriber 的
時間去。
然後也讓 Gemini 回覆時一併輸出判斷符號,讓程式判斷這個是要用來斷行
、術語還是要剪掉的贅詞。
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 61.220.133.157 (臺灣)
※ 文章網址: https://www.ptt.cc/bbs/C_Chat/M.1784777446.A.121.html
推 kuninaka: GOOGLE的影片圖片理解是他的強項沒錯,很強 07/23 11:45
→ kuninaka: 我之前上傳監視器影片,問他某個人物出現多少次 07/23 11:45
→ kuninaka: 都能算得出來 07/23 11:45
推 tim1112: 可是我昨天讓Ginimi分析一場布袋戲的武戲,感覺結果滿空 07/23 12:06
→ tim1112: 泛的,而且有一種偷偷從別的管道查資料的嫌疑而且還查錯 07/23 12:06
→ tim1112: 。 07/23 12:06
→ alljerry04: 如果是在 Web / App 上分析 YouTube 影片時 07/23 12:15
→ alljerry04: 務必要看到有跳出 YouTube icon,不然 Web / App 07/23 12:15
→ alljerry04: 很容易呼叫工具失敗 07/23 12:15
推 nacoojohn: “可能不是不” 你講話可能不要不這麼多贅字,看了實在 07/23 12:27
→ nacoojohn: 不是不難理解 07/23 12:27
※ 編輯: alljerry04 (61.220.133.157 臺灣), 07/23/2026 12:34:00
→ alljerry04: 可能不是 不少人,你的不連錯地方了,但我改一下 07/23 12:34
※ 編輯: alljerry04 (61.220.133.157 臺灣), 07/23/2026 12:35:36