為什麼 AI 處理 90 分鐘影片仍然這麼吃力?
如果你曾經把一場長達一小時的網上研討會或培訓錄影丟給 AI,結果拿回一份漏掉你最關心那一刻的摘要,問題不在你的提示。直到本月之前,Gemini 看影片的方式與閉路電視相同:每秒抽一格,從頭到尾,不管你的問題需不需要。Google DeepMind 於 2026 年 9 月 1 日推出的 Agentic 影片理解(agentic video understanding)改變了這一點:模型自行決定要看影片的哪一段、用什麼速度看、透過哪種訊號看。
Agentic 影片理解是 Gemini 的一種影片處理模式。模型把影片當作可檢索的檔案而非固定串流:先讀字幕稿定位相關時間範圍,再只載入該段畫面或音訊,遇到需要細節的問題時以更高幀率重看。
舊有做法稱為靜態處理(static processing)。根據 Google 的 token 說明文件,靜態模式在低解析度下每秒影片大約消耗 100 個 token,高解析度約 300 個。一段一小時的講座,在你問第一條問題之前,已經耗掉約 108 萬 token。Google 的發佈文章指出,同一段講座在 Agentic 模式下大約只需 10.8 萬 token,實際數字視乎提示而定。
對於要檢視競爭對手發佈會的市場推廣人員、要核對錄播課堂的教育工作者,或者要從兩小時全員大會中抽出決策的營運經理來說,這是「用一次就放棄」與「每星期都用」之間的分別。
Google 在 2026 年 9 月 1 日到底推出了什麼?
Google DeepMind 為 Gemini 3.7 Flash、3.6 Flash 及 3.5 Flash-Lite 推出 Agentic 影片理解,透過 Google AI Studio 及 Gemini Enterprise Agent Platform 的 Gemini API 提供。Google 表示在標準影片基準測試中,token 用量最多減少 88%,分析成本最多降低 66%,準確度最多提升 7%。功能支援上載檔案及公開 YouTube 連結,按標準 token 價格計費,沒有額外功能費。
發佈文章由 Google DeepMind 的 Rohan Doshi 與 Mario Lučić 撰寫。對非工程師的實務用家而言,有三點值得注意。
---這是一個模式,不是新模型。你繼續使用熟悉的 Flash 系列,只需把影片處理方式由靜態切換為 Agentic。
---功能已經在 Google AI Studio 上線,那是免費的瀏覽器介面,不只是純 API。Google 表示 Gemini 應用程式內的 Flash 及 Flash-Lite 模型「很快」會跟進,同一引擎之後亦會用於 YouTube 的 Ask YouTube 功能。
---效率數字是 Google 自家基準測試的最大值。MLQ News 於 9 月 4 日報道,Google 開發者文件現已把 Gemini 3.8 Flash 列為支援模型,所以支援名單已比發佈當日更長。
Google 強調四種能力:亞秒級時刻檢索、跨多小時錄影的「大海撈針」搜尋、以更高幀率重看短時間窗口的異常偵測,以及重複動作或物件計數。留意這四項全部都是「針對影片某一部分」的問題,而不是「把整段影片總結」的要求。
Agentic 影片理解的運作原理是什麼?
靜態處理以固定速率把影片每一秒送入模型的上下文,長片在任何推理開始之前已經很昂貴。Agentic 處理加入一個導航循環:Gemini 先掃描字幕稿,選定時間範圍,只請求該段畫面或音訊,檢查證據是否足夠,不足則重複。進入上下文的畫面減少,成本因此下降,精準度反而提升。
可以這樣理解:閱讀一份 300 頁報告,一種方法是逐頁讀完,另一種是先查索引。靜態模式逐頁讀;Agentic 模式查索引後直接跳到第 142 頁,細讀前後段落,答案不完整就再回到索引。
Google 文件把 Agentic 模式的 token 分為三類:導航推理、按需載入片段的工具調用 token,以及最終輸出。這正是帳單取決於你的問題的原因。針對某一刻的窄問題只載入極少內容;要求逐段描述整段影片,模型便會走遍整條時間軸,節省幅度隨之縮小。
Developers Digest 在 9 月 1 日的分析說得準確:這是一個「路由」層面的宣稱,不是「壓縮」層面的宣稱。當你的問題只指向影片的一小部分,88% 是真實的;它不是「看完整段影片」的折扣。
如何在 Google AI Studio 不寫程式就用上它?
開啟 Google AI Studio,選擇 Gemini 3.7 Flash,附加影片檔案或貼上公開 YouTube 網址,把影片處理設定為 agentic(API 中的設定是 processing: "agentic")。然後提出帶有時間戳、講者名稱或具體事件的針對性問題。免費帳戶可上載最大 2 GB 的檔案,每日最多處理 8 小時 YouTube 影片。
大多數人做錯的一步是問題本身。Agentic 模式獎勵具體,因為具體的指令告訴模型該去哪裡看。以一段 75 分鐘的產品網上研討會錄影為例,比較以下兩種提示。
弱提示:「總結這場研討會。」
強提示,可直接複製:
試試這個提示:
「你正在為市場推廣團隊檢視一段 75 分鐘的產品網上研討會錄影。請依次完成以下任務。(1)找出講者提及價格、推出日期或具名整合夥伴的每一個時刻,逐一提供時間戳及一句原話引述。(2)定位問答環節,列出每條觀眾問題及講者回應,每項不超過 25 字。(3)找出停留在畫面上最長時間的一張投影片,描述其內容。(4)標記所有無法從字幕稿核實、只能從畫面推斷的內容。以表格輸出,欄位為:時間戳、類型、內容、可信度。」
這段提示的每一條指令都給導航循環一個目標:一類陳述、一個環節、一項視覺特徵。第(4)條是實務用家最常略過卻最不應略過的,因為它迫使模型把「聽到的」與「推斷的」分開。
如果你已經按照我們的 ChatGPT 排程任務指南建立了重複性工作流程,同一原則在這裡同樣適用:先定義輸出形態再執行,工具才會由一次性實驗變成可重複的流程。
哪些影片任務最受惠,哪些應該留在靜態模式?
Agentic 模式在長錄影加針對性問題上明顯佔優:在兩小時會議中找出某一句話、統計示範失敗了多少次、抽出每一個提及競爭對手的時間戳。靜態模式在五分鐘以下的短片、需要覆蓋每一格畫面的任務,以及格式嚴謹比節省 token 更重要的輸出上,仍然是較佳選擇。
Google 自己的文件指出,Agentic 導航在五分鐘以下的短片上可能增加首個 token 的等待時間,並建議對延遲敏感的短片及需要全幀覆蓋的任務採用靜態處理。
目前最有參考價值的外部證據,是 PaperEdits 於 9 月 3 日在 Google AI 開發者論壇發表的小型基準測試,該團隊已披露其商業關聯。在六段合成的十分鐘影片上,提示與評分標準預先凍結、不設重試,Agentic 模式找回 20 個短暫事件中的 18 個,靜態模式為 15 個;剪輯決策 F1 分數為 0.68 對 0.55。然而在該測試中,靜態模式的 token 用量少 26.42%,成本低 23.01%,在廣泛時刻檢索上得分略高,而六次 Agentic 輸出中有一次未能符合要求的 JSON 格式。
把這組數據當作決策規則,而不是矛盾。短片加廣泛問題:留在靜態。長片加窄問題:切換 Agentic。六段合成影片不足以定論,但與 Google 自己對此模式適用範圍的說法一致。
數學上明顯偏向 Agentic 模式的實務場景:
---內容行銷人員掃描競爭對手 90 分鐘主題演講中每一次提及價格的位置。
---培訓人員在三小時錄播課程中找出略過安全步驟的確切時刻。
---營運經理從兩小時全員大會中抽出每一項決策及負責人,附時間戳以便跟進。
---社交媒體管理員在長篇訪談中找出三個最適合剪成短片的切點。
常見錯誤與硬性限制有哪些?
最浪費時間的五種失誤:要求完整摘要卻期望 88% 的節省;用三分鐘短片測試然後斷定模式很慢;超出一小時的預設上下文上限卻沒有切換至低解析度;未經核實就相信計數與視覺描述;以及以為功能已在消費者版 Gemini 應用程式推出,而它目前仍是 AI Studio 及 API 功能。
以下數字值得記住,全部來自 Google 影片理解文件(2026 年 9 月 4 日的報道版本):
---擁有一百萬 token 上下文的模型,在預設媒體解析度下可處理最長一小時的影片,低解析度下可達三小時。
---檔案上載上限:付費用戶 20 GB,免費用戶 2 GB。
---免費帳戶每日 YouTube 處理上限為 8 小時影片。
---Gemini 3.7 Flash 及 3.6 Flash 的標準定價為每百萬輸入 token 1.35 美元、每百萬輸出 token 6.75 美元,有效期至 2026 年 12 月 31 日;Gemini 3.5 Flash-Lite 為 0.54 美元及 4.50 美元。
另有兩項較軟性的限制同樣重要。第一,Google 的安全文件明確指出影片輸出可能不準確或帶有偏見,並建議人工審核,所以計數、引述與畫面描述在對照時間戳核實之前都只是草稿。第二,這是一個多步驟的代理循環,繼承了代理的可靠性特徵:比單次處理多出更多可能出錯的環節,偶爾會出現結構化輸出失誤,例如 PaperEdits 測試中的 JSON 失敗。要求表格輸出之後,記得親自看一遍。
模型支援名單也在變動。本文反映 9 月 1 日的發佈名單,加上 9 月 4 日文件中可見的 3.8 Flash。在圍繞特定模型名稱建立流程之前,請先查閱最新文件。
立即嘗試:用你手上已有的影片做一次 20 分鐘測試
選一段你一直想回顧的錄影,最好長於 30 分鐘。在 Google AI Studio 用同一條針對性提示跑兩次,一次靜態、一次 Agentic,然後比較三件事:回應中顯示的 token 數量、每個答案是否附有可核對的時間戳,以及五分鐘抽查內你能核實多少項陳述。
最好的第一個測試對象是你已經看過的研討會錄影,因為你知道正確答案是什麼。要求它找出你記得的三個時刻的時間戳。如果 Agentic 模式用更少 token 找到,你已經得到一個可用的流程。如果漏了一個,在提示中加入講者名稱或畫面線索再跑一次。這一個循環教你的,比任何基準測試都多。
更深一層的啟示,適用於今年每一項新 AI 功能:能力以一個設定的形式到來,價值卻透過你提出的問題到來。精準的簡報把 90 分鐘影片變成兩分鐘答案,含糊的簡報把它變成一份昂貴的摘要。懂AI,更懂你 UD相伴,AI不冷。
由 UD AI 團隊審閱。
準備好讓 AI 替你看完那些沒人有時間看的錄影?
檢視長影片正是 AI 員工可以接手的重複性工作。UD 團隊手把手帶你完成每一步,從選擇合適的模型與提示,到建立團隊每星期都能自行運作的流程。