Gemini 推出智慧體式影片理解:token 最高減少 88%,成本最高降低 66%
Google DeepMind 為 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 推出智慧體式影片理解。模型不再按固定幀率被動讀完整段影片,而是動態搜尋、掃描並檢查畫面、音訊和字幕中的相關片段。官方稱,在標準影片分析基準上,token 消耗最多降低 88%,成本最多降低 66%,準確率最多提升 7%。開發者可透過 Google AI Studio 和 Gemini Enterprise Agent Platform,把 API 設定設為 agentic 來啟用。
Google DeepMind 在官方部落格發布了「智慧體式影片理解」(agentic video understanding),並同步開放給 Gemini 3.7 Flash、Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 三款模型。文章由資深產品經理 Rohan Doshi 與研究總監 Mario Lučić 署名。官方給出的核心數字很直接:在標準影片分析基準上,該功能最多可把 token 消耗降低 88%,把分析成本降低 66%,同時把準確率最多提高 7%。這三個數字都是「最高值」,實際收益會隨影片長度與任務類型而變化。 要理解這項更新,先看舊做法。傳統的「靜態」處理會按固定幀率把整段影片送進模型,預設是每秒 1 幀,開發者可以透過 API 調整。這種做法簡單,但有兩個硬傷。第一,成本與影片時長成線性關係,一段 90 分鐘的講座和一段數小時的錄影會吃掉大量 token。第二,開發者被迫二選一:要麼承擔高昂的 token 成本,要麼採用抽幀、截斷、摘要等壓縮手段,而這些手段往往會丟掉關鍵細節。官方特別指出,長影片場景,也就是從十分鐘的教學到九十分鐘的講座,再到數小時的錄影,是這種矛盾最突出的地方,也是新功能收益最明顯的地方。 新機制的核心是讓模型從被動接收變成主動檢索。官方的說法是,模型把自身的推理能力與原生影片工具結合起來,圍繞目標動態地搜尋、掃描和檢查影片中的相關片段,涉及的訊號包括視覺畫面、音訊和字幕轉寫文字三種模態。模型要自行決定看什麼、用多快的速度看、透過哪種模態去看,只取回完成任務所需的時刻與訊號。這個過程以「智慧體迴圈」(agentic loop) 的方式完成:模型呼叫內部工具,載入影片檔案中相關的部分,再根據觀察結果決定下一步。官方還提到,開發者以前也可以手動實作類似流程,例如自己寫程式切片、轉寫、檢索再餵給模型,而現在這套迴圈由 Gemini 自己完成,開發與維護的工作量因此顯著下降。
這個思路與先前推出的「智慧體式視覺」(agentic vision) 一脈相承。後者把程式碼執行與 Gemini 原生的圖像理解結合起來。新功能則把同樣的思路搬到影片上,依托的是 Gemini 的原生影片工具。官方列出的新能力包括亞秒級的片段檢索、更準確的異常偵測和精確計數等。這些任務有一個共同點:答案往往只藏在很短的幾個時刻裡,用 1 FPS 的均勻取樣很容易漏掉,而讓模型回頭放慢速度、反覆檢查就能解決。 在效能方面,官方稱收益涵蓋三款受支援的模型,但 Gemini 3.7 Flash 搭配智慧體式理解的整體品質最好,也是品質與成本組合最優的一個。官方圖表顯示,它位於已測試模型的「準確率對成本」帕累托前緣上,也就是說,在被測範圍內,沒有別的配置能以更低成本取得更高準確率。需要提醒的是,這些結果來自 Google 自己選定的標準影片分析基準,官方摘錄中沒有給出各基準的名稱與逐項數據,讀者在評估時應當用自己的業務影片做對照測試。
在使用方式上,該功能目前支援影片上傳和 YouTube 影片,透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API 提供。官方摘要說明,開發者只需把 API 設定設為「agentic」即可啟用。這是一個低遷移成本的開關,現有的影片分析流程不需要重寫。 對開發者和企業而言,影響主要有三點。其一,成本結構改變。長影片分析此前常常因為 token 帳單而難以規模化,例如保全錄影審閱、會議與課程回顧、媒體資產檢索和合規抽檢。成本最多降低 66%,會讓一批原本不划算的場景變得可行。其二,工程負擔轉移。過去需要自建的抽幀、分段、轉寫對齊與檢索邏輯,現在可以交給模型內部的工具迴圈。其三,品質與成本不再必然對立,準確率上升的同時成本下降,這對正式環境尤其有吸引力。
當然,也要看到風險與未知。智慧體迴圈意味著模型會進行多步呼叫,延遲與行為的可預測性是需要實測的問題,官方摘錄並未給出延遲數據。模型自主決定「看哪裡」,也可能在極端情況下漏看關鍵片段,因此對高風險場景,例如安全監控和醫療影像,仍需要抽樣複核和人工把關。此外,是否支援更多模型、更多輸入來源,官方尚未說明。 從產業趨勢看,這次發布說明多模態競爭的重點正在從「能看多長」轉向「怎樣看得聰明」。上下文視窗再大,逐幀全量輸入也不經濟。讓模型像人一樣先瀏覽、再定位、再細看,是更接近真實工作方式的路線。可以預期,其他模型廠商也會推出類似的主動式媒體檢索能力,而開發者的關注點會從前處理流程轉向評測與成本監控。對於正在評估影片 AI 的團隊,務實的做法是:先用具代表性的影片做並行對比,記錄 token、成本與準確率,再決定是否遷移。
最後給出一個落地建議。評測時應分開記錄三類指標:每個任務的 token 用量、每個任務的總費用,以及答案的正確率。長影片與短影片要分組統計,因為官方明確說收益在長影片上更突出。若短影片上收益有限,也屬正常,不必強行全量切換。