agentic video 指的是這樣一類配置:AI 系統跨多個步驟做判斷並執行,而不是一個 prompt 換一個結果。概念就這麼多。會混亂,是因為這個詞現在被用在三件不同的事情上,而使用它的人很少說清楚自己指哪一件。 這在你花錢之前就有影響。三件事需要的工具不同,出的狀況不同,買單的團隊也不同。
01
agentic video 是什麼意思
這裡說的 agent,指的是能規劃多個步驟、呼叫工具、查看結果並據此決定下一步的軟體。agentic video 就是把這個迴圈套用到影片上。
| 含義 | agent 做什麼 | 誰來買 |
|---|---|---|
| 影片理解 | 規劃如何檢查一支既有的影片 | 做檢索、審核、摘要的團隊 |
| 互動影片 | 在播放過程中回答觀眾提問 | 行銷、訓練、客服 |
| 製作流程 | 執行把影片做出來的那些步驟 | 按節奏持續產出的團隊 |
讀廠商頁面時的快速判別:問這個 agent 對準的是什麼,是一支已完成的影片、一位觀眾,還是一項製作任務。這一個問題就能把三者分開。
02
含義一:分析既有影片的 agent
這裡影片已經存在,agent 決定怎麼檢查它。Google 在 Gemini 裡就是這樣用 "agentic" 的:模型不是均勻處理整段,而是規劃哪些區間、哪些通道(畫面、聲音、逐字稿)值得細看。對長時間錄製,以及針對某個具體時刻的提問特別有用。
這裡不生成任何東西。這一義談的是讀影片,不是做影片。實際機制、API 設定,以及什麼時候靜態處理反而更合適,寫在我們那篇 Gemini 3.7 video understanding 的指南裡。
03
含義二:觀眾可以對話的影片
多數行銷頁面指的就是這一義。D-ID 把它當作 Agentic Videos 販售,描述為把 "passive content into interactive AI experiences",觀眾可以 "ask questions via voice or chat at any point, turning a one-way broadcast into a two-way dialogue"。agent 以影片本身的腳本加上補充知識為依據,讓回答不偏離品牌口徑。D-ID 列出的用途是訓練、產品行銷、售前與客服。
研究端在 2026 年 10 月 1 日有了動靜:Tavus 發表 Griffin,稱其為 Human Interaction Model——不是把幾個系統串起來,而是由單一全雙工模型同時完成看、聽、說與肢體動作。
那個被到處引用的數字,要連同它真正的口徑一起讀。在 Tavus 報告的一項研究中,透過獨立研究平台招募的 54 位參與者與 Griffin-Lite 進行一分鐘視訊通話,其中 26 位、也就是 48% 認為對方是真人。同一項研究中的對照系統是 2.4%。Tavus 也自行揭露:直到問卷最後才詢問參與者是否想過對方可能不是真人。在 NVIDIA 的全雙工基準 VideoFDB 上,Griffin-Lite 在 15 個系統中兩條賽道都排第一,生成 3.83、感知 3.73。人類參考值為 3.92 與 4.20,也就是說兩條賽道上人仍然更高。
多數報導漏掉了一個事實:你用不到它。Tavus 明寫 Griffin-Lite "will not be available for use for customers at this time, though it is available for select trusted testers as a research preview",並表示將在安全性工作完成後釋出。如果你正圍繞對話式影片編預算,這一義目前是研究預覽,不是可以導入的產品。
04
含義三:跑製作流程的 agent
買方說「把我們的影片自動化」時,多半指的就是這個。agent 不跟觀眾聊天,也不研究舊素材。它跑流程:讀原始素材、寫腳本、規劃分鏡、生成或組裝、落實修改、算圖輸出。
實務問題是這個 agent 操作的是什麼工具。在 r/ClaudeCode 的一場討論裡,有人透過 MCP 把 agent 接到既有的剪輯軟體上,其中一位表示用 DaVinci Resolve Studio 接 Claude 處理剪接、字卡、圖形與 B-roll。另一些人全程留在 Python 加 ffmpeg,認為對界定清楚的工作不需要更貴的軟體。那串討論中得票最高的回覆,就是一句「光用 ffmpeg,agent 就能做很多事」。
有一個值得注意的共通點:拿到可用結果的人描述的是分工,不是整包丟出去。一位為音樂影片編排多個 agent 的實作者寫道,他沒有 "completely delegating the art direction",而是自己握住創意方向,把執行交出去。
TapVid 位在第三義。它是講解影片引擎:你給一份文件、一個連結或一段腳本,它產出一支結構化的講解影片。它的 REST API 與 MCP 伺服器讓助理可以直接呼叫。流程把解析、釐清、查資料、大綱、腳本與逐鏡頭生成攤開成你看得見也介入得了的步驟。修改以對話提出,只有你點名的那顆鏡頭會重做成新版本。它不涵蓋第二義:沒有即時 avatar,也沒有播放器內的觀眾問答。
05
會壞的地方:agent 看不見自己弄壞了什麼
這是廠商頁面會跳過的故障型態。我們讀到的討論裡,多位貢獻者各自撞上了它。
型態總是一樣:執行回報成功,產出卻以 agent 無從察覺的方式出了錯。
這些討論裡的具體案例:
- 一位在做廣告算圖工具的開發者寫下那個熟悉的循環:寫 HTML,用 headless Chrome 截圖,看一眼,發現標題被切掉,修,再截一次。每一輪都在燒 token。另一位貢獻者回覆說,他的卡片算圖器 "clips a line off the edge without saying a word, and I only find out when I look at the image"。隨後他給了一個具體例子:選項文字在大約 33 個字元處衝出框線,沒有任何警告。
- 第三位把它總結為:多數工具 "most tools just shrug and let you find out from the broken output later"。
- 算圖端也一樣。有團隊遇到抓幀 "once returned about 8,500 bytes of black instead of a 2.6MB frame",並追問該怎麼區分 "fits at this size" 與 "all layers actually rendered"。
- 聲音是同一個形狀。在一串 Podcast 討論裡,有人提醒:逐字時間戳不是剪接點。切在那裡會削掉首字的起音與末字的尾音,整體聽起來略有不對,但耳朵說不出為什麼。另一位指出 ffmpeg 的 stream copy 只能從關鍵影格開始,入點會往前滑,於是前面掛著上一句的尾巴。
這些都不是模型品質問題,而是回報問題。agent 看了一眼檔案,就判定做完了。
大家最後都收斂到同一個做法:讓缺陷能被機器讀取,而不是靠眼睛。上面那位開發者重寫了算圖器,現在每次編輯都會依尺寸回報哪裡壞了,錯誤形如 "leaderboard content !overflow needs 572x116",agent 據此修復。他在自己的基準中表示,相較截圖循環約少用一半 token。在一位審閱者追問後,他又補了幾道檢查:中途中斷的片段會讓算圖失敗;每個輸出檔案逐格校驗;缺少的素材在開始算圖前就被標出。
也有貢獻者把問題往前挪。他先把素材過一遍本機模型,取得逐字稿、場景描述與動態標籤,剪輯 agent 之後就在這些文字上作業,而不是重新去讀影片。
照這個順序提三項要求:流程回傳結構化的缺陷,而不是一張縮圖;「成功」意味著檔案存在、每一格都在、每個素材都已解析;以及出稿前仍有人看過一遍。
06
堅持要求產出可繼續編輯
第二個關切是你最後手上剩下什麼。我們讀到的討論中,多位貢獻者講得很清楚:一支成品 MP4 不是可接受的交付物。
開啟那串 r/ClaudeCode 討論的問題說得很直接。發文者想把剪輯交給模型,但寫道:"I need the project to remain editable within standard video editing software. I don't want the editing process to turn into a script that can only be modified via code." 他擔心以程式碼為先的框架,會把工作從真正的剪輯軟體裡拉走。
回覆指向同一個方向:讓 agent 產出一個專案,而不是一支成品。一位貢獻者建議讓模型寫一份剪輯軟體能匯入的 XML 時間軸,片段自己再挪,並建議在把真正的專案交給它之前先試幾刀。剪輯軟體自帶的交換格式正是為此存在:FCPXML、EDL,以及像 DaVinci Resolve 那樣的腳本 API。
驗收條件最銳利的一版,來自一位主動揭露自己也在做同領域產品的貢獻者。他說他要測的是 "whether you can make a manual change and then have Claude continue from that updated project"。生成第一版有用,但把這個來回維持住,才真正省時間。
把這條驗收借走:生成第一版,手動改一處,然後讓 agent 從你改過的版本繼續。只會從頭重做的工具,會在每一輪修改上向你收費。
07
成本真正落在哪裡
這一節請當作個別回報來讀,不是市場通則;它來自為數不多的幾位貢獻者。
其中兩位認為時間並不花在剪那一刀上。一位寫道,他會 "measure the second cut against review time, not the $50 API bill",因為如果你仍要從頭到尾看一遍,那才是貴的部分。他回覆的那位實作者,已從手工剪輯改為用 1.25 倍速看兩三遍,並以「完整看一遍加抽查」為目標。
關於生成開銷,有貢獻者把反覆重試到可用形容為 "spending hundreds of dollars spinning the slot machine";另一位有在跑流程的人,則把機械性步驟移給更便宜的子 agent,免得吃掉預算。
兩種情況的著力點是同一個:成本在重試迴圈裡,不在第一次算圖。這也是上一節那個回報盲區值得補起來的另一個理由——能分辨產出好壞的 agent,不會一直替這個價差買單。
08
該問那些說 agentic 的廠商什麼
按順序一條條問下去。第一個答案告訴你這是三義裡的哪一義,後面幾個告訴你 agent 真正跑起來之後,出了問題風險歸誰。答不上來的廠商,等於一點風險都沒有替你承擔,複核與返工最後還是落在你自己團隊身上。
- 說的是哪一義:理解、互動播放,還是製作?頁面不說,就當成行銷話術。
- 最後交到我手上的是什麼:一支成品檔案,還是一個我能打開繼續改的專案?
- 我手動改一處之後,agent 能不能從我的版本繼續?
- 缺陷怎麼回報給我?要一個錯誤實例看看。如果答案是叫你去看成品,複核就是你的事。
- 這裡的「成功」是指檔案寫出來了,還是指它被驗證過了?
- 哪些步驟我看得見、打斷得了?
- 如果是第二義:今天能用嗎?支援哪些語言、哪些資料?
09
常見問題
agent 生成第一版之後,我還能繼續編輯這個專案嗎?
只有當它輸出的是你的剪輯軟體打得開的東西才行——FCPXML 這類 XML 時間軸、EDL,或透過剪輯軟體自身腳本 API 做出的變更。一個算好的成品檔案,在任何有用的意義上都不可編輯。定案前先測一次來回:生成第一版,手動改一處,再讓 agent 從改過的專案繼續。
我怎麼知道 agent 沒有悄悄弄壞什麼?
要求流程回傳機器可讀的缺陷——溢出尺寸、缺少的素材、影格數校驗,而不是讓 agent 去判斷一張截圖。上面列出的每一種狀況,當下都算「執行成功」。保留一輪人工複看;目標是把它壓到抽查,而不是取消。
agentic video 是不是代表 AI 來做創意決策?
不是。那取決於你怎麼搭這條流程,而不是技術本身的性質。我們讀到的討論裡,多位貢獻者是有意識地劃線的:把機械性工作交出去,創意方向、腳本判斷與最終拍板留給人。也有人完全反對讓 AI 碰創意決策。選工具前先定好你的線,因為不同工具的預設並不一樣。
為什麼每支影片的成本一直往上?
在我們讀到的案例裡,成本在重試迴圈而不是第一次算圖:一遍遍重生成直到有可用的,再算一次確認修改是否生效。那幾位貢獻者用的兩個槓桿,是把機械性步驟交給更便宜的模型,以及生成更短的片段。我們沒有資料說明這有多普遍,所以請在你自己的使用情境裡核對。
10
一句話收尾
如果一個頁面寫著 agentic video,而你讀完一段仍分不清它是在分析、在對話還是在製作,先把這件事釐清。確定是哪一義之後,有兩個問題能預測它撐不撐得住真實工作:產出是否保持可編輯?以及系統能不能告訴你它哪裡做錯了?




