Agentic Video ist jede Konstellation, in der ein KI-System über mehrere Schritte entscheidet und handelt, statt auf einen Prompt genau ein Ergebnis zu liefern. Das ist die ganze Idee. Verwirrend wird es, weil der Begriff heute für drei verschiedene Aufgaben benutzt wird und Anbieter selten sagen, welche sie meinen. Das ist vor jedem Kauf wichtig. Die drei Aufgaben brauchen andere Werkzeuge, erzeugen andere Fehlerbilder und werden von anderen Teams gekauft.
01
Was Agentic Video bedeutet
Ein Agent ist in diesem Zusammenhang Software, die mehrere Schritte planen, Werkzeuge aufrufen, das Ergebnis ansehen und daraus den nächsten Schritt ableiten kann. Agentic Video wendet diese Schleife auf Video an.
| Bedeutung | Was der Agent tut | Wer es kauft |
|---|---|---|
| Videoanalyse | Plant, wie ein vorhandenes Video geprüft wird | Teams für Suche, Moderation und Zusammenfassung |
| Interaktives Video | Beantwortet Zuschauerfragen während der Wiedergabe | Marketing, Schulung und Support |
| Produktionspipeline | Führt die Schritte aus, die ein Video entstehen lassen | Teams mit festem Videotakt |
Ein schneller Test: Fragen Sie, worauf der Agent zielt, auf ein fertiges Video, auf einen Zuschauer oder auf eine Produktionsaufgabe. Diese eine Frage trennt alle drei.
02
Bedeutung 1: ein Agent, der vorhandenes Video analysiert
Hier existiert das Video bereits und der Agent entscheidet, wie er es untersucht. Google verwendet "agentic" in Gemini in diesem Sinn: Das Modell plant, welche Abschnitte und welche Kanäle, Bild, Ton, Transkript, eine genauere Prüfung verdienen, statt einen Clip gleichmäßig durchzuarbeiten. Nützlich ist das bei langen Aufnahmen und bei Fragen zu einem bestimmten Moment.
Dabei wird nichts erzeugt. Diese Bedeutung betrifft das Lesen von Video, nicht das Herstellen. Mechanik, API-Einstellungen und die Frage, wann statische Verarbeitung die bessere Wahl ist, stehen in unserem Leitfaden zu Gemini 3.7 Video Understanding.
03
Bedeutung 2: ein Video, mit dem der Zuschauer sprechen kann
Das ist die Bedeutung, die die meisten Marketingseiten meinen. D-ID verkauft sie als Agentic Videos und beschreibt sie als Weg, "passive content into interactive AI experiences" zu verwandeln, bei dem Zuschauer "ask questions via voice or chat at any point, turning a one-way broadcast into a two-way dialogue". Der Agent ist auf das Skript des Videos und ergänzendes Wissen gestützt, damit Antworten markenkonform bleiben. D-ID nennt Schulung, Produktmarketing, Pre-Sales und Support als Einsatzfelder.
Auf der Forschungsseite bewegte sich etwas am 1. Oktober 2026, als Tavus Griffin vorstellte, ein Human Interaction Model: ein einzelnes vollduplexes Modell, das gleichzeitig sieht, hört, spricht und gestikuliert, statt getrennte Systeme hintereinander zu schalten.
Die Zahl, die überall zitiert wurde, verdient ihren tatsächlichen Rahmen. In einer von Tavus berichteten Studie führten 54 über eine unabhängige Forschungsplattform rekrutierte Teilnehmende ein einminütiges Videogespräch mit Griffin-Lite, und 26 von ihnen, also 48 Prozent, hielten ihr Gegenüber für einen echten Menschen. Das Vergleichssystem derselben Studie kam auf 2,4 Prozent. Tavus legt außerdem offen, dass die Teilnehmenden erst am Ende der Befragung gefragt wurden, ob ihnen der Gedanke gekommen sei, ihr Gegenüber könnte nicht echt sein. Auf NVIDIAs VideoFDB-Benchmark für Vollduplex liegt Griffin-Lite auf beiden Spuren vorn, mit 3,83 bei der Generierung und 3,73 bei der Wahrnehmung unter 15 Systemen. Die menschliche Referenz liegt bei 3,92 und 4,20, ein Mensch ist also auf beiden Spuren weiter vorn.
Eine Tatsache fehlt in den meisten Berichten: Sie können es nicht einsetzen. Tavus schreibt, Griffin-Lite "will not be available for use for customers at this time, though it is available for select trusted testers as a research preview", eine Freigabe sei nach Abschluss der Sicherheitsarbeit geplant. Wer ein Budget um konversationelles Video plant, hat es hier mit einer Forschungsvorschau zu tun, nicht mit einem Produkt.
04
Bedeutung 3: Agents, die die Produktion steuern
Das meinen die meisten Käufer mit "unsere Videos automatisieren". Der Agent unterhält sich nicht mit Zuschauern und untersucht kein altes Material. Er führt die Schritte aus: Quelle lesen, Skript schreiben, Einstellungen planen, erzeugen oder montieren, Änderungen einarbeiten, rendern.
Die praktische Frage ist, welches Werkzeug der Agent bedient. In einer Diskussion in r/ClaudeCode richteten einige Beitragende einen Agent über MCP auf einen vorhandenen Editor; einer berichtete von DaVinci Resolve Studio an Claude für Schnitte, Titel, Grafiken und B-Roll. Andere blieben vollständig bei Python mit ffmpeg und hielten teurere Software für klar umrissene Aufgaben für unnötig. Die am höchsten bewertete Antwort in diesem Thread war schlicht, dass ein Agent mit ffmpeg allein sehr viel schafft.
Ein Muster fällt auf: Wer brauchbare Ergebnisse bekommt, beschreibt eine Arbeitsteilung, keine Übergabe. Ein Praktiker, der mehrere Agents für ein Musikvideo koordinierte, schrieb, statt "completely delegating the art direction" habe er die kreative Leitung behalten und die Ausführung abgegeben.
TapVid sitzt in dieser dritten Bedeutung. Es ist eine Engine für Erklärvideos: Sie geben ein Dokument, einen Link oder ein Skript, und es entsteht ein strukturiertes Erklärvideo. REST-API und MCP-Server erlauben einem Assistenten den direkten Aufruf. Die Pipeline macht Parsen, Rückfragen, Recherche, Gliederung, Skript und Erzeugung je Einstellung als Schritte sichtbar, in die Sie eingreifen können. Eine Änderung wird im Gespräch angefordert, und nur die genannte Einstellung wird in eine neue Fassung neu gerendert. Bedeutung 2 deckt es nicht ab: Es gibt keinen Live-Avatar und keine Zuschauerfragen im Player.
05
Was bricht: der Agent sieht nicht, was er kaputt gemacht hat
Das ist das Fehlerbild, das Anbieterseiten auslassen. Mehrere Beitragende in den von uns gelesenen Diskussionen stießen unabhängig voneinander darauf.
Das Muster ist immer gleich. Der Lauf meldet Erfolg. Das Ergebnis ist auf eine Weise falsch, die der Agent nicht bemerken konnte.
Fälle aus diesen Diskussionen:
- Ein Entwickler, der ein Werkzeug zum Rendern von Anzeigen baute, beschrieb die übliche Schleife: HTML schreiben, mit Headless-Chrome ein Bildschirmfoto machen, hinsehen, feststellen, dass die Überschrift abgeschnitten ist, korrigieren, erneut fotografieren. Jeder Durchlauf kostet Tokens. Ein anderer Beitragender antwortete, sein Karten-Renderer "clips a line off the edge without saying a word, and I only find out when I look at the image". Später nannte er einen konkreten Fall: Optionstext lief bei etwa 33 Zeichen aus dem Rahmen, ohne Warnung.
- Ein Dritter fasste es als Werkzeuge zusammen, die "most tools just shrug and let you find out from the broken output later".
- Beim Rendern dasselbe. Ein Team sah eine Bildaufnahme, die "once returned about 8,500 bytes of black instead of a 2.6MB frame". Gefragt wurde, wie sich "fits at this size" von "all layers actually rendered" unterscheiden lässt.
- Beim Ton ebenso. In einem Podcast-Thread warnte ein Beitragender, Wort-Zeitstempel seien keine Schnittpunkte. Wer dort schneidet, kappt den Anlaut des ersten und den Ausklang des letzten Wortes. Alles klingt leicht daneben, und man hört nicht, warum. Ein anderer wies darauf hin, dass ffmpeg im Stream-Copy nur an einem Keyframe beginnen kann. Der Einstiegspunkt rutscht zurück, und das Ende des vorigen Satzes hängt vorn dran.
Nichts davon sind Qualitätsprobleme des Modells. Es sind Meldeprobleme. Der Agent sah eine Datei an und hielt sie für fertig.
Die Lösung, auf die alle kommen: Defekte maschinenlesbar machen, nicht per Augenschein. Der genannte Entwickler baute seinen Renderer um. Jede Änderung meldet nun je Größe, was kaputt ist, in einem Fehler der Form "leaderboard content !overflow needs 572x116". Der Agent repariert daraus. Er berichtet in seinem eigenen Benchmark von etwa 2-mal weniger Tokens als in der Bildschirmfoto-Schleife. Nach einer Rückfrage ergänzte er weitere Prüfungen: Ein Clip, der mittendrin abbricht, lässt den Render fehlschlagen. Jede Ausgabedatei wird Bild für Bild geprüft. Ein fehlendes Asset wird vor dem Rendern erkannt.
Ein anderer Beitragender setzt früher an. Er schickt das Material zuerst durch ein lokales Modell und erhält Transkripte, Szenenbeschreibungen und Bewegungs-Tags. Der Schnitt-Agent arbeitet dann mit diesem Text, statt das Video erneut zu lesen.
Verlangen Sie drei Dinge, in dieser Reihenfolge. Die Pipeline liefert strukturierte Defekte, kein Vorschaubild. "Erfolg" heißt, die Datei existiert, jedes Bild ist vorhanden und jedes Asset aufgelöst. Und ein Mensch prüft weiterhin, bevor etwas rausgeht.
06
Bestehen Sie darauf, dass das Ergebnis bearbeitbar bleibt
Die zweite Sorge betrifft das, was am Ende in Ihrer Hand liegt. Mehrere Beitragende in den von uns gelesenen Diskussionen waren eindeutig: Eine fertige MP4 ist kein akzeptables Ergebnis.
Die Frage, die einen r/ClaudeCode-Thread eröffnete, sagt es direkt. Der Autor wollte den Schnitt an ein Modell abgeben, schrieb aber: "I need the project to remain editable within standard video editing software. I don't want the editing process to turn into a script that can only be modified via code." Er befürchtete, dass code-first-Frameworks die Arbeit aus einem echten Editor herausziehen.
Die Antworten zeigten in eine Richtung. Der Agent soll ein Projekt ausgeben, keinen fertigen Render. Ein Beitragender schlug vor, das Modell eine XML-Timeline schreiben zu lassen, die der Editor importieren kann, und Clips danach selbst zu verschieben. Er riet, erst ein paar Schnitte zu testen. Die Austauschformate der Editoren gibt es genau dafür: FCPXML, EDL und Skript-APIs wie die in DaVinci Resolve.
Die schärfste Fassung des Tests kam von einem Beitragenden, der offenlegte, dass er selbst ein Produkt in diesem Feld baut. Prüfen würde er, "whether you can make a manual change and then have Claude continue from that updated project". Den ersten Schnitt zu erzeugen ist nützlich. Das Hin und Her am Leben zu halten spart die eigentliche Zeit.
Übernehmen Sie diesen Test. Ersten Durchlauf erzeugen. Eine Sache von Hand ändern. Dann den Agent von Ihrer Fassung aus weitermachen lassen. Ein Werkzeug, das nur von vorn anfangen kann, kostet Sie in jeder Korrekturrunde.
07
Wo die Kosten wirklich anfallen
Behandeln Sie diesen Abschnitt als Einzelberichte, nicht als Marktmuster; er stammt von wenigen Beitragenden.
Zwei von ihnen argumentierten, der Schnitt sei nicht der Zeitfresser. Einer schrieb, er würde "measure the second cut against review time, not the $50 API bill", denn wer das Ganze weiterhin von vorn bis hinten ansieht, zahlt dort den Preis. Der Praktiker, dem er antwortete, war vom manuellen Schnitt dazu übergegangen, die Folge zwei- bis dreimal mit 1,25-facher Geschwindigkeit anzusehen, und strebte einen vollständigen Durchlauf plus Stichproben an.
Zu den Generierungskosten beschrieb ein Beitragender das Wiederholen bis zur Brauchbarkeit als "spending hundreds of dollars spinning the slot machine", und ein anderer mit laufender Pipeline verlagerte mechanische Schritte auf günstigere Sub-Agents, damit sie sein Budget nicht auffressen.
Der Hebel ist in beiden Fällen derselbe: Die Kosten stecken in der Wiederholschleife, nicht im ersten Render. Auch deshalb lohnt es sich, die oben beschriebene Rückmeldelücke zu schließen. Ein Agent, der ein schlechtes von einem guten Ergebnis unterscheiden kann, zahlt die Differenz nicht weiter.
08
Was Sie einen Anbieter fragen, der "agentic" sagt
Gehen Sie sie der Reihe nach durch. Die erste Antwort sagt Ihnen, mit welcher Bedeutung Sie es zu tun haben, die übrigen sagen Ihnen, wer das Risiko trägt, sobald der Agent läuft. Wer sie nicht beantwortet, trägt nichts davon.
- Um welche Bedeutung geht es, Analyse, interaktive Wiedergabe oder Produktion? Sagt die Seite es nicht, ist es Marketingsprache.
- Was übergibt mir der Agent, eine fertige Datei oder ein Projekt, das ich öffnen und bearbeiten kann?
- Kann ich von Hand etwas ändern und der Agent macht von meiner Fassung aus weiter?
- Wie meldet das System einen Defekt? Lassen Sie sich einen Beispielfehler zeigen. Lautet die Antwort, Sie sollen das Ergebnis ansehen, liegt die Prüfung bei Ihnen.
- Was heißt hier "Erfolg", dass eine Datei geschrieben wurde oder dass sie geprüft wurde?
- Welche Schritte kann ich sehen und unterbrechen?
- Bei Bedeutung 2: Kann ich es heute einsetzen, und mit welchen Sprachen und Daten?
09
Häufige Fragen
Kann ich das Projekt weiterbearbeiten, nachdem der Agent eine erste Fassung erzeugt hat?
Nur wenn der Agent etwas ausgibt, das Ihr Editor öffnen kann, eine XML-Timeline wie FCPXML, eine EDL oder Änderungen über die Skript-API des Editors. Eine gerenderte Datei ist in keinem sinnvollen Sinn bearbeitbar. Testen Sie den Rückweg, bevor Sie sich festlegen: erste Fassung erzeugen, eine Sache von Hand ändern, dann den Agent von der geänderten Fassung aus weitermachen lassen.
Woher weiß ich, dass der Agent nicht still etwas kaputt gemacht hat?
Verlangen Sie, dass die Pipeline maschinenlesbare Defekte zurückgibt, Überlaufmaße, fehlende Assets, Bildzahlen, statt den Agent ein Bildschirmfoto beurteilen zu lassen. Jeder oben beschriebene Fehler galt als erfolgreicher Lauf. Behalten Sie eine menschliche Prüfrunde; das Ziel ist, sie auf Stichproben zu verkleinern, nicht sie abzuschaffen.
Heißt Agentic Video, dass die KI die kreativen Entscheidungen trifft?
Nein. Das ist eine Frage, wie Sie die Pipeline aufsetzen, keine Eigenschaft der Technik. Mehrere Beitragende in den von uns gelesenen Diskussionen ziehen die Grenze bewusst: Sie geben mechanische Arbeit ab und behalten Art Direction, Urteil über das Skript und die finale Freigabe. Andere lehnen jede KI-Beteiligung an kreativen Entscheidungen ab. Entscheiden Sie Ihre Grenze, bevor Sie ein Werkzeug wählen, denn Werkzeuge unterstellen Unterschiedliches.
Warum steigen die Kosten pro Video immer weiter?
In den von uns gelesenen Fällen lagen die Kosten in der Wiederholschleife, nicht im ersten Render: so lange neu erzeugen, bis etwas brauchbar ist, und erneut rendern, um zu sehen, ob eine Korrektur gewirkt hat. Die beiden Hebel dieser Beitragenden waren, mechanische Schritte an günstigere Modelle zu geben und kürzere Stücke zu erzeugen. Wir haben keine Daten dazu, wie verbreitet das ist, prüfen Sie es also an Ihrer eigenen Nutzung.
10
Kurz gefasst
Sagt eine Seite Agentic Video und Sie erkennen nicht innerhalb eines Absatzes, ob sie analysiert, spricht oder produziert, klären Sie das zuerst. Steht die Bedeutung fest, sagen zwei Fragen voraus, ob es den echten Betrieb übersteht. Bleibt das Ergebnis bearbeitbar? Und kann das System Ihnen sagen, was es falsch gemacht hat?




