Agentic video es cualquier montaje en el que un sistema de IA decide y actúa a lo largo de varios pasos, en vez de devolver un resultado a partir de un prompt. Esa es toda la idea. La confusión aparece porque hoy el término se usa para tres trabajos distintos y el proveedor rara vez dice a cuál se refiere. Esto importa antes de comprar nada. Los tres trabajos necesitan herramientas distintas, producen fallos distintos y los compran equipos distintos.
01
Qué significa agentic video
Un agente, en este contexto, es software capaz de planificar varios pasos, invocar herramientas, mirar el resultado y decidir qué hacer a continuación. Agentic video aplica ese bucle al vídeo.
| Sentido | Qué hace el agente | Quién lo compra |
|---|---|---|
| Análisis de vídeo | Planifica cómo inspeccionar un vídeo que ya existe | Equipos de búsqueda, moderación y resúmenes |
| Vídeo interactivo | Responde al espectador durante la reproducción | Marketing, formación y soporte |
| Canalización de producción | Ejecuta los pasos que crean un vídeo | Equipos que publican con calendario |
Una prueba rápida al leer la página de un proveedor: pregunte a qué apunta el agente, a un vídeo terminado, a un espectador o a una tarea de producción. Esa sola pregunta separa las tres.
02
Sentido 1: un agente que analiza un vídeo que ya existe
Aquí el vídeo ya existe y el agente decide cómo examinarlo. Google usa "agentic" en este sentido dentro de Gemini: en vez de procesar un clip de forma uniforme, el modelo planifica qué intervalos y qué canales, imagen, audio y transcripción, merecen una inspección más detenida. Resulta útil en grabaciones largas y en preguntas sobre un momento concreto.
No se genera nada. Este sentido trata de leer vídeo, no de fabricarlo. La mecánica, los ajustes de API y cuándo conviene el procesamiento estático están en nuestra guía sobre Gemini 3.7 video understanding.
03
Sentido 2: un vídeo con el que el espectador puede hablar
Este es el sentido que manejan la mayoría de las páginas de marketing. D-ID lo vende como Agentic Videos y lo describe como convertir "passive content into interactive AI experiences", donde el espectador puede "ask questions via voice or chat at any point, turning a one-way broadcast into a two-way dialogue". El agente se apoya en el guion del propio vídeo y en conocimiento complementario para que las respuestas sigan la línea de marca. D-ID cita formación, marketing de producto, preventa y soporte como casos de uso.
La parte de investigación se movió el 1 de octubre de 2026, cuando Tavus presentó Griffin, lo que llama un Human Interaction Model: un único modelo full-duplex que mira, escucha, habla y gesticula a la vez, en lugar de encadenar sistemas separados.
La cifra que todos citaron merece su alcance real. En un estudio que reporta Tavus, 54 participantes reclutados a través de una plataforma de investigación independiente mantuvieron una videollamada de un minuto con Griffin-Lite, y 26 de ellos, el 48 por ciento, creyeron haber hablado con una persona real. El sistema de comparación del mismo estudio obtuvo un 2,4 por ciento. Tavus también revela que sólo al final de la encuesta se preguntó a los participantes si se les había pasado por la cabeza que su interlocutor pudiera no ser real. En el banco de pruebas VideoFDB de NVIDIA para full-duplex, Griffin-Lite va primero en ambas pistas, con 3,83 en generación y 3,73 en percepción entre 15 sistemas. La referencia humana es 3,92 y 4,20, así que una persona sigue por delante en ambas.
Falta un dato en casi toda la cobertura: no puede usarlo. Tavus afirma que Griffin-Lite "will not be available for use for customers at this time, though it is available for select trusted testers as a research preview", y prevé lanzarlo tras el trabajo de seguridad. Si está planificando presupuesto alrededor del vídeo conversacional, este sentido es una vista previa de investigación, no un producto que pueda adoptar.
04
Sentido 3: agentes que ejecutan la producción
Esto es lo que quiere decir la mayoría de los compradores con "automatizar nuestros vídeos". El agente no conversa con un espectador ni estudia material antiguo. Ejecuta los pasos: leer la fuente, escribir el guion, planificar los planos, generarlos o montarlos, aplicar cambios, renderizar.
La pregunta práctica es qué herramienta maneja el agente. En una discusión en r/ClaudeCode, algunos apuntaron un agente a un editor existente por MCP; uno contó que usa DaVinci Resolve Studio conectado a Claude para cortes, títulos, gráficos y B-roll. Otros mantuvieron todo en Python con ffmpeg y dijeron que para tareas bien definidas no hacía falta software más caro. La respuesta más votada de ese hilo fue simplemente que un agente logra mucho sólo con ffmpeg.
Hay un patrón que destaca: quienes obtienen resultados utilizables describen un reparto, no una entrega. Un profesional que coordinó varios agentes para un videoclip escribió que, en vez de "completely delegating the art direction", mantuvo la dirección creativa y delegó la ejecución.
TapVid se sitúa en este tercer sentido. Es un motor de vídeos explicativos: usted entrega un documento, un enlace o un guion, y produce un vídeo explicativo estructurado. Su API REST y su servidor MCP permiten que un asistente lo invoque directamente. La canalización expone análisis, aclaración, documentación, esquema, guion y generación por plano como pasos que puede ver e intervenir. Un cambio se pide conversando, y sólo se vuelve a renderizar el plano indicado en una versión nueva. No cubre el sentido 2: no hay avatar en directo ni preguntas del espectador dentro del reproductor.
05
Lo que se rompe: el agente no ve lo que ha estropeado
Este es el modo de fallo que las páginas de proveedor omiten. Varios participantes en las discusiones que revisamos se lo encontraron por su cuenta.
El patrón es siempre el mismo. La ejecución informa de éxito. El resultado está mal de una forma que el agente no podía detectar.
Casos de esas discusiones:
- Un desarrollador que construía una herramienta para renderizar anuncios describió el bucle habitual: escribir HTML, capturarlo con Chrome headless, mirar la captura, ver que el titular se ha cortado, corregir y volver a capturar. Cada pasada consume tokens. Otro participante respondió que su renderizador de tarjetas "clips a line off the edge without saying a word, and I only find out when I look at the image". Después dio un caso concreto: el texto de una opción se salía del recuadro hacia los 33 caracteres, sin aviso.
- Un tercero lo resumió como herramientas que "most tools just shrug and let you find out from the broken output later".
- En el renderizado pasa igual. Un equipo vio una captura de fotograma que "once returned about 8,500 bytes of black instead of a 2.6MB frame". Preguntaban cómo distinguir "fits at this size" de "all layers actually rendered".
- Con el audio ocurre lo mismo. En un hilo sobre pódcast, alguien advirtió de que las marcas de tiempo por palabra no son puntos de corte. Si corta ahí, se lleva el ataque de la primera palabra y la cola de la última. Todo suena ligeramente mal y no se oye por qué. Otro señaló que el stream copy de ffmpeg sólo puede empezar en un fotograma clave, así que el punto de entrada retrocede y queda colgando el final de la frase anterior.
Nada de esto es un problema de calidad del modelo. Son problemas de notificación. El agente miró un archivo y decidió que estaba listo.
La solución a la que llegan todos es hacer los defectos legibles por máquina, no por el ojo. El desarrollador citado rehízo su renderizador. Ahora cada edición devuelve qué está roto en cada tamaño, con un error con la forma "leaderboard content !overflow needs 572x116". El agente repara a partir de ese texto. En su propio banco de pruebas reporta unas 2 veces menos tokens que el bucle de capturas. Tras la pregunta de un revisor añadió más comprobaciones: un clip que muere a mitad hace fallar el render; cada archivo de salida se comprueba fotograma a fotograma; un recurso que falta se detecta antes de empezar a renderizar.
Otro participante ataca antes en la cadena. Pasa el material primero por un modelo local para obtener transcripciones, descripciones de escena y etiquetas de movimiento. El agente de montaje trabaja luego sobre ese texto en vez de releer el vídeo.
Exija tres cosas, en este orden. Que la canalización devuelva defectos estructurados, no una miniatura. Que "éxito" signifique que el archivo existe, que están todos los fotogramas y que todos los recursos se han resuelto. Y que una persona siga revisando antes de publicar nada.
06
Exija que el resultado siga siendo editable
La segunda preocupación es qué le queda en la mano. Varios participantes en las discusiones que revisamos fueron claros: un MP4 terminado no es un entregable aceptable.
La pregunta que abrió un hilo de r/ClaudeCode lo dice sin rodeos. El autor quería delegar el montaje en un modelo, pero escribió: "I need the project to remain editable within standard video editing software. I don't want the editing process to turn into a script that can only be modified via code." Le preocupaba que los marcos orientados a código alejaran el trabajo de un editor real.
Las respuestas apuntaban en una dirección. Que el agente emita un proyecto, no un render. Un participante propuso que el modelo escribiera una línea de tiempo XML que el editor pueda importar, y mover después los clips a mano. Aconsejó probar un par de cortes antes de confiarle un proyecto. Los formatos de intercambio de los propios editores existen justo para esto: FCPXML, EDL y APIs de scripting como la de DaVinci Resolve.
La versión más afilada de la prueba vino de alguien que declaró estar construyendo un producto en este campo. Lo que él comprobaría es "whether you can make a manual change and then have Claude continue from that updated project". Generar el primer montaje es útil; mantener vivo el ida y vuelta es lo que ahorra tiempo de verdad.
Tome prestada esa prueba. Genere una primera pasada. Cambie una cosa a mano. Luego pida al agente que continúe desde su versión. Una herramienta que sólo sabe empezar de cero le costará en cada ronda de correcciones.
07
Dónde acaba cayendo el coste
Tome esta sección como informes individuales, no como un patrón de mercado; procede de pocos participantes.
Dos de ellos sostenían que el corte no es donde se va el tiempo. Uno escribió que él "measure the second cut against review time, not the $50 API bill", porque si sigue viendo el programa entero, ahí está el gasto. El profesional al que respondía había pasado del montaje manual a ver el episodio dos o tres veces a 1,25x, y aspiraba a un visionado completo más comprobaciones puntuales.
Sobre el coste de generación, un participante describió repetir hasta dar con algo utilizable como "spending hundreds of dollars spinning the slot machine", y otro con una canalización en marcha estaba moviendo los pasos mecánicos a subagentes más baratos para que no se comieran su presupuesto.
La palanca es la misma en ambos casos: el coste está en el bucle de reintentos, no en el primer render. Es otra razón para cerrar la brecha de notificación anterior. Un agente capaz de distinguir un mal resultado de uno bueno deja de pagar la diferencia.
08
Qué preguntar a un proveedor que dice "agentic"
Hágalas en orden. La primera respuesta le dice con qué sentido está tratando y las demás le dicen quién asume el riesgo una vez que el agente está en marcha. Un proveedor que no puede responderlas no asume ninguno.
- ¿De qué sentido hablamos: análisis, reproducción interactiva o producción? Si la página no lo dice, asuma que es lenguaje de marketing.
- ¿Qué me entrega el agente, un archivo terminado o un proyecto que puedo abrir y editar?
- ¿Puedo hacer un cambio a mano y que el agente continúe desde mi versión?
- ¿Cómo informa el sistema de un defecto? Pida un error de ejemplo. Si la respuesta es que mire el resultado, la revisión es suya.
- ¿Qué significa aquí "éxito": que se escribió un archivo o que se verificó?
- ¿Qué pasos puedo ver e interrumpir?
- Si es el sentido 2: ¿puedo usarlo hoy, y con qué idiomas y qué datos?
09
Preguntas frecuentes
¿Puedo seguir editando el proyecto después de que el agente genere una primera versión?
Sólo si el agente devuelve algo que su editor pueda abrir: una línea de tiempo XML como FCPXML, una EDL o cambios hechos con la API de scripting del propio editor. Un archivo renderizado no es editable en ningún sentido útil. Pruebe el ida y vuelta antes de comprometerse: genere una primera pasada, cambie una cosa a mano y pida al agente que continúe desde el proyecto modificado.
¿Cómo sé que el agente no ha roto algo en silencio?
Exija que la canalización devuelva defectos legibles por máquina (medidas de desbordamiento, recursos que faltan, recuento de fotogramas) en vez de pedir al agente que juzgue una captura. Todos los fallos descritos arriba pasaron como ejecuciones correctas. Mantenga una ronda de revisión humana; el objetivo es reducirla a comprobaciones puntuales, no eliminarla.
¿Agentic video significa que la IA toma las decisiones creativas?
No. Eso depende de cómo monte usted la canalización, no de la tecnología. Varios participantes en las discusiones que revisamos trazan la línea a propósito: delegan el trabajo mecánico y se quedan la dirección de arte, el criterio sobre el guion y la aprobación final. Otros rechazan cualquier intervención de la IA en decisiones creativas. Decida dónde está su línea antes de elegir herramienta, porque las herramientas dan por supuestas cosas distintas.
¿Por qué sube el coste por vídeo?
En los casos que leímos, el coste estaba en el bucle de reintentos, no en el primer render: regenerar hasta que algo sirve y volver a renderizar para ver si la corrección funcionó. Las dos palancas que usaron esos participantes fueron mandar los pasos mecánicos a modelos más baratos y generar piezas más cortas. No tenemos datos sobre lo extendido que está, así que compruébelo en su propio uso.
10
En resumen
Si una página dice agentic video y en un párrafo usted no distingue si analiza, conversa o produce, resuelva eso primero. Una vez conoce el sentido, dos preguntas predicen si aguanta el trabajo real. ¿El resultado sigue siendo editable? ¿Y puede el sistema decirle en qué se equivocó?




