TL;DR
En vídeos con mucha información, TapVid lidera el campo.
Esta prueba comparativa de video con IA está diseñada para videos que deben informar (instructivos, editoriales, explicativos) y no entretener. En los escenarios con gran densidad de información a los que se dirige, TapVid toma la delantera absoluta en cobertura de hechos, empata en primer lugar en entrega de información TeachQuiz y encabeza la calidad general en siete sistemas. La métrica automatizada independiente y estándar de la industria, VBench, reproduce la preferencia del panel humano, confirmando el rigor de la evaluación.
01
Veredicto de referencia de vídeo de IA: primero en el contenido que importa, equilibrado en todos los demás
Las escenas con mucha información (profesionales, noticias, instructivos, educación) son el dominio objetivo del punto de referencia y es donde gana TapVid. En las 25 escenas, TapVid es claramente el segundo de 7 en calidad informativa y es el único renderizador de código potente en ambos ejes informativos .
Calidad general: informativo y estético 75.2 T N.º 1 de 7 en trabajos con gran densidad de información: el único sistema elevado en todos los ejes a la vez.
Apreferencia estética frente a Fable 5, el líder informativo 58.7% Preferido al mejor sistema informativo del sector en visualización lado a lado, y significativamente no pierde.
Cobertura objetiva: escenas densas en información 83.6% El líder de campo absoluto. Significativamente por delante de 5 de 6 competidores en la visualización de los datos requeridos en la pantalla.
TeachQuiz Entrega de información: escenas densas en información 84.5% Empatado en primer lugar. Los espectadores responden preguntas de comprensión tanto después de TapVid como de cualquier sistema en el campo.
CALIDAD GENERAL — INFORMATIVA + ESTÉTICA · ESCENAS DENSAS EN INFORMACIÓN
*(Fidelidad del contenido + Calidad visual + Preferencia estética) / 3 · Puntuación T relativa al campo (70 = media del campo, 10 = 1 DE)*

Ambos marcos se informan en todas partes. Los titulares utilizan el marco denso en información (UC1–UC4) como objetivos de referencia, como se muestra aquí, donde TapVid encabeza la calidad general; en las 25 escenas, TapVid ocupa el segundo lugar de 7 en calidad informativa (T 78 frente a 85 de Fable 5). Los cuadros de mando completos con intervalos de confianza se encuentran en el apéndice.
EL REFERENCIA
02
Creado para vídeos que deben informar, no entretener
Cada uno de los cinco casos de uso se basa en material fuente del mundo real y se evalúa en cinco escenas basadas en la intención: el informe especifica los hechos que un espectador debe seguir, y los anotadores humanos miden si lo hacen. El objetivo es un vídeo de alta densidad de información y con una intención clara (instructivo, editorial, explicativo), no contenido estético o de entretenimiento.
EL CAMPO: SIETE SISTEMAS, DOS PARADIGMAS
| Sistema | Arnés / modelo | familia |
|---|---|---|
| TapVid | vídeo renderizado con código | renderizado de código |
| Fable 5 | Claude Code · Fable 5 | renderizado de código |
| Representación de código H | Claude Code · Sonnet 5 | renderizado de código |
| Representación de código R | Codex · GPT-5.5 | renderizado de código |
| Difusión de píxeles L | estudio oficial · Modo Pro, 1080p | difusión de píxeles |
| Seedance | Seedance 2.0 · Jimeng · Modo VIP, 720p | difusión de píxeles |
| Veo | Veo 3.1 · Google Flow · Modo calidad, 720p | difusión de píxeles |
Se accedió a todos los sistemas 2026 del 6 al 12 de julio: herramientas ejecutadas localmente congeladas en su última versión a partir del 6 de julio, sistemas alojados en el último modelo insignia en su plataforma oficial; cada sistema en su configuración de calidad máxima, 16:9. Los pines de la versión exacta con las fuentes se encuentran en el apéndice A.
CINCO CASOS DE USO, MATERIAL FUENTE DEL MUNDO REAL
| Caso de uso | Material de origen |
|---|---|
| Empresa Profesional / Autoaprendizaje | Tareas de GDPval: servicios técnicos y profesionales, gobierno, fabricación, finanzas |
| Editorial de noticias | 2025-26 cubre: Economista, FT, Bloomberg, Naturaleza, Ciencia |
| Estilo de vida práctico | Top #HowTo YouTube: manualidades/bricolaje, arte, fitness, mentalidad, rompecabezas |
| Educación explicativa | “Explicación del examen AP” más visto: historia, psicología, cálculo, biología, geografía |
| Comercialización de Producto/ventas | Vídeos de lanzamiento de las empresas más valiosas del NASDAQ en todos los sectores |
Reglas de muestreo fijadas antes de la generación. Cada caso de uso dibuja sus cinco escenas mediante una regla predefinida: agrupar el grupo de origen, muestrear aleatoriamente uno por grupo (principales industrias, publicaciones, categorías de contenido, temas AP, sectores NASDAQ). Cada resumen es un mensaje de generación de video completamente detallado que contiene la carga útil de información completa, creada y congelada antes de que cualquier sistema generara algo ; su lista de verificación de hechos requeridos (168 hechos en el punto de referencia) y las preguntas de comprensión (149) fueron escritas al mismo tiempo y revisadas por humanos. Un ejemplo completo se encuentra en el apéndice B.
CÓMO SE CORRIÓ EL CAMPO: UN TIRO, EL MISMO BREVE, AJUSTES SUPERIORES
- Entradas idénticas: cada sistema recibió el mismo breve resumen palabra por palabra: cero ingeniería de avisos por sistema.
- Best-of-1: una generación por escena, nunca seleccionada; Se reintentan fallos graves hasta lograr el éxito (se observaron como máximo 3 reintentos).
- Duración generada: longitudes objetivo establecidas por el informe; La salida real de cada sistema se utiliza tal cual (el sistema promedia entre 1,1 y 4,2 minutos).
- La contabilidad 173/175: Las reglas de seguridad de Fable 5 rechazaron 2 de sus 25 escritos. En lugar de sustituir su alternativa Opus, calificamos Fable 5 solo en sus propias 23 generaciones: ningún competidor fue debilitado silenciosamente y las celdas faltantes se eliminan de los denominadores, nunca se imputan.
EL PANEL DE ANOTADORES: INDEPENDIENTE, CIEGO, TOTALMENTE CRUZADO
- 12 anotadores independientes, autónomos subcontratados no afiliados a ningún equipo de sistema, cada uno con una maestría o superior de una de las 50 mejores universidades del QS World Ranking, con competencia certificada en inglés.
- Ciegos en todas partes: videos presentados sin etiquetar en orden aleatorio; A los anotadores nunca se les dijo qué sistema produjo un video.
- Totalmente cruzado: los 12 anotadores calificaron los 7 sistemas, dos evaluadores por video: un evaluador estricto o indulgente mueve todos los sistemas por igual y no puede sesgar una comparación.
- Visualización deliberada, no trabajo con clic: ~20 minutos de anotación por video de menos de 5 minutos, pagados a 4 veces el salario mínimo local. Anotado del 13 al 15 de julio de 2026.
Métricas basadas en métodos publicados, medidas por personas
Cada video es calificado por un panel de anotadores completamente cruzado : cada anotador calificó cada sistema, por lo que un evaluador estricto o indulgente mueve todos los sistemas por igual y no puede sesgar una comparación. El panel produjo 6,760 anotaciones humanas en cinco estaciones basadas en métodos publicados (tres de ellas revisadas por pares en ICML, WACV e IEEE TPAMI/CVPR) y cada video *también* es calificado por el modelo automatizado VBench: >3.7 millones evaluaciones de modelos a nivel de marco.
- TeachQuiz Entrega de información (Code2Video, ICML 2026 · arXiv:2510.01174): cuánta información deseada realmente adquiere un espectador.
- Cobertura fáctica: de los hechos que requiere el escrito, cuántos aparecen en pantalla, palabra por palabra y legibles.
- T2VTextBench Precisión del texto (arXiv:2505.04946): corrección de los títulos, números y etiquetas en pantalla.
- T2VWorldBench ( WACV 2026 · arXiv:2507.18107): cuatro dimensiones de calidad: calidad de vídeo, realismo, relevancia y coherencia.
- Aesthetic Preference: comparaciones estilo arena, lado a lado, con TapVid.
- VBench (VBench++, IEEE TPAMI 2025 · VBench original, CVPR 2024 Highlight · el modelo detrás de la tabla de clasificación pública HuggingFace) — suite de calidad de video automatizada estándar de la industria, >3.7 millones de evaluaciones de modelos a nivel de marco.
VBench es una verificación cruzada independiente y basada en máquina de de nuestras anotaciones humanas. : su evaluación de la calidad del marco reproduce nuestra clasificación de preferencias humanas, por lo que los dos instrumentos se corroboran entre sí (Hallazgo 05).
Las clasificaciones son sólidas en cuanto a cómo se calculan: tres estimadores independientes (tasas brutas, ganancia de información sin incluir y modelos logísticos de efectos mixtos) producen el mismo ordenamiento, y las variantes ponderadas por confiabilidad y PCA lo dejan sin cambios. Debido a que Marketing se comporta como una familia de tareas diferente de los cuatro casos de uso con gran densidad de información, cada resultado se informa en dos cuadros: las 25 escenas y el cuadro con gran densidad de información (Profesional, Noticias, Procedimientos, Explicador). Las tablas completas para ambos se encuentran en el apéndice.
ENCONTRAR 01 · EL MARCO DE CAMPO COMPLETOE
03
El vídeo informativo es una frontera de compensación, y TapVid mantiene el punto de equilibrio
GANAR El campo es una frontera de compensación: en Calidad Informativa el orden es Fable 5 > TapVid > todos los demás; en Preferencia Estética el orden se invierte exactamente. TapVid es el único procesador de código alto en ambos ejes informativos: fidelidad de contenido 77, calidad visual 79, segundo de 7 en cada uno, el punto de equilibrio de la frontera.
La preferencia estética se mide al estilo de la arena (dos videos del mismo resumen, uno al lado del otro) y captura algo que las rúbricas informativas no hacen: su correlación con cada métrica informativa es de negativo a cero (-0,22 a -0,01). Los renderizadores de código compran calidad informativa; La difusión de píxeles adquiere atractivo estético. La siguiente frontera sitúa a los siete sistemas en esa compensación, en ambos marcos.
LA FRONTERA INFORMATIVA-ESTÉTICA
*x: Calidad informativa · y: Preferencia estética · Puntuaciones T relativas al campo (70 = media del campo) · escenas densas en información*

TapVid es el único sistema en el cuadrante verde (altamente informativo y estéticamente preferido) en ambos marcos. La frontera corre cuesta abajo: Calidad Informativa ordena Fable 5 > TapVid > el resto, y Preferencia Estética la invierte de un extremo a otro. En escenas densas en información, TapVid se mueve al codo de la frontera (Calidad Informativa 82, a 3,5 T del líder) mientras que el borde estético de difusión de píxeles se reduce a la paridad; en las 25 escenas, Seedance y Pixel-diffusion L se sitúan por encima del rango de preferencia mostrado. La preferencia estética se informa junto con la calidad informativa, nunca se promedia.
TASA DE GANANCIA ESTÉTICA DE TAPVID: VISIÓN LADO A LADO, LAS 25 ESCENAS
*proporción de comparaciones lado a lado de victorias TapVid (los empates cuentan la mitad) · ×100*

Más de 50 = los espectadores prefieren TapVid. Importancia de las pruebas de logit mixto sin pérdidas/ganancia decisiva; Los CI completos y el marco sin pérdidas se encuentran en el apéndice.
TASA DE GANANCIA ESTÉTICA DE TAPVID: VISIÓN LADO A LADO, ESCENAS DENSAS EN INFORMACIÓN
*proporción de comparaciones lado a lado de victorias TapVid (los empates cuentan la mitad) · ×100*

En el dominio objetivo del índice de referencia, los déficits estéticos se reducen a la paridad: sólo el Seedance sigue siendo significativamente preferido en comparaciones decisivas.
WIN Mostrado lado a lado contra Fable 5, el líder informativo del campo, los espectadores prefieren TapVid. Tasa de ganancia del 58,7 %, y TapVid significativamente no pierde (P = 0,72). El sistema que supera al TapVid en compuestos de calidad pierde frente a los espectadores.
GANAR En trabajos con mucha información, TapVid no concede nada a la estética mientras lidera el contenido. En general, la ausencia de pérdidas aumenta al 53,0% (paridad) y ningún sistema de difusión de píxeles ofrece una ventaja significativa sin pérdidas allí. Frente al Veo de Google: adelante en calidad informativa (78 frente a 65), significativamente adelante en cobertura y cambio de preferencias.
LIMITACIÓN En las 25 escenas, la preferencia estética es una verdadera debilidad. La tasa de ganancia general de TapVid es del 40,7%, significativamente por debajo de la línea de no preferencia del 50%, y es significativamente menos preferido que Pixel-diffusion L y Seedance, el final de la clasificación informativa. La inversión es el intercambio de paradigmas, concentrado en Marketing; el plan de cierre lo aborda directamente.
HALLAZGO 02 · COBERTURA HECHO
04
Mostrar datos en pantalla es la limitación vinculante, y TapVid lo hace mejor
GANAR En escenas con mucha información, TapVid muestra el 83,6% de los datos requeridos en la pantalla: el líder absoluto, significativamente por delante de 5 de 6 competidores. En las 25 escenas, está estadísticamente empatado con el líder Fable 5 y significativamente por delante de todos los sistemas de difusión de píxeles.
La cobertura es la métrica más discriminante del punto de referencia: el campo se divide en dos niveles limpios, con los cuatro procesadores de código (74-79% de los datos en pantalla) muy por encima de los tres sistemas de difusión de píxeles (54-61%).
COBERTURA DE HECHOS: PARTICIPACIÓN DE HECHOS REQUERIDOS EN PANTALLA
*media · 95 % de CI de arranque en escenas · escenas con mucha información · ×100*

Marco denso en información: TapVid 83,6 [77,3–89,0] lidera directamente; la brecha con todos los sistemas excepto Fable 5 es estadísticamente significativa (el IC del 95 % logit mixto excluye 0). Cuadro de 25: Fable 5 79.0, TapVid 77.3 (un empate estadístico) con Seedance, Veo y Pixel-diffusion L significativamente por detrás en ambos cuadros.
LA COBERTURA IMPULSA LA ENTREGA: UN PUNTO POR VIDEO, 173 VIDEOS
*x: Cobertura fáctica · y: Entrega de información TeachQuiz (tasa correcta) · ×100*

GANAR Una vez que un hecho está en pantalla, los espectadores lo captan aproximadamente el 95% de las veces. La cobertura y la entrega se correlacionan en r = 0,70 en 173 vídeos, y la línea ajustada va desde un mínimo del 36% sin hechos hasta un máximo del 96% en pantalla. La comprensión es casi un paso resuelto: el juego es la cobertura y TapVid lo juega mejor.
COBERTURA POR CASO DE USO: P PREDICCIÓN DEL MODELO (HECHO EN PANTALLA)
*probabilidad predicha de logit mixto por caso de uso · ×100*

WIN TapVid conduce o vincula para el liderazgo de cobertura en cuatro de cinco casos de uso. Lidera claramente Noticias (81,9) y Cómo hacer (86,7), y en Profesional está significativamente por delante de cuatro competidores, incluido el líder general Fable 5.
LIMITACIÓN El marketing es la excepción. La cobertura de TapVid cae al 53,8% allí: la parte inferior de los renderizadores de código, detrás de Fable 5, Code-render R y Code-render H. La misma brecha da forma a la columna de Marketing de cada métrica; el plan de cierre lo trata como un solo problema.
ENCONTRAR 03 · ENTREGA DE INFORMACIÓN DE TEACHQUIZY
05
Los espectadores aprenden tanto de TapVid como de cualquier sistema en el campo
GANAR En escenas con mucha información, TapVid empata en primer lugar en Entrega de información TeachQuiz (los espectadores responden correctamente el 84,5% de las preguntas de comprensión) y supera significativamente a tres sistemas (Code-render H, Seedance, Pixel-diffusion L). En las 25 escenas, los cinco primeros son estadísticamente inseparables; TapVid está significativamente por delante de Pixel-diffusion L y Seedance.
La entrega sigue el protocolo TeachQuiz: después de mirar, los anotadores responden preguntas de opción múltiple sobre los hechos que requería el informe, y cada video se califica según una línea de base de campo por pregunta. Tres estimadores independientes (tasa correcta bruta, ganancia de información sin incluir y un logit de efectos mixtos) coinciden en el orden.
ENTREGA DE INFORMACIÓN DEL TEACHQUIZ - TASA CORRECTA DE COMPRENSIÓN
*tasa correcta bruta · significancia vs TapVid de logit de efectos mixtos · escenas densas en información · ×100*

TapVid es de primer nivel en ambos marcos. Las tablas completas de victorias, empates y derrotas por caso de uso se encuentran en el apéndice.
ENTREGA POR CASO DE USO: TASA CORRECTA DE COMPRENSIÓN
*tasa correcta bruta por caso de uso · barras con 95% de CI de arranque sobre las escenas del caso de uso · ×100*

TapVid es de primer nivel en News (88.3) y How-To (89.7); según la inferencia logit mixta, supera significativamente a Code-render R, Pixel-diffusion L y Seedance en News y Veo en How-To, sin perder ante ninguno en ninguno de los dos. Profesional y Explicador están en el medio campo; El marketing es la brecha a la que apunta el [plan de cierre] (https://tapvid.ai/blog/information-dense-ai-video-benchmark). Cada caso de uso se basa en 5 escenas, por lo que los CI son amplios; Las llamadas de significado provienen del logit mixto por caso de uso en el apéndice.
PRECISIÓN DEL TEXTO T2VTEXTBENCH: TÍTULOS, NÚMEROS Y ETIQUETAS EN PANTALLA
*calificación de cuatro niveles asignada a [0,1] · 95 % de CI de arranque · escenas con gran densidad de información · ×100*

WIN TapVid reproduce mejor el texto en pantalla en escenas con mucha información. En las 25 escenas, la cima del campo es estadísticamente inseparable.
HALLAZGO 04 · CALIDAD VISUAL
06
Empatado estadísticamente con el líder en tres de cuatro dimensiones visuales
GANAR En la evaluación humana T2VWorldBench, TapVid está estadísticamente empatado con el líder Fable 5 en realismo, relevancia y consistencia (en ambos fotogramas) y un claro segundo lugar de 7 en el compuesto de cuatro dimensiones (86,4), significativamente por delante de Seedance y Pixel-diffusion L. Lo que sea que renderice TapVid, lo renderiza limpiamente.
Las cuatro dimensiones se clasifican del 1 al 5 mediante el panel anotador cruzado frente a rúbricas por dimensión. La única diferencia visual importante con respecto al Fable 5 es la calidad del vídeo (86,0 frente a 90,0); las otras tres dimensiones son vínculos estadísticos.
T2VWORLDBENCH — CUATRO DIMENSIONES, LAS 25 ESCENAS
*calificación media · IC de arranque del 95 % sobre escenas · ×100 · * = significativo frente a TapVid*

TapVid ocupa el segundo lugar en Calidad, Realismo y Consistencia, y el tercero en Relevancia (detrás de Fable 5 y Code-render R). La relevancia (“dice lo correcto”) se comporta como una dimensión de contenido y se analiza con las métricas de contenido anteriores.
GANAR Cuando los evaluadores están totalmente de acuerdo, TapVid obtiene la puntuación más alta. En el subconjunto de acuerdo exacto, la calidad de video de TapVid aumenta a 0,97, superando a Fable 5; las claras victorias de TapVid son inequívocas.
HALLAZGO 05 · CORROBORACIÓN INDEPENDIENTE
07
Anotaciones humanas validadas por la métrica automatizada estándar de la industria VBench
VERIFICAR Corriendo a ciegas en las mismas 25 escenas, VBench, el modelo automatizado detrás de la tabla de clasificación pública HuggingFace, califica cada video independientemente del panel humano. Ordena los sistemas de la misma manera que lo hace la preferencia de lado a lado de nuestros anotadores. Spearman ρ = +0,89 entre la calidad del marco VBench y la preferencia humana; +0,87 dejando fuera cualquier sistema. El eje de preferencia humana no es un artefacto de nuestros evaluadores: una métrica de máquina independiente y basada en papel aterriza en el mismo orden.
Un modelo automatizado ampliamente utilizado, calculado sin conocimiento de las etiquetas humanas, coincide con el panel humano en cuanto a cómo se clasifican los sistemas: evidencia de que la evaluación captura una señal real y reproducible en lugar de la idiosincrasia del evaluador.
LOS INSTRUMENTOS AUTOMATIZADOS Y HUMANOS ESTÁN DE ACUERDO: CADA VIDEO MOSTRADO
*x: Calidad de cuadro VBench por video (automatizado) · y: tasa de ganancia humana de cada sistema · 141 videos de sistema×escena, coloreados por sistema · ×100*

Eda pequeño punto es la calidad de fotograma automatizada de un vídeo, coloreada por el sistema y colocada según la tasa de ganancia humana de ese sistema; los puntos grandes son los medios del sistema. Las nubes de colores se apilan en orden de tasa de ganancia y sus centros ascienden de izquierda a derecha: la calidad del marco automatizado y la preferencia humana clasifican los sistemas juntos (Spearman ρ = +0,89). Los sistemas no se nombran: la cuestión es el acuerdo de los dos instrumentos, no la posición de un sistema en particular.
SRC VBench (VBench++, IEEE TPAMI 2025 · VBench original, CVPR 2024 Highlight) es el punto de referencia estándar automatizado de calidad de video detrás de la tabla de clasificación pública HuggingFace, con seis dimensiones por clip. Se ejecutó con la ruta de código oficial VBench-Long (commit e946a8d) en GPU dedicadas del 13 al 14 de julio, y se completó antes de que existiera cualquier comparación con las etiquetas humanas. El cabezal Frame Quality (Estético + Calidad de imagen) es la verificación cruzada estética que se utiliza aquí, la calidad calculada cuando funciona para que una generación fallida no distorsione la puntuación de un sistema. Cada compuesto se volvió a calcular a partir de las puntuaciones brutas por escena y coincide con el informe fuente al decimal; El protocolo de ejecución completo se encuentra en el apéndice A.
LA PRÓXIMA GANA AL CIERREE
08
Dos objetivos: contenido de marketing y atractivo estético sin comercio informativo
Ambas brechas son medidas, localizadas y separables de lo que ya funciona. Ninguno de los dos requiere tocar el motor de cobertura y entrega que gana el dominio denso en información.
TAPVID POR CASO DE USO: LA BRECHA DE MARKETING ES EL CONTENIDO, NO LA PRESENTACIÓN
*Compuesto de fidelidad del contenido frente a calidad visual · puntuación T relativa al campo · por caso de uso*

En marketing, la calidad visual de TapVid se mantiene en 75, mientras que la fidelidad del contenido cae a 51: los videos se reproducen limpiamente pero omiten los datos requeridos. En el resto del mundo, los dos ejes se mueven juntos entre 68 y 93.
EL PROGRAMA ESTÉTICO: AVANZAR EN EL EJE ESTÉTICO, MANTENER EL LIDERAZGO INFORMATIVO
*x: Calidad informativa · y: Preferencia estética · T-scores · las 25 escenas*

Debido a que la preferencia es ortogonal a cada métrica de calidad, el movimiento es directo hacia arriba: aumentar el movimiento, el pulido y el atractivo desplaza TapVid hacia la esquina superior derecha vacía de la frontera sin gastar nada de su ventaja informativa.
SIGUIENTE Gane para cerrar el n.º 1: contenido de marketing. El colapso es la entrega de hechos en escenas de marketing, no la representación: una extensión específica del motor de cobertura que ya lidera cuatro casos de uso, no una reconstrucción. Cerrarlo convierte la ventaja de cobertura densa en información de TapVid en una de campo completo: excluyendo Marketing, TapVid ya encabeza cinco de seis sistemas en cobertura absoluta.
SIGUIENTE Gana para cerrar #2: preferencia estética versus difusión de píxeles, sin devolver el liderazgo informativo. La preferencia es empíricamente ortogonal a cada métrica de calidad, por lo que cerrarla es su propio programa (moción, pulido, apelación), no un intercambio forzado contra la cobertura o la entrega. El marco denso en información muestra el techo: donde el contenido es denso, TapVid ya alcanza la paridad de preferencias mientras mantiene el liderazgo en contenido.
APENDICE
09
Protocolo congelado, estadísticas preclasificadas, cada resultado completo
Las versiones del sistema están fijadas al día con las fuentes; las reglas de muestreo y las listas de verificación de hechos se fijaron antes de que existiera el video; el panel de anotadores estaba ciego y completamente cruzado (A – B). Tres estimadores independientes acuerdan cada orden, se siembra toda la aleatoriedad y una repetición independiente reprodujo cada artefacto (C – E). Tablas de clasificación completas con intervalos de confianza para cada métrica, en ambos marcos (F-K). Las columnas Δ son contrastes logit mixtos de probabilidades logarítmicas frente a TapVid, a menos que se indique lo contrario; WIN / LOSS = el intervalo del 95% excluye el cero, desde la perspectiva de TapVid; EMPATE = no es así.
CLAVE Denominación del sistema. El cuerpo de este informe hace referencia a tres sistemas mediante etiquetas anónimas. Sus identidades reales, indicadas aquí únicamente: Representación de código H = Hyperframes · Representación de código R = Remotion · Difusión de píxeles L = LTX. Las tablas siguientes utilizan los nombres reales de los productos.
A · Protocolo de experimento: versiones, cronograma, libro de anotaciones
Timeline (2026). Resúmenes + listas de verificación de hechos creados y congelados antes del 6 de julio → sistemas congelados el 6 de julio → toda la generación del 6 al 12 de julio → puntuación VBench-Long del 13 al 14 de julio → anotación humana del 13 al 15 de julio (primera respuesta el 13 de julio a las 09:41, el último 15 de julio a las 04:33) → estadísticas y alineación humana↔VBench del 14 al 16 de julio. La puntuación VBench se completó antes de que existiera cualquier comparación entre etiquetas humanas.
Pins de versión: herramientas ejecutadas localmente en su última versión a partir de la congelación del 6 de julio; plataformas alojadas en el último modelo insignia durante la ventana. Todo 16:9, configuración de máxima calidad, funciones de guión gráfico/planificación tal como se envía en cada plataforma.
| Sistema | Versión · plataforma · configuración | Fuente |
|---|---|---|
| TapVid | corriente de compilación interna en la ventana de acceso | — |
| Fable 5 | Claude Code 2.1.202 · modelo claude-fable-5 (anunciado el 9 de junio, reimplementado el 1 de julio) · valores predeterminados | anuncio · registro de cambios |
| Hyperframes | v0.7.37 · Claude Code · Sonnet 5 (lanzado el 30 de junio) · valores predeterminados | lanzamiento · Sonnet 5 |
| Remotion | v4.0.485 · Codex CLI 0.142.5 · GPT-5.5 (anunciado el 23 de abril; GPT-5.6 enviado el 9 de julio, después de la congelación) · valores predeterminados | lanzamiento · Codex · GPT-5.5 |
| Veo | Veo 3.1 (anunciado el 15 de octubre de 2025) · Google Flow, planificación de guiones gráficos por Flow · Modo de calidad, 720p | anuncio · modos doc |
| LTX | LTX-2.3 (lanzado en marzo de 2026) · LTX Studio, planificación de guiones gráficos de LTX Studio usando GPT-Image-2 · Modo Pro, 1080p | lanzamiento · GPT-Imagen-2 |
| Seedance | Seedance 2.0 (anunciado el 12 de febrero) · Jimeng — Plataforma de consumo oficial de ByteDance — Modo agente, habilidad de película de historia · Modo VIP (alta calidad), 720p | anuncio · Jimeng |
Prompt provenance. Los 25 resúmenes y sus listas de verificación de hechos fueron escritos con Claude Opus en Claude Code, revisados por humanos y congelados antes de que comenzara la generación. Si la autoría de IA sesga los resúmenes hacia el idioma de cualquier sistema, el beneficiario sería Fable 5 (un competidor), no TapVid.
El libro mayor de 6760 anotaciones. Una fila por anotador × escena × sistema × elemento: verificación de datos 2326 (168 hechos) + comprensión de TeachQuiz 2062 (149 preguntas) + cuatro dimensiones de T2VWorldBench 1384 (346 unidades de video × evaluador × 4) + precisión de texto 692 (346 unidades × calificación + bandera de basura) + preferencia de lado a lado 296 = 6,760. Cada recuento es recalculable a partir de la exportación sin procesar.
VBench run. Código oficial VBench-Long ( vbench2_beta_long , commit e946a8d ) en 5× NVIDIA L4, un fragmento por caso de uso, ~6 h de pared; entorno fijado y reproducido desde cero en una instancia nueva; Se conservan los JSON de resultados por celda y los registros de ejecución. Normalización de entrada y aritmética de evaluación >3,7M: apéndice E.
B · Ejemplo resuelto: un resumen de todo el proceso
El resumen (Escena instructiva 1): *“El papel que explota: un juguete inquietante de origami sin pegamento”*, objetivo 5:00, 16:9. Como cada informe, es un documento de producción completamente especificado, idéntico para los siete sistemas: dirección de arte con una paleta hexadecimal exacta, iluminación y lenguaje de cámara, una lista de tomas de nueve escenas con texto completo de voz en off y notas de movimiento por escena, y un único mensaje maestro, por ejemplo, *“…los tres papeles codificados por colores (caja exterior índigo de 6×6, botón interior ámbar de 5×5, resorte violeta de 9×4), el pliegue blintz compartido que forma ambas cajas… el cierre sin pegamento donde las solapas se esconden debajo de los bordes adyacentes…”* La carga útil de información completa reside en el resumen, por lo que las fallas de cobertura son atribuibles al sistema, no al mensaje.
Su lista de verificación de hechos requeridos (escrito con el informe, congelado antes de la generación; elementos de la estación traducidos en inglés). Un hecho se acredita sólo si aparece en la pantalla palabra por palabra y es legible; los anotadores pueden reproducir cuadro por cuadro:
- Papel de la caja exterior: 6×6 cm
- Papel para botones interior: 5×5 cm
- Papel primavera: 9×4 cm
- La promesa sin pegamento: sin pegamento, sin cinta, en cualquier lugar
- El pliegue clave, por nombre: pliegue ciego (esquinas al centro)
Elemento de comprensión A TeachQuiz (respondido después de verlo; el escape “video no proporcionó esto” se califica como incorrecto): *“¿Cuál es el pliegue clave que comparten ambas cajas?”* — pliegue en valle / pliegue de blintz (esquinas al centro) / pliegue de calabaza / el video no proporcionó esta información.
Cómo obtuvo la puntuación. En esta escena, los dos evaluadores de TapVid acreditaron a 5/5 datos y respondieron correctamente a las preguntas de comprensión 12/12. Los mismos elementos detectaron errores reales en otras partes del campo en esta escena, incluida la pregunta sobre el nombre de la carpeta, que es la discriminación para la cual el punto de referencia está diseñado.
C · Métodos estadísticos: estimadores, semillas y reverificación independiente
Estimators. Estaciones binarias (cobertura, entrega): valor de regresión logística mixta bayesiana ~ sistema + (1|escena) + (1|elemento), TapVid como referencia. Estaciones graduadas (texto, dimensiones): OLS robusto para grupos de escenas con efectos fijos del anotador. Entrega adicionalmente a través de la obtención de información de dejar uno fuera. Tres estimadores independientes (tasas brutas, ganancia de información, logit mixto) producen el ordenamiento idéntico del sistema en ambos marcos.
Uncertainty. IC del 95% desde el arranque a nivel de escena (volver a muestrear las 25 escenas, B = 3000, semilla fija); significancia = el intervalo del 95% excluye el cero; los resultados se informan como niveles donde los intervalos se superponen, nunca como rangos de falsa precisión. VBench: Skillings-Mack omnibus por dimensión (diferencias de método significativas en p = 8e-18 a 1e-9 en 23 bloques de escena completos), rango con signo de Wilcoxon por pares post-hoc con corrección de Holm. Alineación Human↔VBench: correlación de rango Spearman, prueba de estrés mediante arranque 2000×, dejar un sistema fuera y pruebas de permutación (todas preseleccionadas).
Reproducibilidad: reverificada de forma independiente. Toda la aleatoriedad del análisis está sembrada, los datos sin procesar (la exportación de anotaciones completa y las puntuaciones de VBench por escena) se envían con el análisis, y cada métrica tiene su propio script de reproducción de un solo comando bajo dependencias fijadas (Python 3.14.5 · numpy 2.5.1 · pandas 3.0.3 · scipy 1.18.0 · statsmodels 0.14.6 · matplotlib 3.11.0 · openpyxl 3.1.5). Una repetición independiente en un entorno nuevo regeneró los 55 artefactos de resultados comprometidos: cada byte de salida determinista idéntico, las 15 figuras idénticas en píxeles y las columnas de modelo mixto variacional que coinciden con probabilidades logarítmicas ≤6e-06, sin que el veredicto de importancia de cambie en ninguna parte.
D · Fiabilidad, método y limitaciones
Robustez del evaluador por diseño. El panel está completamente cruzado (cada anotador calificó cada sistema), por lo que el rigor del evaluador no puede sesgar una comparación entre sistemas. Agregar un efecto aleatorio del anotador mueve los contrastes en como máximo 0,16 (entrega) / 0,31 (cobertura) log-odds sin cambios significativos.
Acuerdo entre evaluadores por métrica. Entrega: 73,6% de acuerdo bruto, Gwet AC1 0,59. Cobertura: 67,2%, AC1 0,42: el efecto anotador es la fuente de molestia dominante (de 0,98), por lo que el nivel de cobertura absoluta es sensible al evaluador aunque la comparación no lo sea. Texto: dentro de un grado 91%, ponderado κ 0,27: la calificación más ruidosa. Dimensiones de WorldBench: dentro de uno 79–85%, ponderado κ 0,24–0,35. Preferencia estética: ponderada κ 0,07: las tasas de ganancia agregadas en 296 comparaciones son significativas; los juicios individuales no lo son, lo que también atenúa las correlaciones de ortogonalidad hacia cero.
Limitations. La entrega es relativa a este campo de siete sistemas y no es comparable entre ejecuciones de referencia con un campo diferente. La comprensión se administra a libro abierto; el techo medio de 0,86 comprime las diferencias entre sistemas, y una ejecución a libro cerrado es el mayor apalancamiento. 25 escenas (5 por caso de uso) con 2 evaluadores por resolución de caso de uso vinculada por video; los niveles superiores no están completamente separados. La cobertura acredita un hecho sólo cuando es literal y legible. Los intervalos logit mixtos son variacionales (anticonservadores); los grandes contrastes significativos son seguros. La topología en estrella de la arena no admite una clasificación de competidor contra competidor ni una puntuación estética absoluta. Las puntuaciones T son conveniencias relativas al campo, no calificaciones absolutas. Se define una estación de ancho de banda de datos por segundo, pero no se calculó en esta ronda.
E · VBench ↔ alineación humana — método
Instruments. VBench La calidad del marco es la media de las dimensiones de calidad estética y calidad de imagen del modelo, calculadas calidad-cuando-funciona (se excluye una generación fallida, no se califica con 0). La preferencia humana es la tasa de victorias lado a lado sobre TapVid. La correlación se refiere a los seis sistemas de la competencia , ; TapVid es el ancla de topología en estrella de cada comparación y, por lo tanto, no es un punto trazado.
| Alineación (Calidad del marco VBench ↔ preferencia humana) | Spearman ρ |
|---|---|
| En general | +0.89 |
| Dejar un sistema fuera (peor de los casos) | +0.87 |
| Profesional | +0.94 |
| Noticias | +0.77 |
| Comercialización | +0.70 |
| Cómo hacerlo | +0.48 |
| Explicador | −0.33 |
El signo general sobrevive a un remuestreo de arranque de 2000× y a dejar un sistema fuera; n = 6 sistemas con límites de importancia formal. El explicativo es el único segmento en el que los espectadores premian el movimiento antes que el pulido del encuadre, por lo que la métrica de calidad del encuadre rastrea una señal diferente allí. Cada compuesto de VBench se volvió a calcular a partir de las puntuaciones sin procesar por escena y coincide con el informe fuente al decimal.
Procedencia de ejecución de R y recuento >3,7 millones. VBench-Long (vbench2_beta_long en la confirmación e946a8d; VBench++, IEEE TPAMI 2025) se ejecutó en las GPU NVIDIA L4 del 13 al 14 de julio de 2026, antes de que existiera cualquier comparación de etiquetas humanas. Las entradas se normalizaron por escena para que ningún sistema obtenga un artefacto de codificación: límite de 720p (nunca mejorado), una cuadrícula de cuadros uniforme de 24 fps, recodificación casi sin pérdidas. Seis dimensiones por vídeo; Cuatro de ellos puntúan *cada fotograma* (24 marchas por segundo cada uno), la suavidad del movimiento es de 11,5/s y el nivel dinámico de 7,5/s: 116 marchas por segundo de metraje. A lo largo de los 32.141 segundos del vídeo puntuado: 3,73 millones de evaluaciones de modelos a nivel de fotograma . Una nueva verificación de coherencia adicional en compilaciones con longitud recortada (no contadas anteriormente) verificó que la duración del video no confunde la comparación: deltas de recorte nativo todos < 0,0025.
F · Cuadro de mando compuesto — Calidad Informativa y los tres ejes
Puntuaciones T relativas al campo: 70 = la media de estos siete sistemas, cada 10 puntos = 1 DE. Calidad Informativa = media con igual peso de los ejes Fidelidad del Contenido y Calidad Visual. La preferencia estética se deriva del ámbito y se informa junto a los ejes informativos, nunca dentro de ellos: es inversa a ellos. Calidad general, (Contenido + Visual + Preferencia estética)/3, es el título del escenario denso en información nombrado.
Las 25 escenas
| Sistema | Calidad Informativa | IC del 95% | Contenido | visuales | Preferencia estética |
|---|---|---|---|---|---|
| Fable 5 | 85.4 | [78.3, 92.1] | 82.6 | 88.2 | 52.3 |
| TapVid | 78.2 | [69.3, 86.6] | 77.1 | 79.2 | 61.7 |
| Remotion | 72.3 | [61.5, 82.2] | 76.6 | 68.1 | 69.2 |
| Hyperframes | 71.8 | [59.3, 83.0] | 73.3 | 70.2 | 68.1 |
| Veo | 64.8 | [51.7, 77.0] | 66.0 | 63.6 | 74.6 |
| Seedance | 61.3 | [46.8, 75.1] | 60.3 | 62.2 | 83.1 |
| LTX | 56.3 | [41.8, 70.8] | 54.1 | 58.5 | 81.0 |
Escenas con mucha información (profesional, noticias, instructivos, explicativo)
| Sistema | Calidad Global (C+V+P)/3 | Contenido | visuales | Preferencia estética | Calidad Informativa |
|---|---|---|---|---|---|
| TapVid | 75.2 | 83.6 | 80.3 | 61.7 | 82.0 |
| Fable 5 | 75.0 | 82.8 | 88.1 | 54.2 | 85.5 |
| Seedance | 73.5 | 71.7 | 69.7 | 79.1 | 70.7 |
| LTX | 70.0 | 60.2 | 74.8 | 75.1 | 67.5 |
| Remotion | 69.7 | 77.5 | 65.9 | 65.7 | 71.7 |
| Hyperframes | 69.0 | 72.9 | 68.3 | 65.7 | 70.6 |
| Veo | 68.4 | 71.0 | 61.7 | 72.4 | 66.3 |
Los CI de arranque en las 25 escenas se superponen ampliamente: los niveles que admiten los datos son Fable 5 · TapVid · Remotion/Hyperframes · el trío de píxeles. La brecha de calidad general TapVid – Fable 5 (75,2 frente a 75,0) está dentro del ruido. La clasificación es sólida respecto del método (PCA frente a la media del eje), la ponderación de la confiabilidad y el lugar donde se agrupa la relevancia. La preferencia estética de TapVid está anclada en 0,5 por la topología en estrella de la arena; su variación por caso de uso reside en los competidores.
G · Cobertura fáctica: ambos marcos
Alas 25 escenas: proporción de datos requeridos en pantalla, textuales y legibles; IC de arranque del 95%; contraste logit mixto.
| Sistema | Cobertura | IC del 95% | Δ frente a TapVid | IC del 95% | Resultado |
|---|---|---|---|---|---|
| Fable 5 | 0.790 | [0.717, 0.860] | +0.094 | [−0.183, +0.370] | LAZO |
| TapVid | 0.773 | [0.699, 0.843] | — | ||
| Remotion | 0.759 | [0.668, 0.845] | −0.166 | [−0.417, +0.085] | LAZO |
| Hyperframes | 0.745 | [0.642, 0.842] | −0.199 | [−0.448, +0.050] | LAZO |
| Seedance | 0.611 | [0.506, 0.710] | −0.826 | [−1.052, −0.601] | GANAR |
| Veo | 0.596 | [0.494, 0.697] | −0.867 | [−1.091, −0.642] | GANAR |
| LTX | 0.541 | [0.433, 0.658] | −1.179 | [−1.400, −0.958] | GANAR |
Escenas densas en información
| Sistema | Cobertura | IC del 95% | Δ frente a TapVid | IC del 95% | Resultado |
|---|---|---|---|---|---|
| TapVid | 0.836 | [0.773, 0.890] | — | ||
| Fable 5 | 0.792 | [0.710, 0.863] | −0.291 | [−0.601, +0.020] | LAZO |
| Remotion | 0.765 | [0.669, 0.857] | −0.520 | [−0.801, −0.239] | GANAR |
| Hyperframes | 0.727 | [0.607, 0.835] | −0.681 | [−0.952, −0.409] | GANAR |
| Seedance | 0.677 | [0.578, 0.770] | −0.922 | [−1.182, −0.662] | GANAR |
| Veo | 0.601 | [0.497, 0.714] | −1.213 | [−1.464, −0.963] | GANAR |
| LTX | 0.545 | [0.418, 0.671] | −1.553 | [−1.798, −1.307] | GANAR |
Cobertura ↔ entrega: Pearson r = 0,70 en 173 vídeos; MCO combinado da P(comprendido | en pantalla) = 0,96 y un suelo fuera de pantalla de 0,36; un logit mixto concuerda (0,945 / 0,30). El nivel absoluto de cobertura depende del evaluador (ver D); la comparación entre sistemas no lo es.
H · Entrega de información TeachQuiz: ambos marcos
Alas 25 escenas: tasa de corrección de comprensión bruta, P(correcta) predicha de logit mixto en una escena/pregunta típica y contraste.
| Sistema | Tasa bruta | P prevista | Δ frente a TapVid | IC del 95% | Resultado |
|---|---|---|---|---|---|
| Fable 5 | 0.821 | 0.868 | +0.243 | [−0.091, +0.576] | LAZO |
| Remotion | 0.812 | 0.857 | +0.147 | [−0.167, +0.461] | LAZO |
| TapVid | 0.795 | 0.838 | — | ||
| Hyperframes | 0.789 | 0.834 | −0.028 | [−0.330, +0.274] | LAZO |
| Veo | 0.785 | 0.830 | −0.052 | [−0.353, +0.249] | LAZO |
| LTX | 0.715 | 0.756 | −0.509 | [−0.786, −0.233] | GANAR |
| Seedance | 0.691 | 0.730 | −0.647 | [−0.918, −0.377] | GANAR |
Escenas densas en información
| Sistema | Tasa bruta | Δ frente a TapVid | IC del 95% | Resultado |
|---|---|---|---|---|
| Fable 5 | 0.846 | +0.056 | [−0.342, +0.453] | LAZO |
| TapVid | 0.845 | — | ||
| Veo | 0.840 | +0.005 | [−0.368, +0.378] | LAZO |
| Remotion | 0.832 | −0.067 | [−0.433, +0.299] | LAZO |
| Hyperframes | 0.790 | −0.393 | [−0.731, −0.054] | GANAR |
| Seedance | 0.786 | −0.423 | [−0.759, −0.087] | GANAR |
| LTX | 0.752 | −0.650 | [−0.971, −0.329] | GANAR |
La entrega es relativa a este campo de siete sistemas (ganancia sin dejar uno/logit basado en el campo); La administración es a libro abierto, lo que comprime las diferencias hacia el techo medio de 0,86. Tres estimadores (bruto, ganancia D, logit mixto) coinciden en el orden en ambos marcos.
I · Precisión de texto T2VTextBench y dimensiones de T2VWorldBench
T2VTextBench Precisión del texto: calificación de cuatro niveles en [0,1]; contraste robusto en racimos frente a TapVid. * = IC del 95% excluye cero.
| Sistema | los 25 | IC del 95% | Información densa | IC del 95% | Δ todos-25 |
|---|---|---|---|---|---|
| Fable 5 | 0.783 | [0.714, 0.850] | 0.750 | [0.681, 0.825] | +0.062 |
| TapVid | 0.740 | [0.660, 0.820] | 0.769 | [0.675, 0.856] | — |
| Hyperframes | 0.700 | [0.615, 0.785] | 0.706 | [0.613, 0.794] | −0.009 |
| Remotion | 0.695 | [0.610, 0.785] | 0.688 | [0.594, 0.781] | −0.050 |
| Seedance | 0.640 | [0.535, 0.740] | 0.700 | [0.594, 0.806] | −0.087 |
| Veo | 0.630 | [0.530, 0.730] | 0.650 | [0.531, 0.762] | −0.090 |
| LTX | 0.580 | [0.500, 0.660] | 0.619 | [0.537, 0.694] | −0.145* |
T2VWorldBench, las 25 escenas: calificación media por dimensión y composición del papel. * = significativo frente a TapVid (OLS robusto para clústeres).
| Sistema | Calidad | Realismo | Relevancia | consistencia | compuesto |
|---|---|---|---|---|---|
| Fable 5 | 0.900* | 0.909 | 0.891 | 0.909 | 0.902* |
| TapVid | 0.860 | 0.880 | 0.844 | 0.872 | 0.864 |
| Remotion | 0.800 | 0.860 | 0.860 | 0.824 | 0.836 |
| Hyperframes | 0.812 | 0.852 | 0.816 | 0.844 | 0.831 |
| Veo | 0.800 | 0.804 | 0.808 | 0.824 | 0.809 |
| Seedance | 0.808 | 0.808 | 0.772* | 0.796* | 0.796* |
| LTX | 0.792 | 0.784* | 0.688* | 0.792* | 0.764* |
El compuesto es internamente válido (α de Cronbach = 0,91) pero dobla un eje orientado al contenido: la relevancia se correlaciona con Entrega/Cobertura (+0,77) más que con sus dimensiones visuales hermanas (0,61–0,66). Cuadro denso en información: TapVid permanece segundo en todas las dimensiones; sólo las brechas de calidad y compuesto con respecto a Fable 5 siguen siendo significativas.
J · Preferencia estética (estilo arena): ambos fotogramas, ambas lecturas
Topología en estrella: cada comparación es TapVid frente a un competidor en el mismo informe (296 comparaciones). La tasa de victorias cuenta los empates como la mitad; empates sin pérdidas para TapVid; ambos están reportados. Veredictos de logits mixtos binomiales frente a la línea de no preferencia de 0,5.
Las 25 escenas
| vs | tasa de ganancia | IC del 95% | Sin pérdidas | IC del 95% | Veredicto |
|---|---|---|---|---|---|
| Fable 5 | 0.587 | [0.482, 0.683] | 0.696 | [0.577, 0.808] | TapVid-no-pierde* |
| Hyperframes | 0.440 | [0.347, 0.531] | 0.560 | [0.458, 0.667] | tirar hacia arriba |
| Remotion | 0.430 | [0.338, 0.519] | 0.540 | [0.433, 0.643] | tirar hacia arriba |
| Veo | 0.380 | [0.297, 0.464] | 0.480 | [0.389, 0.571] | tirar hacia arriba |
| LTX | 0.320 | [0.217, 0.417] | 0.380 | [0.267, 0.500] | TapVid pierde* |
| Seedance | 0.300 | [0.206, 0.393] | 0.400 | [0.286, 0.500] | TapVid pierde* |
| En general | 0.407 | [0.35, 0.47] | 0.507 | [0.44, 0.57] | menos preferido que el campo* |
Escenas con mucha información: tasa de ganancias general 0,432 [0,37, 0,50], sin pérdidas 0,530: paridad. Los importantes déficits sin pérdidas desaparecen; En comparaciones estrictas y decisivas, sólo el Seedance sigue siendo significativamente preferido.
| vs | tasa de ganancia | IC del 95% | Sin pérdidas | IC del 95% |
|---|---|---|---|---|
| Fable 5 | 0.569 | [0.450, 0.692] | 0.667 | [0.542, 0.800] |
| Remotion | 0.463 | [0.354, 0.568] | 0.575 | [0.458, 0.692] |
| Hyperframes | 0.463 | [0.361, 0.563] | 0.600 | [0.500, 0.714] |
| Veo | 0.400 | [0.304, 0.500] | 0.500 | [0.385, 0.607] |
| LTX | 0.375 | [0.250, 0.500] | 0.425 | [0.292, 0.545] |
| Seedance | 0.338 | [0.225, 0.450] | 0.425 | [0.286, 0.567] |
La preferencia es empíricamente ortogonal a las métricas informativas: correlacionar la ventaja por video de TapVid en cada métrica con el resultado de la arena da −0,22 a −0,01 (n = 148 celdas), todas negativas o cercanas a cero. La ausencia de pérdidas es la lectura favorable (el 20% de las comparaciones son empates); ambos se muestran por ese motivo.
K · Clasificación por caso de uso: donde TapVid gana y pierde
Ganancias/pérdidas significativas frente a TapVid por caso de uso (el intervalo del 95% excluye cero). Las células enumeran a los competidores; “—” = ninguno.
| Caso de uso | Cobertura: Latidos TapVid | pierde contra | Entrega: TapVid late | pierde contra |
|---|---|---|---|---|
| Profesional | Fable 5, Hyperframes, Veo, LTX | — | Fable 5, LTX | Seedance |
| Noticias | Remotion, Veo, LTX, Seedance | — | Remotion, LTX, Seedance | — |
| Cómo hacerlo | Remotion, Hyperframes, Veo, LTX | — | Veo | — |
| Explicador | LTX, Seedance | Fable 5 | Seedance | Fable 5 |
| Comercialización | Seedance | Fable 5, Remotion, Hyperframes | Seedance | Fable 5, Remotion, Hyperframes |
Ningún sistema gana en todas partes: Seedance lidera la entrega profesional pero colapsa en marketing (P 0,30); Veo lidera la entrega de noticias, pero es el peor en el campo en procedimientos. Tasa de victorias en arena de TapVid por caso de uso: Profesional 0,450, Noticias 0,433, Explicador 0,429, Procedimientos 0,417, Marketing 0,308. Calidad informativa compuesta de TapVid por caso de uso: Noticias 87, Procedimientos 89, Explicador 81, Profesional 71, Marketing 63.
10
Pruebe TapVid
Convierta los recursos suministrados y la copia aprobada en un flujo de trabajo de video explicativo revisable. Explorar TapVid.
11
Referencias y citas
Los métodos de evaluación compatibles incluyen T2VTextBench, T2VWorldBench y el Protocolo de evaluación humana de texto a video.
Recommended citation (APA): Law, D. (2026, September 6). AI video benchmark: Accuracy vs aesthetics (Version 1.0). TapVid Research. https://tapvid.ai/blog/information-dense-ai-video-benchmark
@techreport{law2026aiVideoBenchmark,
author = {Derek Law},
title = {AI Video Benchmark: Accuracy vs Aesthetics},
institution = {TapVid Research},
year = {2026},
month = {September},
url = {https://tapvid.ai/blog/information-dense-ai-video-benchmark},
note = {Version 1.0; July 2026 benchmark run}
}12
Sobre el autor

Derek Law es CTO y cofundador de TapVid. Su trabajo se guía por una tesis simple: la limitación de la IA es la interfaz, no la inteligencia. Anteriormente, trabajó en Alexa AI y GenUI para Amazon AGI.



