TL;DR
在信息密集的视频上,TapVid 处于领先地位。
此 AI 视频基准测试是为必须 inform(指导性、编辑性、解释性)而不是娱乐性的视频而构建的。在其针对的信息密集场景中,TapVid 在事实覆盖率方面完全领先,在 TeachQuiz 信息交付方面并列第一,并且在七个系统中的总体质量名列前茅。独立的行业标准自动化指标 VBench 再现了人类小组的偏好,证实了评估的严谨性。
01
AI 视频基准测试结论:首先关注重要内容——其他方面保持平衡
信息密集的场景——专业、新闻、操作指南、教育——是基准测试的目标领域,也是 TapVid 获胜的地方。在所有 25 个场景中,TapVid 的信息质量在 7 个场景中排名第二, 是唯一在两个信息轴上都强大的代码渲染器 。
总体质量 — 信息丰富 + 美观 75.2 T 在信息密集型工作中排名第 1(共 7 个) — 唯一同时在每个轴上都很高的系统。
审美偏好 vs Fable 5,信息领先者 58.7% 在并排观看中优于该领域的顶级信息系统 - 并且明显不输。
事实覆盖 - 信息密集的场景 83.6% 彻底的领域领先。在屏幕上显示所需事实方面明显领先于 6 名竞争对手中的 5 名。
TeachQuiz 信息传递——信息密集场景 84.5% 并列第一。观众在 TapVid 后回答理解问题的效果与在该领域的任何系统后一样好。
整体品质——信息丰富+美观·信息密集的场景
*(内容保真度 + 视觉质量 + 审美偏好)/ 3 · 场相对 T 分数(70 = 场平均值,10 = 1 SD)*

这两个框架随处可见。 标题声称使用信息密集框架 (UC1–UC4) 作为基准目标 - 如图所示,其中 TapVid 总体质量名列前茅;在所有 25 个场景中,TapVid 的信息质量在 7 个场景中排名第 2(T 78 vs Fable 5 85)。带有置信区间的完整记分卡位于附录中。
基准
02
专为必须提供信息而非娱乐的视频而打造
五个用例中的每一个都借鉴了 现实世界的源材料 ,并在五个意图驱动的场景中进行评估:简介指定了观众应该离开的事实,人类注释者衡量他们是否这样做。目标是信息密度高、意图明确的视频——指导性、社论性、解释性——而不是审美或娱乐内容。
该领域——七个系统,两个范式
| 系统 | 线束/模型 | 家庭 |
|---|---|---|
| TapVid | 代码渲染视频 | 代码渲染 |
| Fable 5 | Claude Code · Fable 5 | 代码渲染 |
| 代码渲染 H | Claude Code · Sonnet 5 | 代码渲染 |
| 代码渲染 R | Codex · GPT-5.5 | 代码渲染 |
| 像素扩散L | 官方工作室·专业模式,1080p | 像素扩散 |
| Seedance | Seedance 2.0 · Jimeng · VIP模式,720p | 像素扩散 |
| Veo | Veo 3.1 · Google Flow · 质量模式,720p | 像素扩散 |
所有系统均于 7 月 6 日至 12 访问 2026:本地运行的工具于 7 月 6 日冻结在最新版本,在其官方平台上以最新旗舰型号托管系统 - 每个系统均采用最高质量设置 16:9。确切的版本引脚及其来源请参见附录 A。
五个用例,真实世界的源材料
| 使用案例 | 素材来源 |
|---|---|
| 专业企业/自学 | GDPval 任务 — 专业和技术服务、政府、制造、金融 |
| 新闻社论 | 2025-26 期封面:《经济学人》、《金融时报》、《彭博社》、《自然》、《科学》 |
| 生活方式指南 | 热门 #HowTo YouTube — 工艺/DIY、艺术、健身、心态、谜题 |
| 讲解员教育 | 观看次数最多的“AP 考试解释”——历史、心理学、微积分、生物学、地理 |
| 营销产品/销售 | 纳斯达克最具价值公司跨行业发布视频 |
生成前固定的采样规则。 每个用例都按照预定义的规则绘制五个场景 - 对源池进行聚类,每个聚类随机采样一个(顶级行业、出版物、内容类别、AP 主题、纳斯达克板块)。每个简报都是一个完整详细的视频生成提示,携带完整的信息有效负载,在任何系统生成任何内容之前编写和 冻结;其所需事实清单(基准中的 168 个事实)和理解问题(149 个)是同时编写并经过人工审核的。完整的示例位于附录 B 中。
球场是如何进行的——一次射击,同样的简短,顶级设置
- 相同的输入: 每个系统都收到相同的简短逐字记录 - 每个系统零提示工程。
- Best-of-1: 每个场景一代,从未策划;重试硬故障直至成功(最多观察 3 次重试)。
- 生成的持续时间:简报设定的目标长度;每个系统的实际输出按原样使用(系统平均值 1.1–4.2 分钟)。
- 173/175会计: Fable 5的安全规则拒绝了25份简报中的2份。我们没有替代 Opus 的后备方案,而是仅在其 23 代上对 Fable 5 进行评分——没有竞争对手被悄悄削弱,缺失的单元格从分母中删除,从未进行估算。
注释器面板——独立、盲目、完全交叉
- 12名独立标注者,不隶属于任何系统团队的外包自由职业者——均拥有QS世界排名前50名大学的硕士学位或以上学位,并具有经过认证的英语能力。
- 盲通:视频以随机顺序呈现,未标记;注释者从未被告知哪个系统生成了视频。
- 完全交叉: 所有 12 个注释者对所有 7 个系统进行了评分,每个视频有两个评分者 - 严格或宽松的评分者会平等地移动每个系统,并且不会使比较产生偏差。
- 刻意观看,非点击式工作: 每个5分钟以下的视频注释约20分钟,按当地最低工资的4倍支付。注释于 2026 年 7 月 13 日至 15 日。
以已发布的方法为基础、由人测量的指标
每个视频均由 全交叉注释器面板 进行评分 - 每个注释器都对每个系统进行评分,因此严格或宽松的评分者会平等地移动所有系统,并且不会使比较产生偏差。该小组根据已发布的方法在五个站点生成了 6,760 个人工注释 (其中三个在 ICML、WACV 和 IEEE TPAMI / CVPR 进行了同行评审),并且每个视频*也*由 VBench 自动化模型评分: >370万帧级模型评测 。
- TeachQuiz 信息传递 (Code2Video、ICML 2026 · arXiv:2510.01174) — 观看者实际获取了多少预期信息。
- 事实报道 - 简报所需的事实,有多少出现在屏幕上,逐字且清晰。
- T2VTextBench 文本准确性 (arXiv:2505.04946) — 屏幕标题、数字和标签的正确性。
- T2VWorldBench ( WACV 2026 · arXiv:2507.18107) — 四个质量维度:视频质量、真实性、相关性、一致性。
- 审美偏好——竞技场风格,与TapVid并排比较。
- VBench(VBench++、IEEE TPAMI 2025 · 原始 VBench、CVPR 2024 亮点 · 公共 HuggingFace 排行榜背后的模型) — 行业标准自动化视频质量套件, >370万帧级模型评测 。
VBench 是 的一个独立的、基于机器的对人类注释的交叉检查 :它的帧质量评估再现了我们人类的偏好排名,因此这两个仪器相互印证(发现 05)。
排名对于您如何计算它们来说是稳健的:三个独立的估计器——原始率、留一信息增益和混合效应逻辑模型——产生相同的排序,可靠性加权和PCA变体保持不变。由于营销表现为与四个信息密集用例不同的任务系列,因此 每个结果都在两个框架中报告::所有 25 个场景,以及信息密集框架(专业、新闻、操作方法、解释器)。两者的完整表格都在附录中。
发现01·全视场框架
03
信息视频是一个权衡前沿——TapVid 占据了平衡点
WIN 该领域是一个权衡前沿:在信息质量上,顺序是 Fable 5 > TapVid > 其他人;在审美偏好上,顺序完全相反。 TapVid 是唯一在两个信息轴上都很高的代码渲染器 - 内容保真度 77,视觉质量 79,每个轴上都是 7 中的第二个 - 前沿的平衡点。
审美偏好是通过竞技场风格进行测量的——并排放置两个相同简介的视频——并捕捉到了信息性标题所没有的东西:它与每个信息性指标的相关性都是负到零(-0.22 到 -0.01)。代码渲染器购买信息质量;像素扩散带来了审美吸引力。下面的边界将两个框架中的所有七个系统都置于这种权衡之上。
信息美学前沿
*x:信息质量 · y:审美偏好 · 场相关 T 分数(70 = 场平均值) · 信息密集场景*

TapVid 是绿色象限中唯一的系统——信息丰富且美观——在两个框架中。 边界正在走下坡路:信息质量排序 Fable 5 > TapVid > 其余,而审美偏好将其端到端颠倒。在信息密集的场景中,TapVid 移动到前沿的肘部(信息质量 82,领先者的 3.5 T 范围内),而像素扩散美学边缘缩小到奇偶校验;在所有 25 个场景中,Seedance 和像素扩散 L 都位于所示的偏好范围之上。审美偏好与信息质量一起报告,但从未对其进行平均。
TAPVID 的美学胜率 — 并排观看,所有 25 个场景
*并排比较 TapVid 获胜的份额(平局占一半)·×100*

50 以上 = 观众更喜欢 TapVid。混合逻辑非损失/决定性胜利测试的意义;完整的CI和无损帧在附录中。
TAPVID 的美学胜率 — 并排观看、信息密集的场景
*并排比较 TapVid 获胜的份额(平局占一半)·×100*

在基准测试的目标领域,审美缺陷缩小到同等水平——在决定性比较中,只有 Seedance 仍然明显受到青睐。
WIN 与 Fable 5(该领域信息丰富的领导者)并排显示,观众更喜欢 TapVid。胜率58.7%,TapVid显着不输(P = 0.72)。在质量合成上击败 TapVid 的系统在观众面前输给了 TapVid。
WIN 在信息密集的作品中,TapVid在引领内容的同时,在审美上毫不妥协。总体无损率上升到 53.0%(奇偶校验),并且没有任何像素扩散系统具有显着的无损优势。与 Google 的 Veo 相比:在信息质量上领先(78 比 65),在覆盖范围上显着领先,并且偏好摇摆不定。
局限性 在所有 25 个场景中,审美偏好是一个真正的弱点。 TapVid 的整体胜率是 40.7%,明显低于 50% 的无偏好线,而且它的受欢迎程度明显低于 Pixel-diffusion L 和 Seedance(信息排名垫底)。倒置是范式权衡,集中在营销;收尾计划直接解决了这个问题。
发现 02 · 事实覆盖范围
04
在屏幕上显示事实是约束条件——TapVid 做得最好
获胜 在信息密集的场景中,TapVid 在屏幕上显示了 83.6% 的所需事实 — 绝对领先,明显领先于 6 个竞争对手中的 5 个。在所有 25 个场景中,它在统计上与领先者 Fable 5 并列,并且明显领先于每个像素扩散系统。
覆盖范围是基准测试最具辨别力的指标:该领域分为两个干净的层,四个代码渲染器(屏幕上的事实的 74-79%)远离三个像素扩散系统(54-61%)。
事实覆盖率——屏幕上所需事实的比例
*平均值 · 95% 场景引导 CI · 信息密集场景 · ×100*

信息密集帧:TapVid 83.6 [77.3–89.0] 领先 ;除 Fable 5 外,与每个系统的差距均具有统计显着性(混合对数 95% CI 排除 0)。 All-25 帧:Fable 5 79.0、TapVid 77.3(统计上并列),Seedance、Veo 和像素扩散 L 在这两个帧中都明显落后。
覆盖率推动交付 — 每个视频 1 分,173 个视频
*x:事实覆盖率·y:TeachQuiz 信息传递(正确率)·×100*

获胜 一旦事实出现在屏幕上,观众大约 95% 的时间都会了解它。 173 个视频的覆盖率和投放率在 r = 0.70 处相关,拟合线从 36% 的非事实下限到 96% 的屏幕上限。理解几乎是一个已解决的步骤——游戏是覆盖范围,而 TapVid 发挥得最好。
按用例划分的覆盖范围 — 模型预测的 P(屏幕上的事实)
*每个用例的混合对数预测概率·×100*

WIN TapVid 在五个用例中的四个中领先或并列覆盖率领先。它完全领先于新闻 (81.9) 和操作方法 (86.7),而在专业方面,它明显领先于四个竞争对手,包括总体领先者 Fable 5。
局限性 营销是个例外。 TapVid 的覆盖率下降到 53.8% — 位于代码渲染器的底部,位于 Fable 5、Code-render R 和 Code-render H 后面。每个指标的 Marketing 列都存在相同的差距;结束计划将其视为一个问题。
发现 03 · 教学测验信息传递
05
观众从 TapVid 中学到的知识与从该领域的任何系统中学到的知识一样多
在信息密集的场景中,TapVid 在 TeachQuiz 信息传递方面并列第一——观众正确回答了 84.5% 的理解问题——并且显着超过了三个系统(代码渲染 H、Seedance、像素扩散 L)。在所有 25 个场景中,前五名在统计上是密不可分的; TapVid 明显领先于 Pixel-diffusion L 和 Seedance。
交付遵循 TeachQuiz 协议:观看后,注释者回答有关摘要所需事实的多项选择问题,并且每个视频都会根据每个问题字段基线进行评分。三个独立的估计器——原始正确率、留一信息增益和混合效应逻辑——就排序达成一致。
教学测验信息传递——理解正确率
*原始正确率·显着性与混合效果 Logit 中的 TapVid·信息密集场景·×100*

TapVid 在这两个框架中都是顶级的。完整的每个用例的赢/平/输表位于附录中。
按用例交付 — 理解正确率
*每个用例的原始正确率 · 在用例场景中具有 95% 引导 CI 的条形 · ×100*

TapVid 在新闻 (88.3) 和操作指南 (89.7) 上名列前茅 - 根据混合逻辑推理,它在新闻上的代码渲染 R、像素扩散 L 和 Seedance 以及在操作方法上的 Veo 都显着优于 Veo,两者都不输。专业人士和讲解员属于中场;营销是结束计划 目标的差距。每个用例依赖于 5 个场景,因此 CI 很宽;重要性调用来自附录中的每个用例混合logit。
T2VTEXTBENCH 文本准确性 — 屏幕上的标题、数字和标签
*四层等级映射到 [0,1] · 95% bootstrap CI · 信息密集场景 · ×100*

WIN TapVid 在信息密集的场景中渲染屏幕文本效果最佳。在所有 25 个场景中,从统计数据来看,该领域的顶尖选手是不可分割的。
发现 04 · 视觉质量
06
在四个视觉维度中的三个维度上与领先者统计并列
获胜 在 T2VWorldBench 人类评估中,TapVid 在真实性、相关性和一致性方面在统计上与领先者 Fable 5 并列(在两个帧中),并且在四维合成中排名 7(86.4),明显领先于 Seedance 和像素扩散 L。无论 TapVid 渲染什么,它都渲染得很干净。
交叉注释器面板根据每个维度的评分标准对四个维度进行 1-5 级评级。与 Fable 5 的一个显着视觉差距是视频质量(86.0 vs 90.0);其他三个维度是统计联系。
T2VWORLDBENCH — 四个维度,全部 25 个场景
*平均等级 · 95% 场景引导 CI · ×100 · * = 与 TapVid 相比显着*

TapVid 在质量、真实性和一致性方面排名第二,在相关性方面排名第三(位于 Fable 5 和代码渲染 R 之后)。相关性——“它是否说了正确的事情”——表现为内容维度,并使用上面的内容指标进行分析。
获胜 如果评分者完全同意,TapVid 评分最高。在精确协议子集上,TapVid 的视频质量上升到 0.97,超过了 Fable 5——TapVid 的明显胜利是明确的。
发现05·独立佐证
07
通过 VBench 行业标准自动化指标验证的人工注释
检查 在相同的 25 个场景中盲目运行,VBench(公共 HuggingFace 排行榜背后的自动化模型)独立于人类小组对每个视频进行评分。它对系统进行排序的方式与我们注释者的并排偏好相同。 Spearman VBench 框架质量与人类偏好之间 ρ = +0.89; +0.87 排除任何一个系统。人类偏好轴并不是我们的评估者的产物——一个独立的、纸质的机器指标也遵循同样的顺序。
一个广泛使用的自动化模型,在不了解人类标签的情况下进行计算,与人类小组对系统排名的看法一致——这证明评估捕捉到了真实的、可再现的信号,而不是评估者的特质。
自动化和人类仪器一致——显示的每个视频
*x:VBench 每个视频的帧质量(自动) · y:每个系统的人类获胜率 · 141 个系统×场景视频,按系统着色 · ×100*

E每个小点是一个视频的自动帧质量,由系统着色并按该系统的人类获胜率放置;大点是系统的意思。 彩色云按胜率顺序堆叠,它们的中心从左到右爬升 - 自动帧质量和人类偏好将系统排列在一起( Spearman ρ = +0.89 )。系统未命名:重点是两个仪器的一致,而不是任何一个系统的立场。
SRC VBench(VBench++、IEEE TPAMI 2025·原始 VBench、CVPR 2024 亮点)是公共 HuggingFace 排行榜背后的标准自动视频质量基准,对每个剪辑进行六个维度的评分。它于 7 月 13 日至 14 日在专用 GPU 上使用官方 VBench-Long 代码路径(提交 e946a8d)运行——在与人类标签进行任何比较之前完成。帧质量头(美学+成像质量)是这里使用的美学交叉检查,计算工作时的质量,因此失败的一代不会扭曲系统的分数。每个合成都是根据每个场景的原始分数重新计算的,并将源报告与小数点相匹配;完整的运行方案见附录 A。
下一场胜利结束
08
两个目标:营销内容和审美吸引力,无需信息交易
这两个差距都是经过衡量的、局部的,并且与已经有效的东西是分开的。两者都不需要触及赢得信息密集领域的覆盖和交付引擎。
按使用案例划分的 TAPVID — 营销差距在于内容,而不是渲染
*内容保真度与视觉质量综合·相对于现场的 T 分数·每个用例*

在营销方面,TapVid 的视觉质量保持在 75,而内容保真度则下降到 51 - 视频渲染干净,但错过了所需的事实。在其他地方,两个轴以 68-93 的比例一起移动。
审美计划——提升审美轴,保持信息领先
*x:信息质量·y:审美偏好·T 分数·所有 25 个场景*

因为偏好与每一个质量指标都是正交的,所以这一举措是 直接上升的 ——提高运动、润色和吸引力将 TapVid 移向前沿的空白右上角,而无需花费任何信息领先。
下一个胜利结束 #1 — 营销内容。崩溃是营销场景中的事实传递,而不是渲染——覆盖引擎的有针对性的扩展,已经导致了四个用例,而不是重建。关闭它会将 TapVid 的信息密集覆盖领先优势转变为全领域领先优势:不包括营销,TapVid 已经在覆盖范围的六个系统中名列前茅。
NEXT 获胜结束 #2 — 审美偏好与像素扩散,但不放弃信息领先。从经验上看,偏好与每一个质量指标都是正交的,因此关闭它是它自己的程序——动议、润色、吸引力——而不是被迫反对覆盖或交付的交易。信息密集的框架显示了天花板:在内容密集的地方,TapVid 已经达到偏好平价,同时保持内容领先。
附录
09
冻结协议、种子统计、每个结果都是完整的
系统版本与来源固定;采样规则和事实清单在任何视频出现之前就已确定;注释器面板是盲的并且完全交叉(A-B)。三个独立的估计者就每个顺序达成一致,所有随机性都被播种,并且独立的重新运行再现了每个工件(C-E)。在两个框架 (F–K) 中完成每个指标的排行榜以及每个指标的置信区间。除非另有说明,Δ 列是与 ZXQ4QXZ 的混合对数对数赔率对比; WIN / LOSS = 从 TapVid 的角度来看,95% 区间不包括零; TIE = 没有。
KEY 系统命名。本报告正文通过匿名标签引用了三个系统。他们的真实身份仅在此说明:代码渲染 H = Hyperframes · 代码渲染 R = Remotion · 像素扩散 L = LTX。下表使用真实的产品名称。
A · 实验协议——版本、时间线、注释账本
时间线(2026)。摘要+事实清单在7月6日之前编写和冻结→系统7月6日冻结→所有代7月6-12日→VBench-Long评分7月13-14日→人工注释7月13-15日(第一次回复7月13日09:41,最后7月15日04:33)→统计和人类↔VBench 比对,7 月 14 日至 16 日。 VBench 评分在任何人类标签比较存在之前完成。
版本 pin — 截至 7 月 6 日冻结的最新版本的本地运行工具;窗口期间的最新旗舰机型托管平台。每个平台均提供所有 16:9、最高质量设置、故事板/规划功能。
| 系统 | 版本·平台·设置 | 来源 |
|---|---|---|
| TapVid | 访问窗口的内部构建当前 | — |
| Fable 5 | Claude Code 2.1.202 · 模型 claude-fable-5 (6 月 9 日宣布,7 月 1 日重新部署) · 默认 | 公告 · 变更日志 |
| Hyperframes | v0.7.37 · Claude Code · Sonnet 5(6 月 30 日发布) · 默认 | 发布 · Sonnet 5 |
| Remotion | v4.0.485 · Codex CLI 0.142.5 · GPT-5.5(4 月 23 日发布;GPT-5.6 冻结后于 7 月 9 日发布) · 默认 | 发布 · Codex · GPT-5.5 |
| Veo | Veo 3.1(2025年10月15日发布) · Google Flow,Flow 的故事板规划 · 质量模式,720p | 公告 · 模式文档 |
| LTX | LTX-2.3(2026 年 3 月发布) · LTX Studio,LTX Studio 使用 GPT-Image-2 进行故事板规划 · Pro 模式,1080p | 发布 · GPT-Image-2 |
| Seedance | Seedance 2.0(2月12日公布)·Jimeng——字节跳动官方消费平台——代理模式,故事电影技巧·VIP模式(顶级画质),720p | 公告 · Jimeng |
提示出处。 所有 25 份摘要及其事实清单均由 Claude Opus 在 Claude Code 上编写,经过人工审核,并在生成开始之前冻结。如果人工智能作者的简介偏向于任何系统的习惯用法,那么受益者将是 Fable 5(竞争对手),而不是 TapVid。
6,760 个注释分类账。 每个注释者 × 场景 × 系统 × 项目一行:事实检查 2,326(168 个事实)+ TeachQuiz 理解 2,062(149 个问题)+ T2VWorldBench 四维 1,384(346 个视频×评分者单位 × 4)+ 文本准确性692(346 单位 × 等级 + 垃圾标志)+ 并排偏好 296 = 6,760 。每个计数都可以根据原始导出重新计算。
VBench 运行。 官方 VBench-Long 代码( vbench2_beta_long ,提交 e946a8d )在 5× NVIDIA L4 上,每个用例一个分片,约 6 小时墙;在新实例上从头开始固定和复制环境;保留每个单元结果 JSON 和运行日志。输入归一化和 >3.7M 评估算法:附录 E 。
B· 工作示例——整个流程的简要说明
简报(操作方法场景 1):*“弹出的纸 — 无胶折纸坐立不安玩具”*,目标 5:00、16:9。与每个简报一样,它是一个完全指定的制作文档,对于所有七个系统都是相同的:具有精确的十六进制调色板的艺术指导、灯光和摄像机语言、具有完整画外音文本和每个场景的动作注释的九个场景镜头列表,以及一个主提示 - 例如*“……三张颜色编码的纸(靛蓝 6×6 外盒、琥珀色 5×5 内按钮、紫罗兰色 9×4 弹簧)、构建两个盒子的共享布林茨折叠……翻盖塞在相邻边缘下方的无胶锁……”* 完整的信息有效负载位于简报中,因此覆盖失败可归因于系统,而不是提示。
其必需的事实清单(用简短的方式编写,在生成之前冻结;站点项目以英文呈现)。只有当事实逐字清晰地出现在屏幕上时,它才会被记入——注释者可以逐帧重播:
- 外箱纸:6×6厘米
- 内扣纸:5×5厘米
- 弹簧纸:9×4厘米
- 无胶承诺:无胶水,无胶带,任何地方
- 关键折叠,名称:blintz折叠(角到中心)
A TeachQuiz 理解项(观看后回答;“视频没有提供这个”逃逸得分不正确):*“两个盒子共享的关键折叠是什么?”* — 谷折/blintz 折叠(角到中心)/挤压折叠/视频没有提供此信息。
如何得分。 在这个场景中,TapVid 的两位评分者都将 5/5 事实记入 并正确回答了 12/12 理解问题 。在这个场景中,相同的项目在该领域的其他地方遇到了真正的失误——包括折叠名称问题——这是基准旨在衡量的歧视。
C·统计方法——估计器、种子和独立重新验证
Estimators. 二元站(覆盖、交付):贝叶斯混合逻辑回归值 ~ system + (1|scene) + (1|item) , TapVid 作为参考。分级站(文本、尺寸):具有注释器固定效果的场景集群鲁棒性 OLS。另外还通过留一法信息增益进行传递。 三个独立的估计器——原始速率、信息增益、混合逻辑——在两个帧中产生相同的系统排序。
Uncertainty. 来自场景级引导程序的 95% CI(对 25 个场景重新采样,B = 3000,固定种子);显着性 = 95% 区间排除零;结果报告为间隔重叠的层,绝不是错误的精度排名。 VBench:每个维度的 Skillings-Mack 综合(在 23 个完整场景块中,方法差异在 p = 8e-18 到 1e-9 处显着),事后成对 Wilcoxon 符号秩与 Holm 校正。 Human↔VBench 对齐:Spearman 等级相关,通过 2000× bootstrap、留一系统排除和排列测试(全部为种子)进行压力测试。
可重复性 - 独立重新验证。 所有分析随机性均已播种,原始数据(完整注释导出和每个场景 VBench 分数)随分析一起提供,每个指标在固定依赖项下都有自己的单命令重现脚本(Python 3.14.5 · numpy 2.5.1 · pandas 3.0.3 · scipy 1.18.0 · statsmodels 0.14.6 · matplotlib 3.11.0 · openpyxl 3.1.5)。在新的环境中独立重新运行重新生成了所有 55 个提交的结果工件:每个确定性输出字节相同,所有 15 个数字像素相同,并且变分混合模型列匹配 ≤6e-06 对数赔率 - 任何地方都没有显着性判决改变 。
D·可靠性、方法和局限性
评估者设计的稳健性。 该小组是完全交叉的——每个注释者对每个系统进行评分——因此评估者的严格性不会影响系统间的比较。添加注释器随机效果移动对比最多 0.16(交付)/0.31(覆盖)对数赔率,无显着性翻转。
每个指标的评估者间协议。 交付:73.6% 原始协议,Gwet AC1 0.59。覆盖率:67.2%,AC1 0.42 — 注释器效应是主要的干扰源 (sd 0.98),因此绝对覆盖率水平对评分者敏感,尽管比较并非如此。文本:一级内 91%,加权 κ 0.27 — 最嘈杂的评级。 WorldBench 维度:1 内 79–85%,加权 κ 0.24–0.35。审美偏好:加权 κ 0.07 — 296 次比较的总胜率是有意义的;个人判断并非如此,这也将正交相关性减弱至零。
Limitations. 交付与此七系统字段相关,并且在不同字段的基准运行之间不具有可比性。理解是开卷进行的; 0.86的中位数上限压缩了系统差异,闭盘运行是最高杠杆锐化。 25 个场景(每个用例 5 个),每个视频有 2 个评估者,绑定每个用例的分辨率 — 顶层并未完全分离。报道仅在逐字且清晰的情况下才承认事实。混合对数区间是变分的(反保守的);大的显着对比是安全的。竞技场的星形拓扑不支持竞争对手与竞争对手之间的排名,也不支持绝对的审美评分。 T 分数是相对于现场的便利性,而不是绝对等级。每秒事实带宽站已定义,但在本轮中未计算。
E·VBench ↔ 人类对齐 — 方法
Instruments. VBench 框架质量是模型的美学质量和成像质量维度的平均值,计算得出 quality-when-it-works(失败的一代被排除,不得分为 0)。人类偏好是与 ZXQ6QXZ 的并列胜率。相关性超过了 六个竞争对手系统 — TapVid 是每次比较的星形拓扑锚点,因此不是标绘点。
| 对齐(VBench 框架质量 ↔ 人类偏好) | Spearmanρ |
|---|---|
| 整体 | +0.89 |
| 留一系统(最坏情况) | +0.87 |
| 专业 | +0.94 |
| 新闻动态 | +0.77 |
| 营销 | +0.70 |
| 操作方法 | +0.48 |
| 解说员 | −0.33 |
整体标志经受住了 2000 倍引导重采样和留一系统; n = 6 个系统限制了形式意义。解释器是观众奖励动作而不是帧抛光的部分,因此帧质量指标在那里跟踪不同的线索。每个 VBench 复合材料都是根据每个场景的原始分数重新计算的,并将源报告与小数点匹配。
Run 出处和 >3.7M 计数。 VBench-Long(vbench2_beta_long,提交 e946a8d ;VBench++,IEEE TPAMI 2025)于 2026 年 7 月 13 日至 14 日在 NVIDIA L4 GPU 上运行 - 在任何人类标签比较存在之前。输入按场景标准化,因此系统不会获得编码伪像:720p 上限(从未升级)、统一的 24 fps 帧网格、近乎无损的重新编码。每个视频有六个维度;其中四个得分*每帧*(每帧 24 个模型前进/秒),运动平滑度为 11.5/秒,动态度为 7.5/秒 - 镜头每秒 116 个模型前进。横跨32,141秒的评分视频:373万帧级模型评估。对长度修剪版本(上面未计算)的进一步一致性重新检查验证了视频长度不会混淆比较:原生修剪增量均 < 0.0025。
F·综合记分卡——信息质量和三个轴
场相关 T 分数: 70 = 这七个系统的平均值,每 10 分 = 1 SD。信息质量 = 内容保真度和视觉质量轴的等权平均值。审美偏好是源自领域的,并在信息轴旁边报告,而不是在它们内部——它与它们相反。总体质量(内容+视觉+审美偏好)/3,是指定的信息密集场景标题。
全部25个场景
| 系统 | 信息质量 | 95%置信区间 | 内容 | 视觉 | 审美偏好 |
|---|---|---|---|---|---|
| Fable 5 | 85.4 | [78.3, 92.1] | 82.6 | 88.2 | 52.3 |
| TapVid | 78.2 | [69.3, 86.6] | 77.1 | 79.2 | 61.7 |
| Remotion | 72.3 | [61.5, 82.2] | 76.6 | 68.1 | 69.2 |
| Hyperframes | 71.8 | [59.3, 83.0] | 73.3 | 70.2 | 68.1 |
| Veo | 64.8 | [51.7, 77.0] | 66.0 | 63.6 | 74.6 |
| Seedance | 61.3 | [46.8, 75.1] | 60.3 | 62.2 | 83.1 |
| LTX | 56.3 | [41.8, 70.8] | 54.1 | 58.5 | 81.0 |
信息密集场景(专业、新闻、操作方法、讲解)
| 系统 | 综合素质(C+V+P)/3 | 内容 | 视觉 | 审美偏好 | 信息质量 |
|---|---|---|---|---|---|
| TapVid | 75.2 | 83.6 | 80.3 | 61.7 | 82.0 |
| Fable 5 | 75.0 | 82.8 | 88.1 | 54.2 | 85.5 |
| Seedance | 73.5 | 71.7 | 69.7 | 79.1 | 70.7 |
| LTX | 70.0 | 60.2 | 74.8 | 75.1 | 67.5 |
| Remotion | 69.7 | 77.5 | 65.9 | 65.7 | 71.7 |
| Hyperframes | 69.0 | 72.9 | 68.3 | 65.7 | 70.6 |
| Veo | 68.4 | 71.0 | 61.7 | 72.4 | 66.3 |
25 个场景的 Bootstrap CI 广泛重叠:数据支持的层是 Fable 5 · TapVid · Remotion/Hyperframes · 像素三重奏。总体质量 TapVid–Fable 5 差距(75.2 与 75.0)在噪声范围内。该排名对方法(PCA 与轴均值)、可靠性加权以及相关性分组的位置具有鲁棒性。 TapVid 的审美偏好为 0.5-以竞技场的星形拓扑为锚定;它的每个用例的变化存在于竞争对手中。
G · 事实报道——两个框架
所有 25 个场景 — 屏幕上所需事实的份额,逐字清晰; 95% 引导 CI;混合对数对比。
| 系统 | 覆盖范围 | 95%置信区间 | Δ vs TapVid | 95%置信区间 | 结果 |
|---|---|---|---|---|---|
| Fable 5 | 0.790 | [0.717, 0.860] | +0.094 | [−0.183, +0.370] | TIE |
| TapVid | 0.773 | [0.699, 0.843] | — | ||
| Remotion | 0.759 | [0.668, 0.845] | −0.166 | [−0.417, +0.085] | TIE |
| Hyperframes | 0.745 | [0.642, 0.842] | −0.199 | [−0.448, +0.050] | TIE |
| Seedance | 0.611 | [0.506, 0.710] | −0.826 | [−1.052, −0.601] | 赢 |
| Veo | 0.596 | [0.494, 0.697] | −0.867 | [−1.091, −0.642] | 赢 |
| LTX | 0.541 | [0.433, 0.658] | −1.179 | [−1.400, −0.958] | 赢 |
信息密集场景
| 系统 | 覆盖范围 | 95%置信区间 | Δ vs TapVid | 95%置信区间 | 结果 |
|---|---|---|---|---|---|
| TapVid | 0.836 | [0.773, 0.890] | — | ||
| Fable 5 | 0.792 | [0.710, 0.863] | −0.291 | [−0.601, +0.020] | TIE |
| Remotion | 0.765 | [0.669, 0.857] | −0.520 | [−0.801, −0.239] | 赢 |
| Hyperframes | 0.727 | [0.607, 0.835] | −0.681 | [−0.952, −0.409] | 赢 |
| Seedance | 0.677 | [0.578, 0.770] | −0.922 | [−1.182, −0.662] | 赢 |
| Veo | 0.601 | [0.497, 0.714] | −1.213 | [−1.464, −0.963] | 赢 |
| LTX | 0.545 | [0.418, 0.671] | −1.553 | [−1.798, −1.307] | 赢 |
覆盖率 ↔ 投放:173 个视频中 Pearson r = 0.70;合并 OLS 给出 P(理解|屏幕上) = 0.96 和屏幕外 0.36 的地板;混合 Logit 一致 (0.945 / 0.30)。覆盖率的绝对水平对评分者敏感(参见 D);系统间比较则不然。
H·TeachQuiz 信息传递 — 两种框架
所有 25 个场景 — 典型场景/问题的原始理解正确率、混合对数预测 P(正确) 和对比度。
| 系统 | 原始率 | 预测P | Δ vs TapVid | 95%置信区间 | 结果 |
|---|---|---|---|---|---|
| Fable 5 | 0.821 | 0.868 | +0.243 | [−0.091, +0.576] | TIE |
| Remotion | 0.812 | 0.857 | +0.147 | [−0.167, +0.461] | TIE |
| TapVid | 0.795 | 0.838 | — | ||
| Hyperframes | 0.789 | 0.834 | −0.028 | [−0.330, +0.274] | TIE |
| Veo | 0.785 | 0.830 | −0.052 | [−0.353, +0.249] | TIE |
| LTX | 0.715 | 0.756 | −0.509 | [−0.786, −0.233] | 赢 |
| Seedance | 0.691 | 0.730 | −0.647 | [−0.918, −0.377] | 赢 |
信息密集场景
| 系统 | 原始率 | Δ vs TapVid | 95%置信区间 | 结果 |
|---|---|---|---|---|
| Fable 5 | 0.846 | +0.056 | [−0.342, +0.453] | TIE |
| TapVid | 0.845 | — | ||
| Veo | 0.840 | +0.005 | [−0.368, +0.378] | TIE |
| Remotion | 0.832 | −0.067 | [−0.433, +0.299] | TIE |
| Hyperframes | 0.790 | −0.393 | [−0.731, −0.054] | 赢 |
| Seedance | 0.786 | −0.423 | [−0.759, −0.087] | 赢 |
| LTX | 0.752 | −0.650 | [−0.971, −0.329] | 赢 |
交付是相对于这个七系统字段(留一增益/现场基线logit);政府采取开放式管理,将差异压缩至 0.86 的中位数上限。三个估计器(原始、增益 D、混合 Logit)在两个框架中的顺序达成一致。
I·T2VTextBench文字精度和T2VWorldBench尺寸
T2VTextBench 文本准确度 — [0,1] 上的四级等级;集群稳健对比与 TapVid。 * = 95% CI 排除零。
| 系统 | 全部 25 个 | 95%置信区间 | 信息密集 | 95%置信区间 | Δ全25 |
|---|---|---|---|---|---|
| Fable 5 | 0.783 | [0.714, 0.850] | 0.750 | [0.681, 0.825] | +0.062 |
| TapVid | 0.740 | [0.660, 0.820] | 0.769 | [0.675, 0.856] | — |
| Hyperframes | 0.700 | [0.615, 0.785] | 0.706 | [0.613, 0.794] | −0.009 |
| Remotion | 0.695 | [0.610, 0.785] | 0.688 | [0.594, 0.781] | −0.050 |
| Seedance | 0.640 | [0.535, 0.740] | 0.700 | [0.594, 0.806] | −0.087 |
| Veo | 0.630 | [0.530, 0.730] | 0.650 | [0.531, 0.762] | −0.090 |
| LTX | 0.580 | [0.500, 0.660] | 0.619 | [0.537, 0.694] | −0.145* |
T2VWorldBench,所有 25 个场景 — 每个维度和纸张复合材料的平均等级。 * = 与 TapVid(集群鲁棒性 OLS)相比显着。
| 系统 | 品质 | 现实主义 | 相关性 | 一致性 | 复合材料 |
|---|---|---|---|---|---|
| Fable 5 | 0.900* | 0.909 | 0.891 | 0.909 | 0.902* |
| TapVid | 0.860 | 0.880 | 0.844 | 0.872 | 0.864 |
| Remotion | 0.800 | 0.860 | 0.860 | 0.824 | 0.836 |
| Hyperframes | 0.812 | 0.852 | 0.816 | 0.844 | 0.831 |
| Veo | 0.800 | 0.804 | 0.808 | 0.824 | 0.809 |
| Seedance | 0.808 | 0.808 | 0.772* | 0.796* | 0.796* |
| LTX | 0.792 | 0.784* | 0.688* | 0.792* | 0.764* |
该复合材料在内部有效(Cronbach α = 0.91),但折叠了一个面向内容的轴:相关性与交付/覆盖率(+0.77)的相关性大于其同级视觉维度(0.61-0.66)的相关性。信息密集框架:TapVid 在每个维度上都保持第二;只有质量和综合性能与 Fable 5 的差距仍然很大。
J·审美偏好(竞技场式)——两个框架,两个阅读
星形拓扑:的每一次比较都是TapVid与同一简介上的一个竞争对手的比较(296次比较)。胜率将平局视为一半; TapVid 的非损失计数平局;两者均已报告。根据二项式混合 logits 与 0.5 无偏好线得出的结论。
全部25个场景
| 与 | 胜率 | 95%置信区间 | 无损 | 95%置信区间 | 判决 |
|---|---|---|---|---|---|
| Fable 5 | 0.587 | [0.482, 0.683] | 0.696 | [0.577, 0.808] | TapVid 不输* |
| Hyperframes | 0.440 | [0.347, 0.531] | 0.560 | [0.458, 0.667] | 抛掷 |
| Remotion | 0.430 | [0.338, 0.519] | 0.540 | [0.433, 0.643] | 抛掷 |
| Veo | 0.380 | [0.297, 0.464] | 0.480 | [0.389, 0.571] | 抛掷 |
| LTX | 0.320 | [0.217, 0.417] | 0.380 | [0.267, 0.500] | TapVid 输* |
| Seedance | 0.300 | [0.206, 0.393] | 0.400 | [0.286, 0.500] | TapVid 输* |
| 整体 | 0.407 | [0.35, 0.47] | 0.507 | [0.44, 0.57] | 不如该领域* |
信息密集场景 — 总体胜率 0.432 [0.37, 0.50],非损失 0.530:平价。重大的非损失赤字消失了;在严格的决定性比较中,只有 Seedance 仍然是显着首选。
| 与 | 胜率 | 95%置信区间 | 无损 | 95%置信区间 |
|---|---|---|---|---|
| Fable 5 | 0.569 | [0.450, 0.692] | 0.667 | [0.542, 0.800] |
| Remotion | 0.463 | [0.354, 0.568] | 0.575 | [0.458, 0.692] |
| Hyperframes | 0.463 | [0.361, 0.563] | 0.600 | [0.500, 0.714] |
| Veo | 0.400 | [0.304, 0.500] | 0.500 | [0.385, 0.607] |
| LTX | 0.375 | [0.250, 0.500] | 0.425 | [0.292, 0.545] |
| Seedance | 0.338 | [0.225, 0.450] | 0.425 | [0.286, 0.567] |
偏好在经验上与信息指标正交:将 TapVid 在每个指标上的每个视频优势与竞技场结果相关联,得出 -0.22 到 -0.01(n = 148 个单元格)——全部为负或接近于零。不损失是有利的读数(20%的比较是平局);出于这个原因,两者都被显示。
K · 每个用例的排名 - TapVid 获胜和失败的位置
每个用例相对于 TapVid 都有显着的胜利/损失(95% 间隔不包括零)。细胞列出竞争对手; “—”=无。
| 使用案例 | 覆盖范围:TapVid 节拍 | 输给 | 发货:TapVid 节拍 | 输给 |
|---|---|---|---|---|
| 专业 | Fable 5、Hyperframes、Veo、LTX | — | Fable 5、LTX | Seedance |
| 新闻动态 | Remotion、Veo、LTX、Seedance | — | Remotion、LTX、Seedance | — |
| 操作方法 | Remotion、Hyperframes、Veo、LTX | — | Veo | — |
| 解说员 | LTX、Seedance | Fable 5 | Seedance | Fable 5 |
| 营销 | Seedance | Fable 5、Remotion、Hyperframes | Seedance | Fable 5、Remotion、Hyperframes |
没有一个系统能在所有地方获胜:Seedance 在专业交付方面领先,但在营销方面却崩溃(P < 0.30); Veo 追平新闻传递领先地位,但在 How-To 领域表现最差。按用例划分的 TapVid 竞技场胜率:专业 0.450、新闻 0.433、解释者 0.429、操作方法 0.417、营销 0.308。 TapVid 按用例划分的综合信息质量:新闻 87、操作方法 89、解释者 81、专业 71、营销 63。
10
试试TapVid
将提供的资源和批准的副本转变为可审查的解说视频工作流程。 探索TapVid。
11
参考文献和引用
支持的评估方法包括T2VTextBench、T2VWorldBench和文本到视频人类评估协议。
Recommended citation (APA): Law, D. (2026, September 6). AI video benchmark: Accuracy vs aesthetics (Version 1.0). TapVid Research. https://tapvid.ai/blog/information-dense-ai-video-benchmark
@techreport{law2026aiVideoBenchmark,
author = {Derek Law},
title = {AI Video Benchmark: Accuracy vs Aesthetics},
institution = {TapVid Research},
year = {2026},
month = {September},
url = {https://tapvid.ai/blog/information-dense-ai-video-benchmark},
note = {Version 1.0; July 2026 benchmark run}
}12
关于作者

Derek Law是TapVid的首席技术官兼联合创始人。他的工作以一个简单的论点为指导:人工智能的限制是界面,而不是智能。此前,他曾为 Amazon AGI 开发过 Alexa AI 和 GenUI。



