TapVid
    API & MCP定价博客关于我们
    博客›AI 视频基准:准确性与美观
    返回博客

    AI 视频基准:准确性与美观

    了解 6,760 次盲评揭示了人工智能生成视频的事实覆盖率、观众理解力、视觉质量和美感。

    数据研究
    Derek LawDerek Law2026年9月7日 · 29分钟阅读2026年9月7日 · 29分钟阅读Discord
    Derek LawDerek LawCTO & Co-founder, TapVid

    与作者和其他视频创作者深入交流, 观看实操教程。

    加入我们的 Discord
    2026年9月7日29分钟阅读
    AI 视频基准比较七个系统的准确性、理解力、视觉质量和美观度
    用以下工具总结6 个助手
    ChatGPTPerplexityTapVidvideoClaudeGeminiGrok
    在你的 AI Agent 中直接生成视频接入 TapVid API & MCP→

    本文目录

    1. 01AI 视频基准测试结论:首先关注重要内容——其他方面保持平衡
    2. 02专为必须提供信息而非娱乐的视频而打造
    3. 03信息视频是一个权衡前沿——TapVid 占据了平衡点
    4. 04在屏幕上显示事实是约束条件——TapVid 做得最好
    5. 05观众从 TapVid 中学到的知识与从该领域的任何系统中学到的知识一样多
    6. 06在四个视觉维度中的三个维度上与领先者统计并列
    7. 07通过 VBench 行业标准自动化指标验证的人工注释
    8. 08两个目标:营销内容和审美吸引力,无需信息交易
    9. 09冻结协议、种子统计、每个结果都是完整的
    10. 10试试TapVid
    11. 11参考文献和引用
    12. 12关于作者
    用以下工具总结API & MCP →
    ChatGPTPerplexityTapVidClaudeGeminiGrok

    TL;DR

    在信息密集的视频上,TapVid 处于领先地位。

    此 AI 视频基准测试是为必须 inform(指导性、编辑性、解释性)而不是娱乐性的视频而构建的。在其针对的信息密集场景中,TapVid 在事实覆盖率方面完全领先,在 TeachQuiz 信息交付方面并列第一,并且在七个系统中的总体质量名列前茅。独立的行业标准自动化指标 VBench 再现了人类小组的偏好,证实了评估的严谨性。

    01

    AI 视频基准测试结论:首先关注重要内容——其他方面保持平衡

    信息密集的场景——专业、新闻、操作指南、教育——是基准测试的目标领域,也是 TapVid 获胜的地方。在所有 25 个场景中,TapVid 的信息质量在 7 个场景中排名第二, 是唯一在两个信息轴上都强大的代码渲染器 。

    总体质量 — 信息丰富 + 美观 75.2 T 在信息密集型工作中排名第 1(共 7 个) — 唯一同时在每个轴上都很高的系统。

    审美偏好 vs Fable 5,信息领先者 58.7% 在并排观看中优于该领域的顶级信息系统 - 并且明显不输。

    事实覆盖 - 信息密集的场景 83.6% 彻底的领域领先。在屏幕上显示所需事实方面明显领先于 6 名竞争对手中的 5 名。

    TeachQuiz 信息传递——信息密集场景 84.5% 并列第一。观众在 TapVid 后回答理解问题的效果与在该领域的任何系统后一样好。

    整体品质——信息丰富+美观·信息密集的场景

    *(内容保真度 + 视觉质量 + 审美偏好)/ 3 · 场相对 T 分数(70 = 场平均值,10 = 1 SD)*

    整体品质——信息丰富+美观·信息密集的场景
    整体品质——信息丰富+美观·信息密集的场景

    这两个框架随处可见。 标题声称使用信息密集框架 (UC1–UC4) 作为基准目标 - 如图所示,其中 TapVid 总体质量名列前茅;在所有 25 个场景中,TapVid 的信息质量在 7 个场景中排名第 2(T 78 vs Fable 5 85)。带有置信区间的完整记分卡位于附录中。

    基准

    02

    专为必须提供信息而非娱乐的视频而打造

    五个用例中的每一个都借鉴了 现实世界的源材料 ,并在五个意图驱动的场景中进行评估:简介指定了观众应该离开的事实,人类注释者衡量他们是否这样做。目标是信息密度高、意图明确的视频——指导性、社论性、解释性——而不是审美或娱乐内容。

    该领域——七个系统,两个范式

    系统线束/模型家庭
    TapVid代码渲染视频代码渲染
    Fable 5Claude Code · Fable 5代码渲染
    代码渲染 HClaude Code · Sonnet 5代码渲染
    代码渲染 RCodex · GPT-5.5代码渲染
    像素扩散L官方工作室·专业模式,1080p像素扩散
    SeedanceSeedance 2.0 · Jimeng · VIP模式,720p像素扩散
    VeoVeo 3.1 · Google Flow · 质量模式,720p像素扩散

    所有系统均于 7 月 6 日至 12 访问 2026:本地运行的工具于 7 月 6 日冻结在最新版本,在其官方平台上以最新旗舰型号托管系统 - 每个系统均采用最高质量设置 16:9。确切的版本引脚及其来源请参见附录 A。

    五个用例,真实世界的源材料

    使用案例素材来源
    专业企业/自学GDPval 任务 — 专业和技术服务、政府、制造、金融
    新闻社论2025-26 期封面:《经济学人》、《金融时报》、《彭博社》、《自然》、《科学》
    生活方式指南热门 #HowTo YouTube — 工艺/DIY、艺术、健身、心态、谜题
    讲解员教育观看次数最多的“AP 考试解释”——历史、心理学、微积分、生物学、地理
    营销产品/销售纳斯达克最具价值公司跨行业发布视频

    生成前固定的采样规则。 每个用例都按照预定义的规则绘制五个场景 - 对源池进行聚类,每个聚类随机采样一个(顶级行业、出版物、内容类别、AP 主题、纳斯达克板块)。每个简报都是一个完整详细的视频生成提示,携带完整的信息有效负载,在任何系统生成任何内容之前编写和 冻结;其所需事实清单(基准中的 168 个事实)和理解问题(149 个)是同时编写并经过人工审核的。完整的示例位于附录 B 中。

    球场是如何进行的——一次射击,同样的简短,顶级设置

    • 相同的输入: 每个系统都收到相同的简短逐字记录 - 每个系统零提示工程。
    • Best-of-1: 每个场景一代,从未策划;重试硬故障直至成功(最多观察 3 次重试)。
    • 生成的持续时间:简报设定的目标长度;每个系统的实际输出按原样使用(系统平均值 1.1–4.2 分钟)。
    • 173/175会计: Fable 5的安全规则拒绝了25份简报中的2份。我们没有替代 Opus 的后备方案,而是仅在其 23 代上对 Fable 5 进行评分——没有竞争对手被悄悄削弱,缺失的单元格从分母中删除,从未进行估算。

    注释器面板——独立、盲目、完全交叉

    • 12名独立标注者,不隶属于任何系统团队的外包自由职业者——均拥有QS世界排名前50名大学的硕士学位或以上学位,并具有经过认证的英语能力。
    • 盲通:视频以随机顺序呈现,未标记;注释者从未被告知哪个系统生成了视频。
    • 完全交叉: 所有 12 个注释者对所有 7 个系统进行了评分,每个视频有两个评分者 - 严格或宽松的评分者会平等地移动每个系统,并且不会使比较产生偏差。
    • 刻意观看,非点击式工作: 每个5分钟以下的视频注释约20分钟,按当地最低工资的4倍支付。注释于 2026 年 7 月 13 日至 15 日。

    以已发布的方法为基础、由人测量的指标

    每个视频均由 全交叉注释器面板 进行评分 - 每个注释器都对每个系统进行评分,因此严格或宽松的评分者会平等地移动所有系统,并且不会使比较产生偏差。该小组根据已发布的方法在五个站点生成了 6,760 个人工注释 (其中三个在 ICML、WACV 和 IEEE TPAMI / CVPR 进行了同行评审),并且每个视频*也*由 VBench 自动化模型评分: >370万帧级模型评测 。

    • TeachQuiz 信息传递 (Code2Video、ICML 2026 · arXiv:2510.01174) — 观看者实际获取了多少预期信息。
    • 事实报道 - 简报所需的事实,有多少出现在屏幕上,逐字且清晰。
    • T2VTextBench 文本准确性 (arXiv:2505.04946) — 屏幕标题、数字和标签的正确性。
    • T2VWorldBench ( WACV 2026 · arXiv:2507.18107) — 四个质量维度:视频质量、真实性、相关性、一致性。
    • 审美偏好——竞技场风格,与TapVid并排比较。
    • VBench(VBench++、IEEE TPAMI 2025 · 原始 VBench、CVPR 2024 亮点 · 公共 HuggingFace 排行榜背后的模型) — 行业标准自动化视频质量套件, >370万帧级模型评测 。

    VBench 是 的一个独立的、基于机器的对人类注释的交叉检查 :它的帧质量评估再现了我们人类的偏好排名,因此这两个仪器相互印证(发现 05)。

    排名对于您如何计算它们来说是稳健的:三个独立的估计器——原始率、留一信息增益和混合效应逻辑模型——产生相同的排序,可靠性加权和PCA变体保持不变。由于营销表现为与四个信息密集用例不同的任务系列,因此 每个结果都在两个框架中报告::所有 25 个场景,以及信息密集框架(专业、新闻、操作方法、解释器)。两者的完整表格都在附录中。

    发现01·全视场框架

    03

    信息视频是一个权衡前沿——TapVid 占据了平衡点

    WIN 该领域是一个权衡前沿:在信息质量上,顺序是 Fable 5 > TapVid > 其他人;在审美偏好上,顺序完全相反。 TapVid 是唯一在两个信息轴上都很高的代码渲染器 - 内容保真度 77,视觉质量 79,每个轴上都是 7 中的第二个 - 前沿的平衡点。

    审美偏好是通过竞技场风格进行测量的——并排放置两个相同简介的视频——并捕捉到了信息性标题所没有的东西:它与每个信息性指标的相关性都是负到零(-0.22 到 -0.01)。代码渲染器购买信息质量;像素扩散带来了审美吸引力。下面的边界将两个框架中的所有七个系统都置于这种权衡之上。

    信息美学前沿

    *x:信息质量 · y:审美偏好 · 场相关 T 分数(70 = 场平均值) · 信息密集场景*

    信息美学前沿
    信息美学前沿

    TapVid 是绿色象限中唯一的系统——信息丰富且美观——在两个框架中。 边界正在走下坡路:信息质量排序 Fable 5 > TapVid > 其余,而审美偏好将其端到端颠倒。在信息密集的场景中,TapVid 移动到前沿的肘部(信息质量 82,领先者的 3.5 T 范围内),而像素扩散美学边缘缩小到奇偶校验;在所有 25 个场景中,Seedance 和像素扩散 L 都位于所示的偏好范围之上。审美偏好与信息质量一起报告,但从未对其进行平均。

    TAPVID 的美学胜率 — 并排观看,所有 25 个场景

    *并排比较 TapVid 获胜的份额(平局占一半)·×100*

    TAPVID 的美学胜率 — 并排观看,所有 25 个场景
    TAPVID 的美学胜率 — 并排观看,所有 25 个场景

    50 以上 = 观众更喜欢 TapVid。混合逻辑非损失/决定性胜利测试的意义;完整的CI和无损帧在附录中。

    TAPVID 的美学胜率 — 并排观看、信息密集的场景

    *并排比较 TapVid 获胜的份额(平局占一半)·×100*

    TAPVID 的美学胜率 — 并排观看、信息密集的场景
    TAPVID 的美学胜率 — 并排观看、信息密集的场景

    在基准测试的目标领域,审美缺陷缩小到同等水平——在决定性比较中,只有 Seedance 仍然明显受到青睐。

    WIN 与 Fable 5(该领域信息丰富的领导者)并排显示,观众更喜欢 TapVid。胜率58.7%,TapVid显着不输(P = 0.72)。在质量合成上击败 TapVid 的系统在观众面前输给了 TapVid。

    WIN 在信息密集的作品中,TapVid在引领内容的同时,在审美上毫不妥协。总体无损率上升到 53.0%(奇偶校验),并且没有任何像素扩散系统具有显着的无损优势。与 Google 的 Veo 相比:在信息质量上领先(78 比 65),在覆盖范围上显着领先,并且偏好摇摆不定。

    局限性 在所有 25 个场景中,审美偏好是一个真正的弱点。 TapVid 的整体胜率是 40.7%,明显低于 50% 的无偏好线,而且它的受欢迎程度明显低于 Pixel-diffusion L 和 Seedance(信息排名垫底)。倒置是范式权衡,集中在营销;收尾计划直接解决了这个问题。

    发现 02 · 事实覆盖范围

    04

    在屏幕上显示事实是约束条件——TapVid 做得最好

    获胜 在信息密集的场景中,TapVid 在屏幕上显示了 83.6% 的所需事实 — 绝对领先,明显领先于 6 个竞争对手中的 5 个。在所有 25 个场景中,它在统计上与领先者 Fable 5 并列,并且明显领先于每个像素扩散系统。

    覆盖范围是基准测试最具辨别力的指标:该领域分为两个干净的层,四个代码渲染器(屏幕上的事实的 74-79%)远离三个像素扩散系统(54-61%)。

    事实覆盖率——屏幕上所需事实的比例

    *平均值 · 95% 场景引导 CI · 信息密集场景 · ×100*

    事实覆盖率——屏幕上所需事实的比例
    事实覆盖率——屏幕上所需事实的比例

    信息密集帧:TapVid 83.6 [77.3–89.0] 领先 ;除 Fable 5 外,与每个系统的差距均具有统计显着性(混合对数 95% CI 排除 0)。 All-25 帧:Fable 5 79.0、TapVid 77.3(统计上并列),Seedance、Veo 和像素扩散 L 在这两个帧中都明显落后。

    覆盖率推动交付 — 每个视频 1 分,173 个视频

    *x:事实覆盖率·y:TeachQuiz 信息传递(正确率)·×100*

    覆盖率推动交付 — 每个视频 1 分,173 个视频
    覆盖率推动交付 — 每个视频 1 分,173 个视频

    获胜 一旦事实出现在屏幕上,观众大约 95% 的时间都会了解它。 173 个视频的覆盖率和投放率在 r = 0.70 处相关,拟合线从 36% 的非事实下限到 96% 的屏幕上限。理解几乎是一个已解决的步骤——游戏是覆盖范围,而 TapVid 发挥得最好。

    按用例划分的覆盖范围 — 模型预测的 P(屏幕上的事实)

    *每个用例的混合对数预测概率·×100*

    按用例划分的覆盖范围 — 模型预测的 P(屏幕上的事实)
    按用例划分的覆盖范围 — 模型预测的 P(屏幕上的事实)

    WIN TapVid 在五个用例中的四个中领先或并列覆盖率领先。它完全领先于新闻 (81.9) 和操作方法 (86.7),而在专业方面,它明显领先于四个竞争对手,包括总体领先者 Fable 5。

    局限性 营销是个例外。 TapVid 的覆盖率下降到 53.8% — 位于代码渲染器的底部,位于 Fable 5、Code-render R 和 Code-render H 后面。每个指标的 Marketing 列都存在相同的差距;结束计划将其视为一个问题。

    发现 03 · 教学测验信息传递

    05

    观众从 TapVid 中学到的知识与从该领域的任何系统中学到的知识一样多

    在信息密集的场景中,TapVid 在 TeachQuiz 信息传递方面并列第一——观众正确回答了 84.5% 的理解问题——并且显着超过了三个系统(代码渲染 H、Seedance、像素扩散 L)。在所有 25 个场景中,前五名在统计上是密不可分的; TapVid 明显领先于 Pixel-diffusion L 和 Seedance。

    交付遵循 TeachQuiz 协议:观看后,注释者回答有关摘要所需事实的多项选择问题,并且每个视频都会根据每个问题字段基线进行评分。三个独立的估计器——原始正确率、留一信息增益和混合效应逻辑——就排序达成一致。

    教学测验信息传递——理解正确率

    *原始正确率·显着性与混合效果 Logit 中的 TapVid·信息密集场景·×100*

    教学测验信息传递——理解正确率
    教学测验信息传递——理解正确率

    TapVid 在这两个框架中都是顶级的。完整的每个用例的赢/平/输表位于附录中。

    按用例交付 — 理解正确率

    *每个用例的原始正确率 · 在用例场景中具有 95% 引导 CI 的条形 · ×100*

    按用例交付 — 理解正确率
    按用例交付 — 理解正确率

    TapVid 在新闻 (88.3) 和操作指南 (89.7) 上名列前茅 - 根据混合逻辑推理,它在新闻上的代码渲染 R、像素扩散 L 和 Seedance 以及在操作方法上的 Veo 都显着优于 Veo,两者都不输。专业人士和讲解员属于中场;营销是结束计划 目标的差距。每个用例依赖于 5 个场景,因此 CI 很宽;重要性调用来自附录中的每个用例混合logit。

    T2VTEXTBENCH 文本准确性 — 屏幕上的标题、数字和标签

    *四层等级映射到 [0,1] · 95% bootstrap CI · 信息密集场景 · ×100*

    T2VTEXTBENCH 文本准确性 — 屏幕上的标题、数字和标签
    T2VTEXTBENCH 文本准确性 — 屏幕上的标题、数字和标签

    WIN TapVid 在信息密集的场景中渲染屏幕文本效果最佳。在所有 25 个场景中,从统计数据来看,该领域的顶尖选手是不可分割的。

    发现 04 · 视觉质量

    06

    在四个视觉维度中的三个维度上与领先者统计并列

    获胜 在 T2VWorldBench 人类评估中,TapVid 在真实性、相关性和一致性方面在统计上与领先者 Fable 5 并列(在两个帧中),并且在四维合成中排名 7(86.4),明显领先于 Seedance 和像素扩散 L。无论 TapVid 渲染什么,它都渲染得很干净。

    交叉注释器面板根据每个维度的评分标准对四个维度进行 1-5 级评级。与 Fable 5 的一个显着视觉差距是视频质量(86.0 vs 90.0);其他三个维度是统计联系。

    T2VWORLDBENCH — 四个维度,全部 25 个场景

    *平均等级 · 95% 场景引导 CI · ×100 · * = 与 TapVid 相比显着*

    T2VWORLDBENCH — 四个维度,全部 25 个场景
    T2VWORLDBENCH — 四个维度,全部 25 个场景

    TapVid 在质量、真实性和一致性方面排名第二,在相关性方面排名第三(位于 Fable 5 和代码渲染 R 之后)。相关性——“它是否说了正确的事情”——表现为内容维度,并使用上面的内容指标进行分析。

    获胜 如果评分者完全同意,TapVid 评分最高。在精确协议子集上,TapVid 的视频质量上升到 0.97,超过了 Fable 5——TapVid 的明显胜利是明确的。

    发现05·独立佐证

    07

    通过 VBench 行业标准自动化指标验证的人工注释

    检查 在相同的 25 个场景中盲目运行,VBench(公共 HuggingFace 排行榜背后的自动化模型)独立于人类小组对每个视频进行评分。它对系统进行排序的方式与我们注释者的并排偏好相同。 Spearman VBench 框架质量与人类偏好之间 ρ = +0.89; +0.87 排除任何一个系统。人类偏好轴并不是我们的评估者的产物——一个独立的、纸质的机器指标也遵循同样的顺序。

    一个广泛使用的自动化模型,在不了解人类标签的情况下进行计算,与人类小组对系统排名的看法一致——这证明评估捕捉到了真实的、可再现的信号,而不是评估者的特质。

    自动化和人类仪器一致——显示的每个视频

    *x:VBench 每个视频的帧质量(自动) · y:每个系统的人类获胜率 · 141 个系统×场景视频,按系统着色 · ×100*

    自动化和人类仪器一致——显示的每个视频
    自动化和人类仪器一致——显示的每个视频

    E每个小点是一个视频的自动帧质量,由系统着色并按该系统的人类获胜率放置;大点是系统的意思。 彩色云按胜率顺序堆叠,它们的中心从左到右爬升 - 自动帧质量和人类偏好将系统排列在一起( Spearman ρ = +0.89 )。系统未命名:重点是两个仪器的一致,而不是任何一个系统的立场。

    SRC VBench(VBench++、IEEE TPAMI 2025·原始 VBench、CVPR 2024 亮点)是公共 HuggingFace 排行榜背后的标准自动视频质量基准,对每个剪辑进行六个维度的评分。它于 7 月 13 日至 14 日在专用 GPU 上使用官方 VBench-Long 代码路径(提交 e946a8d)运行——在与人类标签进行任何比较之前完成。帧质量头(美学+成像质量)是这里使用的美学交叉检查,计算工作时的质量,因此失败的一代不会扭曲系统的分数。每个合成都是根据每个场景的原始分数重新计算的,并将源报告​​与小数点相匹配;完整的运行方案见附录 A。

    下一场胜利结束

    08

    两个目标:营销内容和审美吸引力,无需信息交易

    这两个差距都是经过衡量的、局部的,并且与已经有效的东西是分开的。两者都不需要触及赢得信息密集领域的覆盖和交付引擎。

    按使用案例划分的 TAPVID — 营销差距在于内容,而不是渲染

    *内容保真度与视觉质量综合·相对于现场的 T 分数·每个用例*

    按使用案例划分的 TAPVID — 营销差距在于内容,而不是渲染
    按使用案例划分的 TAPVID — 营销差距在于内容,而不是渲染

    在营销方面,TapVid 的视觉质量保持在 75,而内容保真度则下降到 51 - 视频渲染干净,但错过了所需的事实。在其他地方,两个轴以 68-93 的比例一起移动。

    审美计划——提升审美轴,保持信息领先

    *x:信息质量·y:审美偏好·T 分数·所有 25 个场景*

    审美计划——提升审美轴,保持信息领先
    审美计划——提升审美轴,保持信息领先

    因为偏好与每一个质量指标都是正交的,所以这一举措是 直接上升的 ——提高运动、润色和吸引力将 TapVid 移向前沿的空白右上角,而无需花费任何信息领先。

    下一个胜利结束 #1 — 营销内容。崩溃是营销场景中的事实传递,而不是渲染——覆盖引擎的有针对性的扩展,已经导致了四个用例,而不是重建。关闭它会将 TapVid 的信息密集覆盖领先优势转变为全领域领先优势:不包括营销,TapVid 已经在覆盖范围的六个系统中名列前茅。

    NEXT 获胜结束 #2 — 审美偏好与像素扩散,但不放弃信息领先。从经验上看,偏好与每一个质量指标都是正交的,因此关闭它是它自己的程序——动议、润色、吸引力——而不是被迫反对覆盖或交付的交易。信息密集的框架显示了天花板:在内容密集的地方,TapVid 已经达到偏好平价,同时保持内容领先。

    附录

    09

    冻结协议、种子统计、每个结果都是完整的

    系统版本与来源固定;采样规则和事实清单在任何视频出现之前就已确定;注释器面板是盲的并且完全交叉(A-B)。三个独立的估计者就每个顺序达成一致,所有随机性都被播种,并且独立的重新运行再现了每个工件(C-E)。在两个框架 (F–K) 中完成每个指标的排行榜以及每个指标的置信区间。除非另有说明,Δ 列是与 ZX​​Q4QXZ 的混合对数对数赔率对比; WIN / LOSS = 从 TapVid 的角度来看,95% 区间不包括零; TIE = 没有。

    KEY 系统命名。本报告正文通过匿名标签引用了三个系统。他们的真实身份仅在此说明:代码渲染 H = Hyperframes · 代码渲染 R = Remotion · 像素扩散 L = LTX。下表使用真实的产品名称。

    A · 实验协议——版本、时间线、注释账本

    时间线(2026)。摘要+事实清单在7月6日之前编写和冻结→系统7月6日冻结→所有代7月6-12日→VBench-Long评分7月13-14日→人工注释7月13-15日(第一次回复7月13日09:41,最后7月15日04:33)→统计和人类↔VBench 比对,7 月 14 日至 16 日。 VBench 评分在任何人类标签比较存在之前完成。

    版本 pin — 截至 7 月 6 日冻结的最新版本的本地运行工具;窗口期间的最新旗舰机型托管平台。每个平台均提供所有 16:9、最高质量设置、故事板/规划功能。

    系统版本·平台·设置来源
    TapVid访问窗口的内部构建当前—
    Fable 5Claude Code 2.1.202 · 模型 claude-fable-5 (6 月 9 日宣布,7 月 1 日重新部署) · 默认公告 · 变更日志
    Hyperframesv0.7.37 · Claude Code · Sonnet 5(6 月 30 日发布) · 默认发布 · Sonnet 5
    Remotionv4.0.485 · Codex CLI 0.142.5 · GPT-5.5(4 月 23 日发布;GPT-5.6 冻结后于 7 月 9 日发布) · 默认发布 · Codex · GPT-5.5
    VeoVeo 3.1(2025年10月15日发布) · Google Flow,Flow 的故事板规划 · 质量模式,720p公告 · 模式文档
    LTXLTX-2.3(2026 年 3 月发布) · LTX Studio,LTX Studio 使用 GPT-Image-2 进行故事板规划 · Pro 模式,1080p发布 · GPT-Image-2
    SeedanceSeedance 2.0(2月12日公布)·Jimeng——字节跳动官方消费平台——代理模式,故事电影技巧·VIP模式(顶级画质),720p公告 · Jimeng

    提示出处。 所有 25 份摘要及其事实清单均由 Claude Opus 在 Claude Code 上编写,经过人工审核,并在生成开始之前冻结。如果人工智能作者的简介偏向于任何系统的习惯用法,那么受益者将是 Fable 5(竞争对手),而不是 TapVid。

    6,760 个注释分类账。 每个注释者 × 场景 × 系统 × 项目一行:事实检查 2,326(168 个事实)+ TeachQuiz 理解 2,062(149 个问题)+ T2VWorldBench 四维 1,384(346 个视频×评分者单位 × 4)+ 文本准确性692(346 单位 × 等级 + 垃圾标志)+ 并排偏好 296 = 6,760 。每个计数都可以根据原始导出重新计算。

    VBench 运行。 官方 VBench-Long 代码( vbench2_beta_long ,提交 e946a8d )在 5× NVIDIA L4 上,每个用例一个分片,约 6 小时墙;在新实例上从头开始固定和复制环境;保留每个单元结果 JSON 和运行日志。输入归一化和 >3.7M 评估算法:附录 E 。

    B· 工作示例——整个流程的简要说明

    简报(操作方法场景 1):*“弹出的纸 — 无胶折纸坐立不安玩具”*,目标 5:00、16:9。与每个简报一样,它是一个完全指定的制作文档,对于所有七个系统都是相同的:具有精确的十六进制调色板的艺术指导、灯光和摄像机语言、具有完整画外音文本和每个场景的动作注释的九个场景镜头列表,以及一个主提示 - 例如*“……三张颜色编码的纸(靛蓝 6×6 外盒、琥珀色 5×5 内按钮、紫罗兰色 9×4 弹簧)、构建两个盒子的共享布林茨折叠……翻盖塞在相邻边缘下方的无胶锁……”* 完整的信息有效负载位于简报中,因此覆盖失败可归因于系统,而不是提示。

    其必需的事实清单(用简短的方式编写,在生成之前冻结;站点项目以英文呈现)。只有当事实逐字清晰地出现在屏幕上时,它才会被记入——注释者可以逐帧重播:

    • 外箱纸:6×6厘米
    • 内扣纸:5×5厘米
    • 弹簧纸:9×4厘米
    • 无胶承诺:无胶水,无胶带,任何地方
    • 关键折叠,名称:blintz折叠(角到中心)

    A TeachQuiz 理解项(观看后回答;“视频没有提供这个”逃逸得分不正确):*“两个盒子共享的关键折叠是什么?”* — 谷折/blintz 折叠(角到中心)/挤压折叠/视频没有提供此信息。

    如何得分。 在这个场景中,TapVid 的两位评分者都将 5/5 事实记入 并正确回答了 12/12 理解问题 。在这个场景中,相同的项目在该领域的其他地方遇到了真正的失误——包括折叠名称问题——这是基准旨在衡量的歧视。

    C·统计方法——估计器、种子和独立重新验证

    Estimators. 二元站(覆盖、交付):贝叶斯混合逻辑回归值 ~ system + (1|scene) + (1|item) , TapVid 作为参考。分级站(文本、尺寸):具有注释器固定效果的场景集群鲁棒性 OLS。另外还通过留一法信息增益进行传递。 三个独立的估计器——原始速率、信息增益、混合逻辑——在两个帧中产生相同的系统排序。

    Uncertainty. 来自场景级引导程序的 95% CI(对 25 个场景重新采样,B = 3000,固定种子);显着性 = 95% 区间排除零;结果报告为间隔重叠的层,绝不是错误的精度排名。 VBench:每个维度的 Skillings-Mack 综合(在 23 个完整场景块中,方法差异在 p = 8e-18 到 1e-9 处显着),事后成对 Wilcoxon 符号秩与 Holm 校正。 Human↔VBench 对齐:Spearman 等级相关,通过 2000× bootstrap、留一系统排除和排列测试(全部为种子)进行压力测试。

    可重复性 - 独立重新验证。 所有分析随机性均已播种,原始数据(完整注释导出和每个场景 VBench 分数)随分析一起提供,每个指标在固定依赖项下都有自己的单命令重现脚本(Python 3.14.5 · numpy 2.5.1 · pandas 3.0.3 · scipy 1.18.0 · statsmodels 0.14.6 · matplotlib 3.11.0 · openpyxl 3.1.5)。在新的环境中独立重新运行重新生成了所有 55 个提交的结果工件:每个确定性输出字节相同,所有 15 个数字像素相同,并且变分混合模型列匹配 ≤6e-06 对数赔率 - 任何地方都没有显着性判决改变 。

    D·可靠性、方法和局限性

    评估者设计的稳健性。 该小组是完全交叉的——每个注释者对每个系统进行评分——因此评估者的严格性不会影响系统间的比较。添加注释器随机效果移动对比最多 0.16(交付)/0.31(覆盖)对数赔率,无显着性翻转。

    每个指标的评估者间协议。 交付:73.6% 原始协议,Gwet AC1 0.59。覆盖率:67.2%,AC1 0.42 — 注释器效应是主要的干扰源 (sd 0.98),因此绝对覆盖率水平对评分者敏感,尽管比较并非如此。文本:一级内 91%,加权 κ 0.27 — 最嘈杂的评级。 WorldBench 维度:1 内 79–85%,加权 κ 0.24–0.35。审美偏好:加权 κ 0.07 — 296 次比较的总胜率是有意义的;个人判断并非如此,这也将正交相关性减弱至零。

    Limitations. 交付与此七系统字段相关,并且在不同字段的基准运行之间不具有可比性。理解是开卷进行的; 0.86的中位数上限压缩了系统差异,闭盘运行是最高杠杆锐化。 25 个场景(每个用例 5 个),每个视频有 2 个评估者,绑定每个用例的分辨率 — 顶层并未完全分离。报道仅在逐字且清晰的情况下才承认事实。混合对数区间是变分的(反保守的);大的显着对比是安全的。竞技场的星形拓扑不支持竞争对手与竞争对手之间的排名,也不支持绝对的审美评分。 T 分数是相对于现场的便利性,而不是绝对等级。每秒事实带宽站已定义,但在本轮中未计算。

    E·VBench ↔ 人类对齐 — 方法

    Instruments. VBench 框架质量是模型的美学质量和成像质量维度的平均值,计算得出 quality-when-it-works(失败的一代被排除,不得分为 0)。人类偏好是与 ZX​​Q6QXZ 的并列胜率。相关性超过了 六个竞争对手系统 — TapVid 是每次比较的星形拓扑锚点,因此不是标绘点。

    对齐(VBench 框架质量 ↔ 人类偏好)Spearmanρ
    整体+0.89
    留一系统(最坏情况)+0.87
    专业+0.94
    新闻动态+0.77
    营销+0.70
    操作方法+0.48
    解说员−0.33

    整体标志经受住了 2000 倍引导重采样和留一系统; n = 6 个系统限制了形式意义。解释器是观众奖励动作而不是帧抛光的部分,因此帧质量指标在那里跟踪不同的线索。每个 VBench 复合材料都是根据每个场景的原始分数重新计算的,并将源报告​​与小数点匹配。

    Run 出处和 >3.7M 计数。 VBench-Long(vbench2_beta_long,提交 e946a8d ;VBench++,IEEE TPAMI 2025)于 2026 年 7 月 13 日至 14 日在 NVIDIA L4 GPU 上运行 - 在任何人类标签比较存在之前。输入按场景标准化,因此系统不会获得编码伪像:720p 上限(从未升级)、统一的 24 fps 帧网格、近乎无损的重新编码。每个视频有六个维度;其中四个得分*每帧*(每帧 24 个模型前进/秒),运动平滑度为 11.5/秒,动态度为 7.5/秒 - 镜头每秒 116 个模型前进。横跨32,141秒的评分视频:373万帧级模型评估。对长度修剪版本(上面未计算)的进一步一致性重新检查验证了视频长度不会混淆比较:原生修剪增量均 < 0.0025。

    F·综合记分卡——信息质量和三个轴

    场相关 T 分数: 70 = 这七个系统的平均值,每 10 分 = 1 SD。信息质量 = 内容保真度和视觉质量轴的等权平均值。审美偏好是源自领域的,并在信息轴旁边报告,而不是在它们内部——它与它们相反。总体质量(内容+视觉+审美偏好)/3,是指定的信息密集场景标题。

    全部25个场景

    系统信息质量95%置信区间内容视觉审美偏好
    Fable 585.4[78.3, 92.1]82.688.252.3
    TapVid78.2[69.3, 86.6]77.179.261.7
    Remotion72.3[61.5, 82.2]76.668.169.2
    Hyperframes71.8[59.3, 83.0]73.370.268.1
    Veo64.8[51.7, 77.0]66.063.674.6
    Seedance61.3[46.8, 75.1]60.362.283.1
    LTX56.3[41.8, 70.8]54.158.581.0

    信息密集场景(专业、新闻、操作方法、讲解)

    系统综合素质(C+V+P)/3内容视觉审美偏好信息质量
    TapVid75.283.680.361.782.0
    Fable 575.082.888.154.285.5
    Seedance73.571.769.779.170.7
    LTX70.060.274.875.167.5
    Remotion69.777.565.965.771.7
    Hyperframes69.072.968.365.770.6
    Veo68.471.061.772.466.3

    25 个场景的 Bootstrap CI 广泛重叠:数据支持的层是 Fable 5 · TapVid · Remotion/Hyperframes · 像素三重奏。总体质量 TapVid–Fable 5 差距(75.2 与 75.0)在噪声范围内。该排名对方法(PCA 与轴均值)、可靠性加权以及相关性分组的位置具有鲁棒性。 TapVid 的审美偏好为 0.5-以竞技场的星形拓扑为锚定;它的每个用例的变化存在于竞争对手中。

    G · 事实报道——两个框架

    所有 25 个场景 — 屏幕上所需事实的份额,逐字清晰; 95% 引导 CI;混合对数对比。

    系统覆盖范围95%置信区间Δ vs TapVid95%置信区间结果
    Fable 50.790[0.717, 0.860]+0.094[−0.183, +0.370]TIE
    TapVid0.773[0.699, 0.843]—
    Remotion0.759[0.668, 0.845]−0.166[−0.417, +0.085]TIE
    Hyperframes0.745[0.642, 0.842]−0.199[−0.448, +0.050]TIE
    Seedance0.611[0.506, 0.710]−0.826[−1.052, −0.601]赢
    Veo0.596[0.494, 0.697]−0.867[−1.091, −0.642]赢
    LTX0.541[0.433, 0.658]−1.179[−1.400, −0.958]赢

    信息密集场景

    系统覆盖范围95%置信区间Δ vs TapVid95%置信区间结果
    TapVid0.836[0.773, 0.890]—
    Fable 50.792[0.710, 0.863]−0.291[−0.601, +0.020]TIE
    Remotion0.765[0.669, 0.857]−0.520[−0.801, −0.239]赢
    Hyperframes0.727[0.607, 0.835]−0.681[−0.952, −0.409]赢
    Seedance0.677[0.578, 0.770]−0.922[−1.182, −0.662]赢
    Veo0.601[0.497, 0.714]−1.213[−1.464, −0.963]赢
    LTX0.545[0.418, 0.671]−1.553[−1.798, −1.307]赢

    覆盖率 ↔ 投放:173 个视频中 Pearson r = 0.70;合并 OLS 给出 P(理解|屏幕上) = 0.96 和屏幕外 0.36 的地板;混合 Logit 一致 (0.945 / 0.30)。覆盖率的绝对水平对评分者敏感(参见 D);系统间比较则不然。

    H·TeachQuiz 信息传递 — 两种框架

    所有 25 个场景 — 典型场景/问题的原始理解正确率、混合对数预测 P(正确) 和对比度。

    系统原始率预测PΔ vs TapVid95%置信区间结果
    Fable 50.8210.868+0.243[−0.091, +0.576]TIE
    Remotion0.8120.857+0.147[−0.167, +0.461]TIE
    TapVid0.7950.838—
    Hyperframes0.7890.834−0.028[−0.330, +0.274]TIE
    Veo0.7850.830−0.052[−0.353, +0.249]TIE
    LTX0.7150.756−0.509[−0.786, −0.233]赢
    Seedance0.6910.730−0.647[−0.918, −0.377]赢

    信息密集场景

    系统原始率Δ vs TapVid95%置信区间结果
    Fable 50.846+0.056[−0.342, +0.453]TIE
    TapVid0.845—
    Veo0.840+0.005[−0.368, +0.378]TIE
    Remotion0.832−0.067[−0.433, +0.299]TIE
    Hyperframes0.790−0.393[−0.731, −0.054]赢
    Seedance0.786−0.423[−0.759, −0.087]赢
    LTX0.752−0.650[−0.971, −0.329]赢

    交付是相对于这个七系统字段(留一增益/现场基线logit);政府采取开放式管理,将差异压缩至 0.86 的中位数上限。三个估计器(原始、增益 D、混合 Logit)在两个框架中的顺序达成一致。

    I·T2VTextBench文字精度和T2VWorldBench尺寸

    T2VTextBench 文本准确度 — [0,1] 上的四级等级;集群稳健对比与 TapVid。 * = 95% CI 排除零。

    系统全部 25 个95%置信区间信息密集95%置信区间Δ全25
    Fable 50.783[0.714, 0.850]0.750[0.681, 0.825]+0.062
    TapVid0.740[0.660, 0.820]0.769[0.675, 0.856]—
    Hyperframes0.700[0.615, 0.785]0.706[0.613, 0.794]−0.009
    Remotion0.695[0.610, 0.785]0.688[0.594, 0.781]−0.050
    Seedance0.640[0.535, 0.740]0.700[0.594, 0.806]−0.087
    Veo0.630[0.530, 0.730]0.650[0.531, 0.762]−0.090
    LTX0.580[0.500, 0.660]0.619[0.537, 0.694]−0.145*

    T2VWorldBench,所有 25 个场景 — 每个维度和纸张复合材料的平均等级。 * = 与 TapVid(集群鲁棒性 OLS)相比显着。

    系统品质现实主义相关性一致性复合材料
    Fable 50.900*0.9090.8910.9090.902*
    TapVid0.8600.8800.8440.8720.864
    Remotion0.8000.8600.8600.8240.836
    Hyperframes0.8120.8520.8160.8440.831
    Veo0.8000.8040.8080.8240.809
    Seedance0.8080.8080.772*0.796*0.796*
    LTX0.7920.784*0.688*0.792*0.764*

    该复合材料在内部有效(Cronbach α = 0.91),但折叠了一个面向内容的轴:相关性与交付/覆盖率(+0.77)的相关性大于其同级视觉维度(0.61-0.66)的相关性。信息密集框架:TapVid 在每个维度上都保持第二;只有质量和综合性能与 Fable 5 的差距仍然很大。

    J·审美偏好(竞技场式)——两个框架,两个阅读

    星形拓扑:的每一次比较都是TapVid与同一简介上的一个竞争对手的比较(296次比较)。胜率将平局视为一半; TapVid 的非损失计数平局;两者均已报告。根据二项式混合 logits 与 0.5 无偏好线得出的结论。

    全部25个场景

    与胜率95%置信区间无损95%置信区间判决
    Fable 50.587[0.482, 0.683]0.696[0.577, 0.808]TapVid 不输*
    Hyperframes0.440[0.347, 0.531]0.560[0.458, 0.667]抛掷
    Remotion0.430[0.338, 0.519]0.540[0.433, 0.643]抛掷
    Veo0.380[0.297, 0.464]0.480[0.389, 0.571]抛掷
    LTX0.320[0.217, 0.417]0.380[0.267, 0.500]TapVid 输*
    Seedance0.300[0.206, 0.393]0.400[0.286, 0.500]TapVid 输*
    整体0.407[0.35, 0.47]0.507[0.44, 0.57]不如该领域*

    信息密集场景 — 总体胜率 0.432 [0.37, 0.50],非损失 0.530:平价。重大的非损失赤字消失了;在严格的决定性比较中,只有 Seedance 仍然是显着首选。

    与胜率95%置信区间无损95%置信区间
    Fable 50.569[0.450, 0.692]0.667[0.542, 0.800]
    Remotion0.463[0.354, 0.568]0.575[0.458, 0.692]
    Hyperframes0.463[0.361, 0.563]0.600[0.500, 0.714]
    Veo0.400[0.304, 0.500]0.500[0.385, 0.607]
    LTX0.375[0.250, 0.500]0.425[0.292, 0.545]
    Seedance0.338[0.225, 0.450]0.425[0.286, 0.567]

    偏好在经验上与信息指标正交:将 TapVid 在每个指标上的每个视频优势与竞技场结果相关联,得出 -0.22 到 -0.01(n = 148 个单元格)——全部为负或接近于零。不损失是有利的读数(20%的比较是平局);出于这个原因,两者都被显示。

    K · 每个用例的排名 - TapVid 获胜和失败的位置

    每个用例相对于 TapVid 都有显着的胜利/损失(95% 间隔不包括零)。细胞列出竞争对手; “—”=无。

    使用案例覆盖范围:TapVid 节拍输给发货:TapVid 节拍输给
    专业Fable 5、Hyperframes、Veo、LTX—Fable 5、LTXSeedance
    新闻动态Remotion、Veo、LTX、Seedance—Remotion、LTX、Seedance—
    操作方法Remotion、Hyperframes、Veo、LTX—Veo—
    解说员LTX、SeedanceFable 5SeedanceFable 5
    营销SeedanceFable 5、Remotion、HyperframesSeedanceFable 5、Remotion、Hyperframes

    没有一个系统能在所有地方获胜:Seedance 在专业交付方面领先,但在营销方面却崩溃(P < 0.30); Veo 追平新闻传递领先地位,但在 How-To 领域表现最差。按用例划分的 TapVid 竞技场胜率:专业 0.450、新闻 0.433、解释者 0.429、操作方法 0.417、营销 0.308。 TapVid 按用例划分的综合信息质量:新闻 87、操作方法 89、解释者 81、专业 71、营销 63。

    10

    试试TapVid

    将提供的资源和批准的副本转变为可审查的解说视频工作流程。 探索TapVid。

    11

    参考文献和引用

    支持的评估方法包括T2VTextBench、T2VWorldBench和文本到视频人类评估协议。

    Recommended citation (APA): Law, D. (2026, September 6). AI video benchmark: Accuracy vs aesthetics (Version 1.0). TapVid Research. https://tapvid.ai/blog/information-dense-ai-video-benchmark

    @techreport{law2026aiVideoBenchmark,
      author = {Derek Law},
      title = {AI Video Benchmark: Accuracy vs Aesthetics},
      institution = {TapVid Research},
      year = {2026},
      month = {September},
      url = {https://tapvid.ai/blog/information-dense-ai-video-benchmark},
      note = {Version 1.0; July 2026 benchmark run}
    }

    12

    关于作者

    Derek Law
    Derek Law

    Derek Law是TapVid的首席技术官兼联合创始人。他的工作以一个简单的论点为指导:人工智能的限制是界面,而不是智能。此前,他曾为 Amazon AGI 开发过 Alexa AI 和 GenUI。

    本文如何核验

    核验基础: TapVid 对本文的编辑与发布记录证据: 作者署名、发布记录,以及外部事实主张需要时提供的来源链接

    文章版本2026年9月7日

    关于作者Derek Law

    CTO & Co-founder, TapVid

    Derek Law is CTO and co-founder of TapVid. His work is guided by a simple thesis: the constraint on AI is the interface, not intelligence. Previously, he worked on Alexa AI and GenUI for Amazon AGI.

    查看全部 1 篇文章 →

    Derek Law 邀请你加入 Discord,与其他视频创作者一起交流。

    在 Discord 加入 Derek →
    将批准的资产和副本转换为可审查的解释视频

    用好你已有的素材

    把你的文件文件变成可直接发布的视频

    网页→ 视频PPT→ 视频PDF→ 视频素材→ 视频音频→ 视频视频→ 视频口播→ 视频网页→ 视频PPT→ 视频PDF→ 视频素材→ 视频音频→ 视频视频→ 视频口播→ 视频

    继续阅读

    相关文章

    2026 年视频完成率:七个定义 经过审计的研究封面
    数据研究·11分钟阅读

    2026 年视频完成率:审核七种定义

    七个第一方定义显示了播放次数、开始次数、展示次数、观看次数和里程碑计数如何改变视频完成率。

    2026年9月4日

    基于 6,464 名匹配 TapVid 用户的 AI 视频工作流基准
    数据研究·11分钟阅读

    AI 视频工作流基准:分析 6,464 名用户

    一个包含 6,464 名 TapVid 匹配用户的队列表明,简报、脚本、有效视频、观看、导出和分享需要使用彼此独立的工作流指标。

    2026年9月2日

    用 TapVid 快速制作动画视频,同时保持质量
    教程·10分钟阅读

    如何在不损失质量的情况下快速制作动画视频

    一套快速且不牺牲质量的方法,专为需要在真实截止日期下制作动画视频的团队和创作者而设。

    2026年4月16日

    准备好制作第一支视频了吗?

    加入数千个产品团队,用 AI 几分钟做出专业视频。

    5 分钟内做出第一支视频 →预约演示 →
    Tapvid

    TapVid 将你的企业已有素材制作成准确的视频,清晰讲解内容并可直接发布。

    TikTokInstagramXDiscordYouTube

    TapVid

    功能

    AI 讲解视频生成器AI 动态图形生成器AI 产品演示视频生成器产品演示视频制作工具讲解视频模板视频制作计划模板视频创意简报模板企业视频模板视频销售信模板视频制作提案模板宣传视频模板视频制作模板AI 商品视频生成器AI 补充镜头生成器口播视频增强器AI 视频克隆器Prompt to VideoAI 文字转视频文字转动态图形动画视频制作工具动画讲解视频制作工具动态文字生成器动态图表制作工具动态拼贴制作器免费 AI 视频生成器

    转换为视频

    截图转视频图片转视频Assets to VideoAudio to Video视频转视频 AIPDF 转视频PPT 转视频文章转视频博客转视频URL 转视频脚本转视频Google Slides 转视频Word 转视频SOP 转视频

    使用场景

    AI 学习视频制作工具SaaS 讲解视频AI 视频自动化SaaS 视频制作工业视频制作产品发布视频制作工具AI 广告视频生成器AI 纪录片制作工具动画社交媒体视频制作器信息图视频制作器播客转视频白板动画制作器白板解说视频电商视频广告初创讲解视频案例视频教学视频教程视频客户上手引导帮助中心视频API 文档视频

    解决方案

    讲解视频产品演示视频会议纪要视频网络研讨会剪辑营销视频功能发布公告竞品对比邮件通讯视频落地页视频投资人路演视频

    精选指南

    视频提示词库Gemini Omni 1.1 Flash 提示词库MiniMax H3 提示词库不露脸 YouTube 热门赛道拼贴动画指南

    公司

    所有功能关于博客价格联系我们

    © 2026 TapVid。保留所有权利。

    隐私政策
    服务条款