TL;DR
情報量の多いビデオでは、TapVid がこの分野をリードしています。
この AI ビデオ ベンチマークは、inform (教育、編集、説明) を楽しませる必要のないビデオ向けに構築されています。対象となる情報密度の高いシーンでは、TapVid が事実報道で完全にリードし、TeachQuiz 情報配信で 1 位に並び、7 つのシステム全体で総合品質でトップに立っています。独立した業界標準の自動メトリックである VBench は、人間のパネルの好みを再現し、評価の厳密さを裏付けています。
01
AI ビデオ ベンチマークの評決: まず重要なコンテンツについて、その他の部分はバランスが取れている
プロフェッショナル、ニュース、ハウツー、教育といった情報密度の高いシーンがベンチマークの対象領域であり、TapVid が勝つのはそこです。 25 のシーン全体で、TapVid は情報品質に関して 7 件中 2 位であり、 は両方の情報軸 に強い唯一のコード レンダラーです。
全体的な品質 — 有益かつ美的 75.2 T 情報密度の高い作業で 7 つ中 1 位 — すべての軸で一度に高い唯一のシステム。
美的好みと有益なリーダーである Fable 5 58.7% 並べて表示した場合、この分野のトップの情報システムよりも好まれており、ほとんど負けていません。
実際の報道 — 情報密度の高いシーン 83.6% 完全なるフィールドリード。必要な事実を画面上に表示する点で、競合他社 6 社中 5 社を大幅に上回りました。
XXQ20QXZ 情報配信 — 情報密度の高いシーン 84.5% 同率 1 位。視聴者は、現場の他のシステムの後と同様に、TapVid の後でも理解に関する質問に答えます。
全体的な品質 — 有益 + 美的 · 情報密度の高いシーン
*(コンテンツ忠実度 + ビジュアル品質 + 美的好み) / 3 · フィールド相対 T スコア (70 = フィールド平均、10 = 1 SD)*

両方のフレームがどこでもレポートされます。 ヘッドライン クレームでは、ベンチマークのターゲットとなる情報密度の高いフレーム (UC1 ~ UC4) が使用されています。ここでは、TapVid が総合品質のトップとなっています。 25 シーンすべてで、TapVid は情報品質で 7 件中 2 位です (T 78 対 Fable 5 の 85)。信頼区間を含む完全なスコアカードは、付録 にあります。
ベンチマーク
02
楽しむものではなく、情報を提供する必要がある動画向けに構築されています
5 つのユースケースのそれぞれは、現実世界のソース素材 を利用し、5 つの意図主導のシーンで評価されます。ブリーフでは、視聴者が立ち去るべき事実が指定されており、ヒューマン アノテーターは、事実を把握しているかどうかを測定します。ターゲットは、情報密度が高く、教育的、編集的、説明的な意図が明確なビデオであり、美的コンテンツやエンターテイメント コンテンツではありません。
フィールド — 7 つのシステム、2 つのパラダイム
| システム | ハーネス/モデル | 家族 |
|---|---|---|
| TapVid | コードレンダリングされたビデオ | コードレンダリング |
| Fable 5 | Claude Code・Fable 5 | コードレンダリング |
| コードレンダーH | Claude Code・Sonnet 5 | コードレンダリング |
| コードレンダーR | Codex・GPT-5.5 | コードレンダリング |
| ピクセル拡散L | 公式スタジオ・プロモード、1080p | ピクセル拡散 |
| Seedance | Seedance 2.0 · Jimeng · VIP モード、720p | ピクセル拡散 |
| Veo | Veo 3.1 · Google Flow · 品質モード、720p | ピクセル拡散 |
すべてのシステムは 2026 年 7 月 6 日から 12 日 にアクセスしました。ローカルで実行されるツールは 7 月 6 日の時点で最新リリースで凍結され、ホスト システムは公式プラットフォーム上の最新のフラッグシップ モデルで、すべてのシステムは最高品質設定の 16:9 で使用されました。ソースを含む正確なバージョンのピンは、付録 A にあります。
5 つのユースケース、現実世界のソースマテリアル
| ユースケース | 原材料 |
|---|---|
| プロフェッショナル企業 / 自己学習 | GDPval タスク — プロフェッショナルおよびテクニカル サービス、政府、製造、財務 |
| ニュース社説 | 2025 ~ 26 年の表紙: Economist、FT、Bloomberg、Nature、Science |
| ハウツーライフスタイル | トップ #HowTo YouTube — クラフト/DIY、アート、フィットネス、マインドセット、パズル |
| 説明者教育 | 最も閲覧されている「AP 試験の解説」 — 歴史、心理学、微積分学、生物学、地理学 |
| マーケティング 製品・販売 | ナスダックで最も価値のある企業のさまざまな分野の発表ビデオ |
生成前に修正されたサンプリング ルール。 各ユース ケースは、事前定義されたルールによって 5 つのシーンを描画します。つまり、ソース プールをクラスター化し、クラスターごとに 1 つをランダムにサンプリングします (上位の業界、出版物、コンテンツ カテゴリ、AP 主題、NASDAQ セクター)。すべてのブリーフは、システムが何かを生成する前に作成および 凍結された完全な情報ペイロードを運ぶ完全に詳細なビデオ生成プロンプトです 。必須事実チェックリスト (ベンチマーク全体で 168 件の事実) と理解に関する質問 (149 件) が同時に作成され、人間によるレビューが行われました。完全な動作例は 付録 B にあります。
フィールドの運営方法 – ワンショット、同じブリーフ、最高の設定
- 同一の入力: すべてのシステムは同じ簡潔な内容をそのまま受信しました - システムごとのプロンプト エンジニアリングはゼロです。
- Best-of-1: シーンごとに 1 世代、決して厳選されていません。ハード失敗は成功するまで再試行されます (最大 3 回の再試行が観察されます)。
- 生成された Durations:ブリーフによって設定された ターゲットの長さ。各システムの実際の出力はそのまま使用されます (システム平均 1.1 ~ 4.2 分)。
- 173/175 会計: Fable 5 の安全規則は、25 件の準備書面のうち 2 件を拒否しました。 Opus のフォールバックを置き換えるのではなく、独自の 23 世代のみで Fable 5 をスコア付けしました。競合他社が静かに弱体化することはなく、欠落しているセルは分母から削除され、決して代入されません。
アノテーターパネル — 独立、ブラインド、完全交差
- 12 人の独立したアノテーター は、どのシステム チームにも所属していない外部委託のフリーランサーです。各メンバーは QS 世界ランキング上位 50 位の大学で修士号以上を取得し、認定された英語能力を備えています。
- Blind through: ビデオはラベルなしでランダムな順序で表示されます。アノテーターは、どのシステムがビデオを作成したかについて一切知らされませんでした。
- 全クロス: 12 人のアノテーター全員が 7 システムすべてを評価し、ビデオごとに 2 人の評価者がいます。厳格または寛大な評価者はすべてのシステムを平等に評価し、比較に偏りを与えることはできません。
- 意図的な視聴、クリック作業ではありません: 5 分未満のビデオごとに最大 20 分の注釈が付けられ、地域最低賃金の 4 倍で支払われます。 2026 年 7 月 13 ~ 15 日に注釈が付けられました。
公開された方法に基づいた、人によって測定された指標
すべてのビデオは、完全に交差したアノテーター パネル によって採点されます。すべてのアノテーターがすべてのシステムを評価するため、厳格または寛大な評価者はすべてのシステムを平等に評価し、比較に偏りを与えることはできません。このパネルは、公開された手法に基づいて、5 つのステーションにわたって 6,760 個の人による注釈 を作成しました (そのうち 3 つは ICML、WACV、IEEE TPAMI / CVPR で査読済みです)。また、すべてのビデオは ZZQ25QXZZZQ7QXZ 自動化モデルによって*もスコア付けされています: >370 万フレームレベルのモデル評価 。
- ZZQ20QXZ 情報配信 (Code2Video、ICML 2026 · arXiv:2510.01174) — 視聴者が意図した情報のどれだけを実際に取得するか。
- 実際の報道範囲 — 要旨に必要な事実のうち、画面上に逐語的に表示され、判読できるものがいくつあるか。
- T2VTextBench テキストの精度 (arXiv:2505.04946) — 画面上のタイトル、番号、ラベルの正確さ。
- ZZQ22QXZXXQ1QXZ ( WACV 2026 · arXiv:2507.18107) — 4 つの品質の側面: ビデオ品質、リアリズム、関連性、一貫性。
- A美的好み — アリーナ形式での TapVid との並べての比較。
- ZZQ23QXZXXQ1QXZ (VBench++、IEEE TPAMI 2025 · オリジナルの VBench, CVPR 2024 Highlight · 公開 HuggingFace リーダーボードの背後にあるモデル) — 業界標準の自動ビデオ品質スイート、 >370 万フレームレベルのモデル評価 。
VBench は、人間による注釈 の 独立した機械ベースのクロスチェックです。そのフレーム品質評価は人間の好みのランキングを再現するため、2 つの測定器は相互に裏付けられます ( 調査結果 05 )。
ランキングは計算方法に応じて堅牢です。3 つの独立した推定器 — 生レート、リーブワンアウト情報利得、および混合効果ロジスティックモデル — は同一の順序を生成し、信頼性加重および PCA バリアントでは変更されません。マーケティングは情報密度の高い 4 つのユース ケースとは異なるタスク ファミリとして動作するため、 すべての結果は 2 つのフレーム でレポートされます: 25 のシーンすべてと情報密度の高いフレーム (プロフェッショナル、ニュース、ハウツー、説明)。両方の完全な表は 付録 にあります。
ファインディング 01 · フルフィールド フレーム
03
有益なビデオはトレードオフの境界線であり、TapVid がバランス ポイントを保持します
WIN このフィールドはトレードオフのフロンティアです。Informative Quality では、順序は Fable 5 > TapVid > その他です。 「美的好み」では順序がまったく逆になります。 TapVid は、両方の情報軸 (コンテンツ忠実度 77、ビジュアル品質 79、それぞれ 7 点中 2 位) で高い唯一のコード レンダラーであり、フロンティアのバランス ポイントです。
美的嗜好はアリーナ スタイル (同じ概要の 2 つのビデオを並べて表示) で測定され、有益なルーブリックでは得られないものを捉えています。すべての有益な指標との相関はマイナスからゼロ (-0.22 ~ -0.01) です。コードレンダラーは有益な品質を購入します。ピクセルの拡散により美的魅力が得られます。以下のフロンティアでは、両方のフレームで 7 つのシステムすべてがそのトレードオフ上に配置されています。
有益な美的フロンティア
*x: 情報品質 · y: 美的好み · フィールド相対 T スコア (70 = フィールド平均) · 情報密度の高いシーン*

ZZQ2QXZ は、両方のフレームにおいて、緑の象限にある唯一のシステムです。情報量が多く、美的に好まれるシステムです。 フロンティアは下り坂です。有益な品質では、Fable 5 > TapVid > 残りの順であり、美的好みでは、それがエンドツーエンドで逆転します。情報密度の高いシーンでは、TapVid はフロンティアのエルボ (情報品質 82、リーダーから 3.5 T 以内) に移動しますが、ピクセル拡散の美的エッジは同等に縮小します。 25 のシーンすべてで、Seedance とピクセル拡散 L は、示されている優先範囲を上回っています。美的嗜好は情報品質の横に報告されますが、平均化されることはありません。
TAPVID の美的勝率 — 並べて表示、全 25 シーン
*横並び比較のシェア TapVid が勝利 (同点カウントは半分) · ×100*

50 を超える = 視聴者は TapVid を好みます。混合ロジットの非損失/決定的勝利テストからの有意性。完全な CI と非損失フレームは 付録 にあります。
TAPVID の美しい勝率 — 並べて表示、情報密度の高いシーン
*横並び比較のシェア TapVid が勝利 (同点カウントは半分) · ×100*

ベンチマークのターゲット領域では、美的欠点は同等にまで縮小します。決定的な比較では、依然として Seedance のみが大幅に優先されています。
WIN この分野の有益なリーダーである Fable 5 と並べて表示されますが、視聴者は TapVid を好みます。勝率は 58.7%、TapVid は有意に負けませんでした (P = 0.72)。高品質のコンポジットで TapVid に勝つシステムは、視聴者の前ではそれに負けます。
WIN 情報密度の高い作品において、TapVid はコンテンツを主導しながら美学については何も譲りません。全体的な無損失率は 53.0% (パリティ) に上昇し、そこでは無損失という大きな利点を持つピクセル拡散システムは存在しません。 Google の Veo との比較: 情報品質で優位 (78 対 65)、カバレッジで大幅に優位、好みのトスアップ。
制限 25 のシーンすべてにおいて、美的な好みが大きな弱点となります。 TapVid の全体的な勝率は 40.7% で、非優先ラインの 50% を大幅に下回っています。また、有益なランキングの最下位である Pixel-diffusion L や Seedance よりも優先度が大幅に低くなります。逆転はパラダイムのトレードオフであり、マーケティングに集中しています。閉鎖計画はこれに直接対処します。
発見 02 · 事実報道
04
画面上に事実を表示することがバインディング制約であり、TapVid が最適です。
情報が密集したシーンでの勝利 TapVid は、必要な事実の 83.6% を画面上に表示します。これは、競合他社 6 社中 5 社を大幅に上回り、分野での完全なリードです。 25 シーンすべてにおいて、統計的にはリーダーの Fable 5 と並んでおり、あらゆるピクセル拡散システムよりも大幅に優れています。
カバレッジはベンチマークの最も特徴的な指標です。フィールドは 2 つのきれいな層に分割され、4 つのコード レンダラー (画面上の事実の 74 ~ 79%) が 3 つのピクセル拡散システム (54 ~ 61%) から十分離れた位置にあります。
事実の報道 — 画面上で必要な事実の共有
*平均 · シーン全体の 95% ブートストラップ CI · 情報密度の高いシーン · ×100*

情報密度の高いフレーム: TapVid 83.6 [77.3–89.0] が完全にリード ; Fable 5 を除くすべてのシステムとのギャップは統計的に有意です (混合ロジット 95% CI は 0 を除外します)。オール 25 フレーム: Fable 5 79.0、TapVid 77.3 — 統計的には同点 — Seedance、Veo、およびピクセル拡散 L が両方のフレームで大幅に遅れています。
カバレッジが配信を促進 — ビデオごとに 1 ポイント、173 ビデオ
*x: 事実報道 · y: TeachQuiz 情報配信(正解率) · ×100*

勝利事実が画面に表示されると、視聴者は最大 95% の確率でそれを理解します。 173 本のビデオにわたって、カバレッジと配信は r = 0.70 で相関しており、当てはめられた直線は 36% の事実なしの下限から 96% の画面上の上限まで伸びています。理解はほぼ解決されたステップです。ゲームは報道であり、TapVid がそれを最もよくプレイします。
ユースケース別のカバレッジ — モデル予測 P(画面上の事実)
*ユースケースごとの混合ロジット予測確率 · ×100*

WIN TapVid は、5 つの使用例のうち 4 つでカバレッジ リードをリードまたは同点です。 News (81.9) と How-To (86.7) を完全にリードしており、Professional では総合リーダーの Fable 5 を含む競合 4 社を大幅に上回っています。
制限 マーケティングは例外です。そこでは、TapVid のカバレッジは 53.8% に低下します。コード レンダラーの最下部、Fable 5、コード レンダー R、およびコード レンダー H の後ろにあります。同じギャップが、すべての指標のマーケティング列を形成します。終結計画ではそれを一つの問題として扱います。
FINDING 03・TEACHQUIZ情報配信
05
視聴者は、現場のシステムから学ぶのと同じくらい、TapVid から多くのことを学びます
情報密度の高いシーンでは、TapVid が TeachQuiz の情報配信と同点で 1 位となり、視聴者は理解問題の 84.5% に正解しました。また、3 つのシステム (コード レンダー H、Seedance、ピクセル拡散 L) を大幅に上回りました。 25 シーンすべてにおいて、上位 5 シーンは統計的に切り離すことができません。 TapVid は、Pixel-diffusion L および Seedance よりも大幅に優れています。
配信は TeachQuiz プロトコルに従います。視聴後、アノテーターは概要に必要な事実に関する多肢選択式の質問に答え、各ビデオは質問ごとのフィールド ベースラインに対してスコア付けされます。 3 つの独立した推定器 (生の正解率、リーブワンアウト情報利得、および混合効果ロジット) が順序付けに同意します。
TEACHQUIZ 情報配信 — 理解正答率
*生の正解率 · 混合効果ロジットからの有意性 vs TapVid · 情報密度の高いシーン · ×100*

TapVidはどちらの枠でもトップクラスです。ユースケースごとの完全な勝敗表は、付録 にあります。
ユースケース別の配信 — 理解の正解率
*ユースケースごとの生の正解率 · ユースケースのシーン全体で 95% のブートストラップ CI を持つバー · ×100*

ZZQ4QXZ は、ニュース (88.3) とハウツー (89.7) でトップレベルです。混合ロジット推論によると、ニュースではコード レンダー R、ピクセル拡散 L および Seedance、ハウツーでは Veo を大幅に上回り、どちらにも負けません。プロフェッショナルと説明者は中堅です。マーケティングは、クローズアウト計画 がターゲットとするギャップです。各ユースケースは 5 つのシーンに基づいているため、CI の範囲は広くなります。重要性の呼び出しは、付録 のユースケースごとの混合ロジットから来ています。
T2VTEXTBENCH テキストの精度 — 画面上のタイトル、番号、ラベル
*[0,1] にマッピングされた 4 層グレード · 95% ブートストラップ CI · 情報密度の高いシーン · ×100*

WIN TapVid は、情報が豊富なシーンで画面上のテキストを最適にレンダリングします。 25 のシーンすべてにおいて、フィールドのトップは統計的に切り離すことができません。
ファインディング 04 · ビジュアルクオリティ
06
4 つの視覚的側面のうち 3 つにおいて、統計的にリーダーと同等である
勝利 T2VWorldBench の人間による評価では、TapVid は両方のフレームにおいてリアリズム、関連性、一貫性においてリーダーの Fable 5 と統計的に同点であり、4 次元コンポジット (86.4) では 7 つ中 2 位であり、Seedance とピクセル拡散 L を大幅に上回っています。 TapVid がレンダリングするものは何でも、きれいにレンダリングされます。
4 つの次元は、次元ごとのルーブリックに対して十字のアノテーター パネルによって 1 ~ 5 で評価されます。 Fable 5 との視覚的な大きな違いは、ビデオ品質 (86.0 対 90.0) です。他の 3 つの次元は統計的な関係です。
T2VWORLDBENCH — 4 次元、全 25 シーン
*平均グレード · シーン全体の 95% ブートストラップ CI · ×100 · * = TapVid に対して有意*

XXQ2QXZ は、品質、リアリズム、一貫性で 2 位、関連性 で 3 位です (Fable 5 とコード レンダー R に次ぐ)。関連性 (「正しいことを言っているかどうか」) はコンテンツのディメンションとして機能し、上記のコンテンツ指標を使用して分析されます。
WIN 評価者が全面的に同意する場合、TapVid が最も高い評価をします。完全一致サブセットでは、TapVid のビデオ品質が 0.97 に上昇し、Fable 5 を追い越しました。TapVid の明らかな勝利は明らかです。
発見 05 · 独立した裏付け
07
人間による注釈は業界標準の自動メトリクス VBench によって検証されています
チェック 同じ 25 のシーンをブラインドで実行すると、公開 HuggingFace リーダーボードの背後にある自動モデルである VBench が、人間のパネルとは独立してすべてのビデオをスコアリングします。アノテーターの並列設定と同じ方法でシステムを順序付けします。 Spearman ρ = +0.89 VBench フレーム品質と人間の好みの間。 +0.87 で、いずれか 1 つのシステムが除外されます。人間の好みの軸は評価者の人工物ではありません。紙に基づいた独立した機械の指標が同じ順序で配置されます。
人間のラベルをまったく知らずに計算された、広く使用されている自動モデルは、システムのランク付けに関する人間のパネルと一致しています。これは、評価が評価者の特異性ではなく、実際の再現可能な信号を捉えている証拠です。
自動化された装置と人間の装置が同意 - 表示されるすべてのビデオ
*x: VBench ビデオごとのフレーム品質 (自動) · y: 各システムの人間の勝率 · 141 システム×シーン ビデオ、システムごとに色分け · ×100*

それぞれの小さな点は、1 つのビデオの自動フレーム品質であり、システムごとに色分けされ、そのシステムの人間の勝率に基づいて配置されます。大きな点はシステムの平均値です。 色付きの雲は勝率の順に積み重なり、その中心は左から右に上がります。自動化されたフレーム品質と人間の好みによってシステムがランク付けされます ( Spearman ρ = +0.89 )。システムには名前が付けられていません。重要なのは、どちらかのシステムの立場ではなく、2 つの手段の合意です。
SRC VBench (VBench++、IEEE TPAMI 2025、オリジナル VBench、CVPR 2024 ハイライト) は、公開されている HuggingFace リーダーボードの背後にある標準の自動ビデオ品質ベンチマークであり、クリップごとに 6 つのディメンションをスコアリングします。これは、7 月 13 ~ 14 日に専用 GPU 上の公式 VBench-Long コード パス (コミット e946a8d) を使用して実行されました。人間のラベルとの比較が存在する前に完了しました。フレーム品質ヘッド (美的 + イメージング品質) は、ここで使用される美的クロスチェックであり、失敗した生成によってシステムのスコアが歪められないように、機能したときに計算された品質です。すべてのコンポジットはシーンごとの生のスコアから再計算され、ソース レポートと小数点まで一致します。完全な実行プロトコルは付録 A にあります。
次に勝つのはクローズ
08
2 つのターゲット: マーケティング コンテンツと、情報交換を行わない美的魅力
どちらのギャップも測定され、局所的に特定され、すでに機能しているものから分離可能です。どちらも、情報密度の高い領域を勝ち取るカバレッジおよび配信エンジンに触れる必要はありません。
ユースケース別のTAPVID — マーケティングギャップはレンダリングではなくコンテンツである
*コンテンツ忠実度 vs ビジュアル品質複合 · フィールド相対 T スコア · ユースケースごと*

マーケティングに関しては、TapVid のビジュアル品質は 75 に保たれていますが、コンテンツの忠実度は 51 に低下しています。ビデオはきれいにレンダリングされますが、必要な事実は見逃しています。それ以外の場所では、2 つの軸が 68 ~ 93 で一緒に動きます。
美的プログラム — 美的軸を高め、情報を先導する
*x: 情報品質 · y: 美的好み · T スコア · 全 25 シーン*

好みはあらゆる品質指標と直交しているため、動きは 真っ直ぐ です。モーション、磨きをかけ、魅力を高めると、有益なリードをまったく費やすことなく、TapVid がフロンティアの空いている右上隅に移動します。
NEXT 勝利して成約 #1 — マーケティング コンテンツ。崩壊はレンダリングではなく、マーケティング シーンでのファクト配信です。再構築ではなく、既に 4 つのユースケースをリードしているカバレッジ エンジンの対象を絞った拡張です。これを終了すると、TapVid の情報密度の高いカバレッジ リードが全分野のカバレッジ リードに変わります。マーケティングを除くと、TapVid はカバレッジですでに 6 システム中 5 つを完全にトップにしています。
NEXT 勝利してクロージング #2 — 有益なリードを返さずに、美的好みとピクセルの拡散を比較します。好みは経験的にあらゆる品質指標と直交しているため、それをクロージングすることは、独自のプログラム、つまり動き、磨きをかけ、アピールするものであり、取材や配信に対して強制される取引ではありません。情報密度の高いフレームは上限を示しています。コンテンツが密度の高いところでは、TapVid はコンテンツのリードを維持しながら、すでに優先パリティに達しています。
付録
09
凍結されたプロトコル、シードされた統計、すべての結果を完全に表示
システムのバージョンはソースとともにその日に固定されます。サンプリング ルールとファクト チェックリストは、ビデオが存在する前に修正されました。アノテーターのパネルは盲目で完全に交差していました (A-B)。 3 つの独立した推定器がすべての順序付けに同意し、すべてのランダム性がシードされ、独立した再実行によってすべてのアーティファクトが再現されます (C ~ E)。両方のフレーム (F ~ K) で、すべてのメトリクスの信頼区間を含むリーダーボードを完成させます。 Δ列は、特に断りのない限り、混合ロジット対数オッズ対TapVidの対比です。 WIN / LOSS = TapVid の観点からは、95% の間隔にはゼロが含まれません。 TIE = そうではありません。
KEY システムの命名。このレポートの本文では、匿名化されたラベルによる 3 つのシステムについて言及しています。彼らの本当のアイデンティティは、ここでのみ述べられています: コード レンダー H = Hyperframes · コード レンダー R = Remotion · ピクセル拡散 L = LTX。以下の表では実際の製品名を使用しています。
A · 実験プロトコル — バージョン、タイムライン、注釈台帳
Timeline (2026). ブリーフ + ファクト チェックリストが 7 月 6 日より前に作成および凍結 → システムが 7 月 6 日に凍結 → 全世代 7 月 6 ~ 12 日 → VBench-Long スコアリング 7 月 13 ~ 14 日 → 人間による注釈 7 月 13 ~ 15 日 (最初の応答 7 月 13 日 09:41、最終応答 7 月 15 日 04:33) → 統計と人間↔VBench アライメント 7 月 14 ~ 16 日。 VBench スコアリングは、人間によるラベルの比較が存在する前に完了しました。
Version pins — 7 月 6 日のフリーズ時点での最新リリースのローカルで実行されるツール。期間中に最新のフラッグシップ モデルでホストされたプラットフォームをご利用いただけます。すべての 16:9、最高品質設定、各プラットフォームに付属のストーリーボード/プランニング機能。
| システム | バージョン・プラットフォーム・設定 | ソース |
|---|---|---|
| TapVid | アクセスウィンドウでの内部ビルドの最新情報 | — |
| Fable 5 | Claude Code 2.1.202 · モデル claude-fable-5 (6 月 9 日に発表、7 月 1 日に再展開) · デフォルト | お知らせ · 変更履歴 |
| Hyperframes | v0.7.37 · Claude Code · Sonnet 5 (6 月 30 日リリース) · デフォルト | リリース · Sonnet 5 |
| Remotion | v4.0.485 · Codex CLI 0.142.5 · GPT-5.5 (4 月 23 日に発表、フリーズ後の GPT-5.6 は 7 月 9 日に出荷) · デフォルト | リリース · Codex · GPT-5.5 |
| Veo | Veo 3.1 (2025-10-15 発表) · Google Flow、Flow によるストーリーボード計画 · 品質モード、720p | お知らせ · モードドキュメント |
| LTX | LTX-2.3 (2026 年 3 月リリース) · LTX Studio、GPT-Image-2 を使用した LTX Studio によるストーリーボード計画 · Pro モード、1080p | リリース · GPT-画像-2 |
| Seedance | Seedance 2.0 (2 月 12 日に発表) · Jimeng — ByteDance の公式消費者プラットフォーム — エージェント モード、ストーリー映画スキル · VIP モード (最高品質)、720p | お知らせ · Jimeng |
出所を確認する。 25 のブリーフすべてとそのファクト チェックリストは、Claude Code 上の Claude Opus を使用して作成され、人間によるレビューが行われ、生成が開始される前に凍結されました。 AI の著者が概要を何らかのシステムのイディオムに偏らせる場合、受益者は TapVid ではなく、競合他社である Fable 5 になります。
6,760 のアノテーション台帳。 アノテーターごとに 1 行×シーン×システム×アイテム: ファクトチェック 2,326 (事実 168) + TeachQuiz 理解 2,062 (質問 149) + T2VWorldBench 4 次元 1,384 (ビデオ 346 × 評価者ユニット × 4) + テキスト精度692 (346 ユニット × グレード + ジャンク フラグ) + 並列優先 296 = 6,760 。すべてのカウントは、生のエクスポートから再計算できます。
ZZQ18QXZ run. 公式 VBench-Long コード ( vbench2_beta_long 、 commit e946a8d ) 5× NVIDIA L4、ユースケースごとに 1 シャード、最大 6 時間の壁。環境は固定され、新しいインスタンス上で最初から再現されます。セルごとの結果 JSON と実行ログが保持されます。入力正規化と 370 万を超える評価演算: 付録 E 。
B · 実用的な例 — パイプライン全体にわたる 1 つの概要
概要 (ハウツー シーン 1): *「はじける紙 — 接着剤不要の折り紙そわそわおもちゃ」*、ターゲット 5:00、16:9。すべてのブリーフと同様に、これは 7 つのシステムすべてで同一の、完全に仕様化された制作ドキュメントです。正確な 16 進パレットを使用したアート ディレクション、照明とカメラの言語、完全なナレーション テキストとシーンごとのモーション ノートを含む 9 シーンのショット リスト、および単一のマスター プロンプト。 *「…3 つの色分けされた紙 (インディゴ 6×6 の外箱、琥珀色の 5×5 内側のボタン、バイオレットの 9×4 スプリング)、両方の箱を構築する共有ブリンツ折り目…フラップが隣接する端の下に押し込まれる接着剤不要のロック…」* 完全な情報ペイロードはブリーフに存在するため、カバレッジの失敗はプロンプトではなくシステムに起因します。
必須事実チェックリスト (概要を使用して作成され、生成前に凍結されています。ステーション項目は英語で表示されます)。ファクトは、画面上にそのまま表示され、判読できる場合にのみクレジットされます。アノテーターはフレームごとに再生できます。
- 外箱紙:6×6cm
- 内ボタン紙:5×5cm
- スプリングペーパー:9×4cm
- 接着剤不使用の約束: 接着剤もテープも使わず、どこでも使用可能
- 主要な折り目、名前: blintz 折り (角から中心まで)
A TeachQuiz 理解項目 (視聴後に回答。「ビデオではこれが提供されていませんでした」エスケープは不正確と採点されます): *「両方のボックスが共有する重要な折り目は何ですか?」* — 谷折り / ブリンツ折り (角から中心) / スカッシュ折り / ビデオではこの情報が提供されませんでした。
得点方法。 このシーンでは、TapVid の評価者の両方が 5/5 事実 を評価し、12/12 の理解問題 に正しく答えました。同じ項目が、このシーンのフィールドの他の場所 (フォールド名の質問を含む) で実際のミスを捕らえました。これは、ベンチマークが測定するために構築された識別です。
C · 統計的手法 — 推定量、シード、独立した再検証
Estimators. バイナリ ステーション (カバレッジ、配信): ベイジアン混合ロジスティック回帰値 ~ システム + (1|シーン) + (1|アイテム) 、参照として TapVid。グレーディングステーション (テキスト、寸法): アノテーターの固定効果を備えたシーンクラスター堅牢な OLS。リーブワンアウト情報取得による追加配信。 3 つの独立した推定器 (生レート、情報ゲイン、混合ロジット) は、両方のフレームで同一のシステム順序付けを生成します。
Uncertainty. シーン レベルのブートストラップからの 95% CI (25 シーンをリサンプリング、B = 3000、固定シード)。有意性 = 95% 間隔はゼロを除外します。結果は間隔が重複する階層として報告され、誤った精度のランクは発生しません。 VBench: 次元ごとのスキリングス – マック オムニバス (23 個の完全なシーン ブロックにわたって p = 8e-18 から 1e-9 で有意なメソッドの違い)、ホルム補正を伴うポストホック ペアワイズ ウィルコクソン符号付きランク。 Human↔VBench アライメント: Spearman ランク相関、2000 倍ブートストラップ、leave-one-system-out、および並べ替えテスト (すべてシード) によるストレス テスト済み。
再現性 — 独立して再検証。 すべての分析のランダム性がシードされ、生データ (完全な注釈のエクスポートとシーンごとの VBench スコア) が分析に同梱され、各メトリクスには固定された依存関係 (Python 3.14.5 · numpy 2.5.1 · pandas 3.0.3 · scipy) の下に独自のワンコマンド再生スクリプトがあります。 1.18.0 · statsmodels 0.14.6 · matplotlib 3.11.0 · openpyxl 3.1.5)。新しい環境での独立した再実行により、コミットされた 55 個の結果アーティファクトすべてが再生成されました。すべての決定論的出力バイトが同一で、15 個の数字がすべてピクセル同一で、変分混合モデルの列が ≤6e-06 対数オッズに一致し、 有意性判定はどこにも変化なし でした。
D · 信頼性、方法、制限事項
Rater の設計による堅牢性。 パネルは完全に交差しており、すべてのアノテーターがすべてのシステムを評価しています。そのため、評価者の厳密性がシステム間の比較に偏ることはありません。アノテーターのランダム効果を追加すると、有意性反転なしでコントラストが最大 0.16 (配信) / 0.31 (カバレッジ) 対数オッズだけ移動します。
メトリックごとの評価者間の合意。 配信: 73.6% の生の合意、Gwet AC1 0.59。カバレッジ: 67.2%、AC1 0.42 — アノテーター効果が支配的な迷惑源 (sd 0.98) であるため、比較はそうでなくても、絶対カバレッジ レベルは評価者の影響を受けます。テキスト: 1 学年内 91%、重み付け κ 0.27 — 最もノイズの多い評価。 WorldBench の寸法: 1 以内 79 ~ 85%、重み付け κ 0.24 ~ 0.35。美的好み: 加重 κ 0.07 — 296 回の比較にわたる合計勝率は意味があります。個々の判断はそうではなく、これにより直交性相関もゼロに向かって減衰します。
Limitations. 配信は、この 7 システム フィールドに関連しており、異なるフィールドで実行されたベンチマーク間で比較することはできません。理解はオープンブックで管理されます。中央値 0.86 の上限はシステムの差異を圧縮し、クローズドブック実行は最もレバレッジのシャープ化となります。 25 シーン (ユースケースごとに 5 つ)、ビデオごとに 2 人の評価者がユースケースごとの解像度に制限されています。上位層は完全には分離されていません。報道では、逐語的かつ判読可能な場合にのみ事実が認められます。混合ロジット区間は変分的 (反保守的) です。大きな有意なコントラストは安全です。アリーナのスター トポロジでは、競合他社間のランキングや絶対的な美的スコアはサポートされていません。 T スコアはフィールドに関連した便宜的なものであり、絶対的な成績ではありません。ファクト/秒帯域幅ステーションは定義されていますが、このラウンドでは計算されませんでした。
E・VBench ↔ 人間の位置合わせ — メソッド
Instruments. VBench フレーム品質は、モデルの美的品質と画像品質の次元の平均であり、動作時の品質 (失敗した世代は除外され、スコアは 0 ではありません) で計算されます。人間の好みは、TapVid よりも横並びの勝率です。相関関係は、six の競合システム を上回ります。TapVid は、すべての比較のスター トポロジ アンカーであるため、プロットされた点ではありません。
| アライメント (VBench フレーム品質 ↔ 人間の好み) | Spearmanρ |
|---|---|
| 全体的に | +0.89 |
| 1 つのシステムをアウトにしたままにする (最悪の場合) | +0.87 |
| プロフェッショナル | +0.94 |
| ニュース | +0.77 |
| マーケティング | +0.70 |
| ハウツー | +0.48 |
| 説明者 | −0.33 |
全体的な兆候は、2000 回のブートストラップ リサンプリングと 1 つのシステムを残した後も残ります。 n = 6 システムは形式的な重要性を制限します。 Explainer は、視聴者がフレームポリッシュよりもモーションに報酬を与える 1 つのセグメントであるため、フレーム品質メトリクスはそこでの別の手がかりを追跡します。すべての VBench コンポジットは、シーンごとの生のスコアから再計算され、ソース レポートと小数点まで一致します。
R 実行の来歴と >370 万件。 VBench-Long ( vbench2_beta_long at commit e946a8d ; VBench++、IEEE TPAMI 2025) は、人間によるラベルの比較が存在する前、2026 年 7 月 13 ~ 14 日に NVIDIA L4 GPU で実行されました。入力はシーンごとに正規化されているため、どのシステムにもエンコード アーティファクトが発生しません。720p キャップ (アップスケールなし)、1 つの均一な 24 fps フレーム グリッド、ほぼロスレスの再エンコード。ビデオごとに 6 つのディメンション。そのうち 4 つは *すべてのフレーム* でスコアを獲得し (各 24 モデル転送/秒)、モーションの滑らかさは 11.5/秒、ダイナミック度は 7.5/秒で、映像の 1 秒あたり 116 モデル転送になります。スコアリングされたビデオの 32,141 秒全体: 373 万フレームレベルのモデル評価 。長さをトリミングしたビルド (上記ではカウントされていない) の一貫性をさらに再チェックすると、ビデオの長さが比較を混乱させないことが確認されました。ネイティブ トリム デルタはすべて < 0.0025 です。
F · 複合スコアカード — 情報品質と 3 つの軸
フィールド相対 T スコア: 70 = これら 7 つのシステムの平均、10 ポイントごと = 1 SD。情報品質 = コンテンツ忠実度軸とビジュアル品質軸の等しい加重平均。美的嗜好はアリーナから派生し、情報軸の横に報告され、情報軸の内側では決してなく、情報軸とは逆に実行されます。全体的な品質、(コンテンツ + ビジュアル + 美的好み)/3 は、名前付きの情報密度の高いシナリオの見出しです。
全 25 シーン
| システム | 有益な品質 | 95% CI | 内容 | ビジュアル | 美的嗜好 |
|---|---|---|---|---|---|
| Fable 5 | 85.4 | [78.3, 92.1] | 82.6 | 88.2 | 52.3 |
| TapVid | 78.2 | [69.3, 86.6] | 77.1 | 79.2 | 61.7 |
| Remotion | 72.3 | [61.5, 82.2] | 76.6 | 68.1 | 69.2 |
| Hyperframes | 71.8 | [59.3, 83.0] | 73.3 | 70.2 | 68.1 |
| Veo | 64.8 | [51.7, 77.0] | 66.0 | 63.6 | 74.6 |
| Seedance | 61.3 | [46.8, 75.1] | 60.3 | 62.2 | 83.1 |
| LTX | 56.3 | [41.8, 70.8] | 54.1 | 58.5 | 81.0 |
情報密度の高いシーン (プロフェッショナル、ニュース、ハウツー、説明)
| システム | 全体的な品質 (C+V+P)/3 | 内容 | ビジュアル | 美的嗜好 | 有益な品質 |
|---|---|---|---|---|---|
| TapVid | 75.2 | 83.6 | 80.3 | 61.7 | 82.0 |
| Fable 5 | 75.0 | 82.8 | 88.1 | 54.2 | 85.5 |
| Seedance | 73.5 | 71.7 | 69.7 | 79.1 | 70.7 |
| LTX | 70.0 | 60.2 | 74.8 | 75.1 | 67.5 |
| Remotion | 69.7 | 77.5 | 65.9 | 65.7 | 71.7 |
| Hyperframes | 69.0 | 72.9 | 68.3 | 65.7 | 70.6 |
| Veo | 68.4 | 71.0 | 61.7 | 72.4 | 66.3 |
25 のシーンにわたるブートストラップ CI は広く重複しています。データがサポートする層は、Fable 5、TapVid、Remotion/Hyperframes、ピクセル トリオです。全体的な品質の TapVid ~ Fable 5 の差 (75.2 対 75.0) はノイズの範囲内です。このランキングは、方法 (PCA 対軸平均)、信頼性の重み付け、および関連性がグループ化される場所に対して堅牢です。 TapVid の美的好みは、アリーナのスター トポロジーによって 0.5 固定されています。競合他社にはユースケースごとの違いが存在します。
G · 事実の報道 — 両方のフレーム
全 25 シーン — 画面上で必要な事実を逐語的に読みやすく共有。 95% ブートストラップ CI。混合ロジット コントラスト。
| システム | 適用範囲 | 95% CI | Δ vs TapVid | 95% CI | 結果 |
|---|---|---|---|---|---|
| Fable 5 | 0.790 | [0.717, 0.860] | +0.094 | [−0.183, +0.370] | ネクタイ |
| TapVid | 0.773 | [0.699, 0.843] | — | ||
| Remotion | 0.759 | [0.668, 0.845] | −0.166 | [−0.417, +0.085] | ネクタイ |
| Hyperframes | 0.745 | [0.642, 0.842] | −0.199 | [−0.448, +0.050] | ネクタイ |
| Seedance | 0.611 | [0.506, 0.710] | −0.826 | [−1.052, −0.601] | 勝つ |
| Veo | 0.596 | [0.494, 0.697] | −0.867 | [−1.091, −0.642] | 勝つ |
| LTX | 0.541 | [0.433, 0.658] | −1.179 | [−1.400, −0.958] | 勝つ |
情報密度の高いシーン
| システム | 適用範囲 | 95% CI | Δ vs TapVid | 95% CI | 結果 |
|---|---|---|---|---|---|
| TapVid | 0.836 | [0.773, 0.890] | — | ||
| Fable 5 | 0.792 | [0.710, 0.863] | −0.291 | [−0.601, +0.020] | ネクタイ |
| Remotion | 0.765 | [0.669, 0.857] | −0.520 | [−0.801, −0.239] | 勝つ |
| Hyperframes | 0.727 | [0.607, 0.835] | −0.681 | [−0.952, −0.409] | 勝つ |
| Seedance | 0.677 | [0.578, 0.770] | −0.922 | [−1.182, −0.662] | 勝つ |
| Veo | 0.601 | [0.497, 0.714] | −1.213 | [−1.464, −0.963] | 勝つ |
| LTX | 0.545 | [0.418, 0.671] | −1.553 | [−1.798, −1.307] | 勝つ |
カバレッジ ↔ 配信: Pearson r = 0.70 (173 ビデオ全体)。プールされた OLS では、P(comprehend | on screen) = 0.96、オフスクリーンフロアは 0.36 になります。混合ロジットは一致します (0.945 / 0.30)。カバレッジの絶対レベルは評価者に依存します (D を参照)。システム間の比較は行われません。
H・TeachQuiz 情報配信 — 両方のフレーム
全 25 シーン — 典型的なシーン/質問における生の理解正解率、混合ロジット予測 P(正解)、およびコントラスト。
| システム | 生レート | 予測P | Δ vs TapVid | 95% CI | 結果 |
|---|---|---|---|---|---|
| Fable 5 | 0.821 | 0.868 | +0.243 | [−0.091, +0.576] | ネクタイ |
| Remotion | 0.812 | 0.857 | +0.147 | [−0.167, +0.461] | ネクタイ |
| TapVid | 0.795 | 0.838 | — | ||
| Hyperframes | 0.789 | 0.834 | −0.028 | [−0.330, +0.274] | ネクタイ |
| Veo | 0.785 | 0.830 | −0.052 | [−0.353, +0.249] | ネクタイ |
| LTX | 0.715 | 0.756 | −0.509 | [−0.786, −0.233] | 勝つ |
| Seedance | 0.691 | 0.730 | −0.647 | [−0.918, −0.377] | 勝つ |
情報密度の高いシーン
| システム | 生レート | Δ vs TapVid | 95% CI | 結果 |
|---|---|---|---|---|
| Fable 5 | 0.846 | +0.056 | [−0.342, +0.453] | ネクタイ |
| TapVid | 0.845 | — | ||
| Veo | 0.840 | +0.005 | [−0.368, +0.378] | ネクタイ |
| Remotion | 0.832 | −0.067 | [−0.433, +0.299] | ネクタイ |
| Hyperframes | 0.790 | −0.393 | [−0.731, −0.054] | 勝つ |
| Seedance | 0.786 | −0.423 | [−0.759, −0.087] | 勝つ |
| LTX | 0.752 | −0.650 | [−0.971, −0.329] | 勝つ |
配信は、この 7 システム フィールド (leave-one-out ゲイン / フィールドベースライン ロジット) に関連します。行政はオープンブックであり、その差は中央値の上限である 0.86 に向かって圧縮されている。 3 つの推定量 (生、ゲイン D、混合ロジット) は両方のフレームの順序に同意します。
I · T2VTextBench テキストの精度と T2VWorldBench の寸法
T2VTextBench テキスト精度 — [0,1] の 4 段階グレード。クラスターに強いコントラストと TapVid の比較。 * = 95% CI にはゼロが含まれません。
| システム | 全25枚 | 95% CI | 情報密度が高い | 95% CI | Δ全25 |
|---|---|---|---|---|---|
| Fable 5 | 0.783 | [0.714, 0.850] | 0.750 | [0.681, 0.825] | +0.062 |
| TapVid | 0.740 | [0.660, 0.820] | 0.769 | [0.675, 0.856] | — |
| Hyperframes | 0.700 | [0.615, 0.785] | 0.706 | [0.613, 0.794] | −0.009 |
| Remotion | 0.695 | [0.610, 0.785] | 0.688 | [0.594, 0.781] | −0.050 |
| Seedance | 0.640 | [0.535, 0.740] | 0.700 | [0.594, 0.806] | −0.087 |
| Veo | 0.630 | [0.530, 0.730] | 0.650 | [0.531, 0.762] | −0.090 |
| LTX | 0.580 | [0.500, 0.660] | 0.619 | [0.537, 0.694] | −0.145* |
XXQ20QXZ、全 25 シーン — 寸法および紙複合物ごとの平均グレード。 * = TapVid (クラスター堅牢な OLS) と比較して有意。
| システム | 品質 | リアリズム | 関連性 | 一貫性 | 複合 |
|---|---|---|---|---|---|
| Fable 5 | 0.900* | 0.909 | 0.891 | 0.909 | 0.902* |
| TapVid | 0.860 | 0.880 | 0.844 | 0.872 | 0.864 |
| Remotion | 0.800 | 0.860 | 0.860 | 0.824 | 0.836 |
| Hyperframes | 0.812 | 0.852 | 0.816 | 0.844 | 0.831 |
| Veo | 0.800 | 0.804 | 0.808 | 0.824 | 0.809 |
| Seedance | 0.808 | 0.808 | 0.772* | 0.796* | 0.796* |
| LTX | 0.792 | 0.784* | 0.688* | 0.792* | 0.764* |
コンポジットは内部的には有効です (Cronbach α = 0.91) が、コンテンツに面する 1 つの軸が折り畳まれています。関連性は、兄弟のビジュアル ディメンション (0.61 ~ 0.66) よりも配信/カバレッジ (+0.77) と相関しています。情報密度の高いフレーム: TapVid はあらゆる次元で 2 位を維持。 Fable 5 との品質と複合のギャップのみが依然として顕著です。
J · 美的嗜好 (アリーナ スタイル) — 両方のフレーム、両方の読み取り
Star トポロジ: すべての比較は、同じブリーフ上の 1 つの競合他社に対する TapVid です (296 件の比較)。勝率は同点を半分としてカウントします。 TapVidの無敗数は同点。両方とも報告されています。二項混合ロジットと 0.5 の非優先ラインからの評決。
全 25 シーン
| 対 | 勝率 | 95% CI | 無損失 | 95% CI | 評決 |
|---|---|---|---|---|---|
| Fable 5 | 0.587 | [0.482, 0.683] | 0.696 | [0.577, 0.808] | TapVidは負けない* |
| Hyperframes | 0.440 | [0.347, 0.531] | 0.560 | [0.458, 0.667] | 投げ上げる |
| Remotion | 0.430 | [0.338, 0.519] | 0.540 | [0.433, 0.643] | 投げ上げる |
| Veo | 0.380 | [0.297, 0.464] | 0.480 | [0.389, 0.571] | 投げ上げる |
| LTX | 0.320 | [0.217, 0.417] | 0.380 | [0.267, 0.500] | TapVid 負け* |
| Seedance | 0.300 | [0.206, 0.393] | 0.400 | [0.286, 0.500] | TapVid 負け* |
| 全体的に | 0.407 | [0.35, 0.47] | 0.507 | [0.44, 0.57] | フィールドよりも優先度が低い* |
情報密度の高いシーン — 全体勝率 0.432 [0.37, 0.50]、無敗 0.530: 同等。重大な非損失赤字は消滅します。厳密に決定的な比較では、依然として Seedance のみが大幅に優先されます。
| 対 | 勝率 | 95% CI | 無損失 | 95% CI |
|---|---|---|---|---|
| Fable 5 | 0.569 | [0.450, 0.692] | 0.667 | [0.542, 0.800] |
| Remotion | 0.463 | [0.354, 0.568] | 0.575 | [0.458, 0.692] |
| Hyperframes | 0.463 | [0.361, 0.563] | 0.600 | [0.500, 0.714] |
| Veo | 0.400 | [0.304, 0.500] | 0.500 | [0.385, 0.607] |
| LTX | 0.375 | [0.250, 0.500] | 0.425 | [0.292, 0.545] |
| Seedance | 0.338 | [0.225, 0.450] | 0.425 | [0.286, 0.567] |
優先度は経験的に有益な指標と直交しています。各指標における TapVid のビデオごとの優位性とアリーナの結果を相関させると、-0.22 ~ -0.01 (n = 148 セル) となり、すべて負かゼロに近づきます。無損失は有利な読み取り値です (比較の 20% は同点です)。そのため、両方が表示されます。
K · ユースケースごとの順位 — TapVid の勝敗
ユースケースごとの TapVid に対する有意な勝敗 (95% 間隔はゼロを除く)。セルには競合他社がリストされます。 「—」 = なし。
| ユースケース | カバレッジ: TapVid ビート | に負ける | 配信:TapVidビート | に負ける |
|---|---|---|---|---|
| プロフェッショナル | Fable 5、Hyperframes、Veo、LTX | — | Fable 5、LTX | Seedance |
| ニュース | Remotion、Veo、LTX、Seedance | — | Remotion、LTX、Seedance | — |
| ハウツー | Remotion、Hyperframes、Veo、LTX | — | Veo | — |
| 説明者 | LTX、Seedance | Fable 5 | Seedance | Fable 5 |
| マーケティング | Seedance | Fable 5、Remotion、Hyperframes | Seedance | Fable 5、Remotion、Hyperframes |
どこでも勝てるシステムはありません: Seedance はプロフェッショナル向けの配信では首位に立っていますが、マーケティングでは崩壊しています (P 0.30)。 Veo はニュース配信で首位に並んでいますが、ハウツー分野では最悪です。 TapVid のユースケース別のアリーナ勝率: プロフェッショナル 0.450、ニュース 0.433、説明者 0.429、ハウツー 0.417、マーケティング 0.308。 TapVid のユースケース別の総合情報品質: ニュース 87、ハウツー 89、説明 81、プロフェッショナル 71、マーケティング 63。
10
TapVid を試してください
提供されたアセットと承認されたコピーを、レビュー可能な説明ビデオのワークフローに変換します。 TapVid を探索。
11
参考文献と引用
サポートされている評価方法には、T2VTextBench、T2VWorldBench、および Text-to-Video Human Evaluation Protocol が含まれます。
Recommended citation (APA): Law, D. (2026, September 6). AI video benchmark: Accuracy vs aesthetics (Version 1.0). TapVid Research. https://tapvid.ai/blog/information-dense-ai-video-benchmark
@techreport{law2026aiVideoBenchmark,
author = {Derek Law},
title = {AI Video Benchmark: Accuracy vs Aesthetics},
institution = {TapVid Research},
year = {2026},
month = {September},
url = {https://tapvid.ai/blog/information-dense-ai-video-benchmark},
note = {Version 1.0; July 2026 benchmark run}
}12
著者について

Derek Law は、TapVid の CTO 兼共同創設者です。彼の研究は、AI に対する制約は知能ではなくインターフェイスであるという単純な理論に基づいています。以前は、Amazon AGI の Alexa AI および GenUI に取り組んでいました。



