TL;DR
Bei informationsreichen Videos ist TapVid führend.
Dieser KI-Video-Benchmark wurde für Videos entwickelt, die informieren – belehrend, redaktionell, erklärend – und nicht unterhaltsam sein sollen. In den Bereichen mit hoher Informationsdichte, auf die es abzielt, liegt TapVid eindeutig an der Spitze bei der sachlichen Berichterstattung, belegt den ersten Platz bei der Informationsbereitstellung TeachQuiz und ist in sieben Systemen Spitzenreiter bei der Gesamtqualität. Die unabhängige, branchenübliche automatisierte Metrik VBench reproduziert die Präferenz des menschlichen Gremiums und bestätigt die Genauigkeit der Bewertung.
01
Urteil zum KI-Video-Benchmark: Zuerst kommt es auf den Inhalt an, auf den es ankommt – überall sonst ausgewogen
Informationsreiche Szenen – Beruf, Nachrichten, Anleitungen, Bildung – sind die Zieldomäne des Benchmarks, und dort gewinnt TapVid. In allen 25 Szenen ist TapVid der klare 2. von 7 in der Informationsqualität und der einzige Code-Renderer, der auf beiden Informationsachsen stark ist .
Gesamtqualität – informativ + ästhetisch 75,2 T Nr. 1 von 7 für Arbeiten mit hoher Informationsdichte – das einzige System, das auf allen Achsen gleichzeitig hoch ist.
Aesthetic Preference vs. Fable 5, der Informationsführer 58,7% Wird dem besten Informationssystem der Branche bei der Parallelansicht vorgezogen – und verliert deutlich nicht.
Faktische Berichterstattung – informationsreiche Szenen 83,6% Der klare Feldführer. Deutlich vor 5 von 6 Mitbewerbern, wenn es darum geht, die erforderlichen Fakten auf den Bildschirm zu bringen.
TeachQuiz Informationsübermittlung – informationsreiche Szenen 84,5% Gleicher Platz. Zuschauer beantworten Verständnisfragen sowohl nach TapVid als auch nach jedem anderen System in diesem Bereich.
GESAMTQUALITÄT – INFORMATIV + ÄSTHETISCH · INFORMATIONSREICHE SZENEN
*(Inhaltstreue + visuelle Qualität + ästhetische Präferenz) / 3 · feldrelativer T-Score (70 = Feldmittelwert, 10 = 1 SD)*

Bide Frames werden überall gemeldet. Headline Claims verwenden den informationsdichten Frame (UC1–UC4) als Benchmark-Ziele – hier gezeigt, wo TapVid die Gesamtqualität anführt; In allen 25 Szenen belegt TapVid den 2. von 7 Plätzen in der Informationsqualität (T 78 gegenüber 85 von Fable 5). Vollständige Scorecards mit Konfidenzintervallen finden Sie im Anhang.
DER MASSSTAB
02
Entwickelt für Videos, die informieren und nicht unterhalten sollen
Jeder der fünf Anwendungsfälle basiert auf realem Quellmaterial und wird anhand von fünf absichtsgesteuerten Szenen bewertet: Der Auftrag spezifiziert die Fakten, mit denen ein Betrachter davonkommen sollte, und menschliche Annotatoren messen, ob dies der Fall ist. Das Ziel sind Videos mit hoher Informationsdichte und klarer Absicht – lehrreich, redaktionell, erklärend – und kein ästhetischer oder unterhaltsamer Inhalt.
DAS FELD – SIEBEN SYSTEME, ZWEI PARADIGMEN
| System | Geschirr / Modell | Familie |
|---|---|---|
| TapVid | Code-gerendertes Video | Code-Rendering |
| Fable 5 | Claude Code · Fable 5 | Code-Rendering |
| Code-Rendering H | Claude Code · Sonnet 5 | Code-Rendering |
| Code-Rendering R | Codex · GPT-5.5 | Code-Rendering |
| Pixeldiffusion L | offizielles Studio · Pro-Modus, 1080p | Pixeldiffusion |
| Seedance | Seedance 2.0 · Jimeng · VIP-Modus, 720p | Pixeldiffusion |
| Veo | Veo 3.1 · Google Flow · Qualitätsmodus, 720p | Pixeldiffusion |
Alle Systeme haben zugegriffen 2026 6.–12. Juli: Lokal ausgeführte Tools sind seit dem 6. Juli auf ihre neueste Version eingefroren, gehostete Systeme auf dem neuesten Flaggschiffmodell auf ihrer offiziellen Plattform – jedes System mit seiner maximalen Qualitätseinstellung, 16:9. Genaue Versionspins mit Quellen finden Sie in Anhang A.
FÜNF ANWENDUNGSFÄLLE, QUELLENMATERIAL AUS DER REALEN WELT
| Anwendungsfall | Quellenmaterial |
|---|---|
| Professionelles Unternehmen / Selbstlernen | GDPval-Aufgaben – Professionelle und technische Dienstleistungen, Regierung, Fertigung, Finanzen |
| Nachrichtenredaktion | 2025–26 umfasst: Economist, FT, Bloomberg, Nature, Science |
| How-To-Lebensstil | Top #HowTo YouTube – Basteln/Heimwerken, Kunst, Fitness, Denkweise, Rätsel |
| Erklärer-Ausbildung | Meistgesehenes „AP-Examen erklärt“ – Geschichte, Psychologie, Analysis, Biologie, Geographie |
| Produktmarketing / Vertrieb | Branchenübergreifende Einführungsvideos zu den wertvollsten Unternehmen der NASDAQ |
Vor der Generierung festgelegte Stichprobenregeln. Jeder Anwendungsfall zeichnet seine fünf Szenen nach einer vordefinierten Regel: Clustern des Quellpools, zufällige Stichprobe einer pro Cluster (Top-Branchen, Veröffentlichungen, Inhaltskategorien, AP-Themen, NASDAQ-Sektoren). Bei jedem Briefing handelt es sich um eine ausführliche Eingabeaufforderung zur Videogenerierung, die die gesamte Informationsnutzlast enthält, erstellt und eingefroren wird, bevor ein System irgendetwas generiert. Die Checkliste mit den erforderlichen Fakten (168 Fakten im gesamten Benchmark) und die Verständnisfragen (149) wurden gleichzeitig verfasst und von Menschen überprüft. Ein vollständig ausgearbeitetes Beispiel finden Sie in Anhang B.
WIE DAS FELD GELAUFEN WURDE – EIN SCHUSS, DIESELBE BRIEF, TOP-EINSTELLUNGEN
- Identische Eingaben: Jedes System erhielt wörtlich die gleichen kurzen Anweisungen – kein pro-System-Prompt-Engineering.
- Best-of-1: eine Generation pro Szene, nie kuratiert; Schwere Fehler wurden bis zum Erfolg wiederholt (höchstens 3 Wiederholungsversuche beobachtet).
- Dauer wie generiert: vom Auftrag festgelegte Ziellängen; Die tatsächliche Leistung jedes Systems wird unverändert verwendet (System durchschnittlich 1,1–4,2 Minuten).
- Die 173/175-Buchhaltung: Die Sicherheitsregeln von Fable 5 lehnten 2 seiner 25 Schriftsätze ab. Anstatt seinen Opus-Fallback zu ersetzen, haben wir Fable 5 nur für seine eigenen 23 Generationen bewertet – kein Konkurrent wurde stillschweigend geschwächt, und fehlende Zellen werden aus den Nennern gestrichen, nie angerechnet.
DAS ANNOTATOR-PANEL – UNABHÄNGIG, BLIND, VOLLSTÄNDIG GEKREUZT
- 12 unabhängige Kommentatoren , ausgelagerte Freiberufler, die keinem Systemteam angehören – jeder mit einem Master-Abschluss oder höher von einer der 50 besten Universitäten des QS-Weltrankings, mit zertifizierten Englischkenntnissen.
- Blind durchgängig:-Videos werden unbeschriftet in zufälliger Reihenfolge präsentiert; Den Kommentatoren wurde nie mitgeteilt, welches System ein Video produziert hat.
- Vollständig gekreuzt: alle 12 Kommentatoren bewerteten alle 7 Systeme, zwei Bewerter pro Video – ein strenger oder nachsichtiger Bewerter bewegt jedes System gleichermaßen und kann einen Vergleich nicht verzerren.
- Bewusstes Ansehen, nicht Klickarbeit: ~20 Minuten Anmerkung pro Video von weniger als 5 Minuten, bezahlt zum 4-fachen lokalen Mindestlohn. Kommentiert vom 13.–15. Juli 2026.
Metriken, die auf veröffentlichten Methoden basieren und von Menschen gemessen werden
Jedes Video wird von einem vollständig gekreuzten Kommentatorgremium bewertet – jeder Kommentator hat jedes System bewertet, sodass ein strenger oder nachsichtiger Bewerter alle Systeme gleichermaßen anpasst und einen Vergleich nicht verzerren kann. Das Gremium produzierte 6.760 menschliche Anmerkungen über fünf Stationen, die auf veröffentlichten Methoden basieren – drei davon wurden von Experten begutachtet bei ICML, WACV und IEEE TPAMI / CVPR – und jedes Video wird *auch* mit dem automatisierten Modell VBench bewertet: >3,7 Millionen Modellbewertungen auf Frame-Ebene .
- TeachQuiz Informationsbereitstellung (Code2Video, ICML 2026 · arXiv:2510.01174) – wie viele der beabsichtigten Informationen ein Betrachter tatsächlich erhält.
- Faktische Berichterstattung – Wie viele der Fakten, die das Briefing erfordert, werden wörtlich und lesbar auf dem Bildschirm angezeigt?
- T2VTextBench Textgenauigkeit (arXiv:2505.04946) – Korrektheit der Titel, Zahlen und Beschriftungen auf dem Bildschirm.
- T2VWorldBench ( WACV 2026 · arXiv:2507.18107) – vier Qualitätsdimensionen: Videoqualität, Realismus, Relevanz, Konsistenz.
- Aesthetic Preference – Arena-ähnliche, direkte Vergleiche mit TapVid.
- VBench (VBench++, IEEE TPAMI 2025 · Original VBench, CVPR 2024 Highlight · das Modell hinter der öffentlichen HuggingFace-Bestenliste) – branchenübliche automatisierte Videoqualitätssuite, >3.7 Millionen Modellbewertungen auf Frame-Ebene .
VBench ist eine unabhängige, maschinenbasierte Gegenprüfung unserer menschlichen Anmerkungen: Die Bewertung der Rahmenqualität reproduziert unser menschliches Präferenzranking, sodass sich die beiden Instrumente gegenseitig bestätigen (Ergebnis 05).
Die Rankings sind robust gegenüber der Art und Weise, wie Sie sie berechnen: drei unabhängige Schätzer – Rohraten, ausgelassener Informationsgewinn und Logistikmodelle mit gemischten Effekten – erzeugen die identische Reihenfolge, und zuverlässigkeitsgewichtete Varianten und PCA-Varianten lassen sie unverändert. Da sich Marketing wie eine andere Aufgabenfamilie als die vier Anwendungsfälle mit hoher Informationsdichte verhält, wird jedes Ergebnis in zwei Frames gemeldet: alle 25 Szenen und der informationsreiche Frame (Professional, News, How-To, Explainer). Vollständige Tabellen für beide finden Sie im Anhang.
FINDING 01 · DER VOLLFELD-FRAME
03
Informatives Video ist eine Kompromissgrenze – und TapVid hält den Balancepunkt
WIN Das Feld ist eine Kompromissgrenze: Bei der Informationsqualität lautet die Reihenfolge Fable 5 > TapVid > alle anderen; Bei der ästhetischen Präferenz wird die Reihenfolge genau umgekehrt. TapVid ist der einzige Code-Renderer mit hohen Werten auf beiden Informationsachsen – Inhaltstreue 77, visuelle Qualität 79, jeweils 2. von 7 – der Gleichgewichtspunkt der Grenze.
Die ästhetische Präferenz wird im Arena-Stil gemessen – zwei Videos desselben Briefings nebeneinander – und erfasst etwas, was die informativen Rubriken nicht tun: Ihre Korrelation mit jeder informativen Metrik ist negativ bis null (–0,22 bis –0,01). Code-Renderer kaufen informative Qualität; Pixeldiffusion erkauft ästhetischen Reiz. Die Grenze unten stellt alle sieben Systeme in beiden Frames in diesen Kompromiss.
DIE INFORMATIV-ÄSTHETISCHE GRENZE
*x: Informationsqualität · y: Ästhetische Präferenz · feldrelative T-Scores (70 = Feldmittelwert) · Szenen mit hoher Informationsdichte*

TapVid ist das einzige System im grünen Quadranten – sehr informativ und ästhetisch bevorzugt – in beiden Frames. Bei Szenen mit hoher Informationsdichte bewegt sich TapVid zum Ellbogen der Grenze (Informationsqualität 82, innerhalb von 3,5 T vom Spitzenreiter), während der ästhetische Rand der Pixeldiffusion auf Parität schrumpft; In allen 25 Szenen liegen Seedance und Pixeldiffusion L über dem angezeigten Präferenzbereich. Die ästhetische Präferenz wird neben der Informationsqualität angegeben und nie gemittelt.
ÄSTHETISCHE GEWINNRATE VON TAPVID – NEBENEINANDER ANSEHEN, ALLE 25 SZENEN
*Anteil der direkten Vergleiche, bei denen TapVid gewinnt (Unentschieden zählen zur Hälfte) · ×100*

Über 50 = Zuschauer bevorzugen TapVid. Signifikanz aus den Mixed-Logit-Tests ohne Verlust/entscheidender Sieg; Die vollständigen CIs und der verlustfreie Rahmen finden Sie im Anhang.
ÄSTHETISCHE GEWINNRATE VON TAPVID – NEBENEINANDER ANSEHEN, INFORMATIONSREICHE SZENEN
*Anteil der direkten Vergleiche, bei denen TapVid gewinnt (Unentschieden zählen zur Hälfte) · ×100*

Im Zielbereich des Benchmarks schrumpfen die ästhetischen Defizite auf das Gleiche – nur Seedance bleibt bei entscheidenden Vergleichen deutlich bevorzugt.
SIEG Wird Seite an Seite gegen Fable 5 gezeigt – den informativen Spitzenreiter des Feldes – die Zuschauer bevorzugen TapVid. Gewinnrate 58,7 %, und TapVid verliert deutlich nicht (P = 0,72). Das System, das TapVid bei qualitativ hochwertigen Composites übertrifft, verliert vor den Zuschauern.
GEWINNEN Bei informationsreichen Arbeiten gibt TapVid bei der inhaltlichen Führung keine Kompromisse bei der Ästhetik ein. Die Gesamtverlustfreiheit steigt auf 53,0 % – Parität – und kein Pixeldiffusionssystem bietet dort einen signifikanten Verlustfreiheitsvorteil. Im Vergleich zu Googles Veo: Vorsprung bei der Informationsqualität (78 vs. 65), deutlicher Vorsprung bei der Abdeckung und ein Präferenzwechsel.
EINSCHRÄNKUNG In allen 25 Szenen ist die ästhetische Präferenz eine echte Schwäche. Die Gesamtgewinnrate von TapVid liegt bei 40,7 % – deutlich unter der 50 %-Keine-Präferenz-Linie – und wird deutlich weniger bevorzugt als Pixel-diffusion L und Seedance, die Schlusslichter der informativen Rangliste. Die Umkehrung ist der Paradigmen-Kompromiss, der sich auf das Marketing konzentriert; Der Glattstellungsplan befasst sich direkt damit.
FINDING 02 · FAKTENBERICHT
04
Fakten auf den Bildschirm zu bringen, ist die verbindliche Vorgabe – und TapVid schafft es am besten
GEWINNEN Bei Szenen mit hoher Informationsdichte bringt TapVid 83,6 % der erforderlichen Fakten auf den Bildschirm – der absolute Spitzenreiter, deutlich vor 5 von 6 Mitbewerbern. In allen 25 Szenen liegt es statistisch gleichauf mit dem Spitzenreiter Fable 5 und deutlich vor jedem Pixeldiffusionssystem.
Die Abdeckung ist die anspruchsvollste Messgröße des Benchmarks: Das Feld teilt sich in zwei klare Ebenen auf, wobei die vier Code-Renderer (74–79 % der Daten auf dem Bildschirm) deutlich von den drei Pixeldiffusionssystemen (54–61 %) entfernt sind.
FAKTENABDECKUNG – ANTEIL DER ERFORDERLICHEN FAKTEN AUF DEM BILDSCHIRM
*Mittelwert · 95 % Bootstrap-CI über Szenen · Szenen mit hoher Informationsdichte · ×100*

Info-dichter Rahmen: TapVid 83,6 [77,3–89,0] führt direkt ; Die Lücke zu jedem System außer Fable 5 ist statistisch signifikant (gemischt-logitisches 95 %-KI schließt 0 aus). Alle 25 Frames: Fable 5 79,0, TapVid 77,3 – ein statistischer Gleichstand – wobei Seedance, Veo und Pixeldiffusion L in beiden Frames deutlich zurückliegen.
ABDECKUNG FÖRDERT DIE LIEFERUNG – EIN PUNKT PRO VIDEO, 173 VIDEOS
*x: Sachliche Berichterstattung · y: TeachQuiz Informationslieferung (korrekter Tarif) · ×100*

GEWINNEN Sobald eine Tatsache auf dem Bildschirm erscheint, erfassen die Zuschauer sie in etwa 95 % der Fälle. Abdeckung und Auslieferung korrelieren bei r = 0,70 über 173 Videos hinweg, und die angepasste Linie reicht von einer No-Fact-Untergrenze von 36 % bis zu einer Bildschirmobergrenze von 96 %. Das Verstehen ist fast ein gelöster Schritt – das Spiel ist Berichterstattung, und TapVid spielt es am besten.
ABDECKUNG NACH ANWENDUNGSFALL – MODELLVORHERSAGES P(FAKTEN AUF DEM BILDSCHIRM)
*mixed-logit vorhergesagte Wahrscheinlichkeit pro Anwendungsfall · ×100*

GEWINNEN Sie TapVid-Leads oder -Gleichstände für den Coverage-Lead in vier von fünf Anwendungsfällen. Es liegt mit Abstand an der Spitze von News (81,9) und How-To (86,7) und liegt bei Professional deutlich vor vier Mitbewerbern – darunter dem Gesamtführer Fable 5.
EINSCHRÄNKUNG Marketing ist die Ausnahme. Die Abdeckung von TapVid sinkt dort auf 53,8 % – das Schlusslicht der Code-Renderer, hinter Fable 5, Code-render R und Code-render H. Die gleiche Lücke prägt die Marketing-Spalte jeder Metrik; Der Glattstellungsplan behandelt es als ein Problem.
FINDING 03 · TEACHQUIZ-INFORMATIONSLIEFERUNG
05
Zuschauer lernen von TapVid genauso viel wie von jedem anderen System auf diesem Gebiet
GEWINNEN Bei Szenen mit hoher Informationsdichte belegt TapVid den ersten Platz bei der Informationsbereitstellung TeachQuiz – Zuschauer beantworten 84,5 % der Verständnisfragen richtig – und übertrifft drei Systeme (Code-Render H, Seedance, Pixeldiffusion L) deutlich. Über alle 25 Szenen hinweg sind die Top 5 statistisch untrennbar miteinander verbunden; TapVid liegt deutlich vor Pixel-Diffusion L und Seedance.
Die Bereitstellung erfolgt nach dem TeachQuiz-Protokoll: Nach dem Ansehen beantworten die Kommentatoren Multiple-Choice-Fragen zu den Fakten, die im Briefing gefordert werden, und jedes Video wird anhand einer Feldbasislinie pro Frage bewertet. Drei unabhängige Schätzer – rohe korrekte Rate, ausgelassener Informationsgewinn und ein Logit mit gemischten Effekten – einigen sich auf die Reihenfolge.
TEACHQUIZ-INFORMATIONSLIEFERUNG – VERSTEHEN, RICHTIG
*rohe korrekte Rate · Signifikanz vs. TapVid aus Mixed-Effects-Logit · Szenen mit hoher Informationsdichte · ×100*

TapVid ist in beiden Frames erstklassig. Vollständige Gewinn-/Unentschieden-/Verlusttabellen pro Anwendungsfall finden Sie im Anhang.
LIEFERUNG NACH ANWENDUNGSFALL – VERSTEHEN RICHTIG-RATE
*rohe korrekte Rate pro Anwendungsfall · Balken mit 95 % Bootstrap-CI über die Szenen des Anwendungsfalls · ×100*

TapVid ist Spitzenreiter bei News (88,3) und How-To (89,7) – laut Mixed-Logit-Inferenz übertrifft es Code-render R, Pixel-diffusion L und Seedance bei News und Veo bei How-To deutlich und verliert in beiden Punkten ohne Gegentreffer. Professional und Explainer liegen im Mittelfeld; Marketing ist die Lücke, auf die der Abschlussplan abzielt. Jeder Anwendungsfall basiert auf 5 Szenen, daher sind die CIs breit gefächert; Signifikanzaufrufe stammen aus dem gemischten Logit pro Anwendungsfall im Anhang .
T2VTEXTBENCH-TEXTGENAUIGKEIT – BILDSCHIRMTITEL, ZAHLEN UND ETIKETTEN
*Vierstufiger Grad zugeordnet zu [0,1] · 95 % Bootstrap-CI · Szenen mit hoher Informationsdichte · ×100*

WIN TapVid rendert Bildschirmtext am besten in Szenen mit hohem Informationsgehalt. Über alle 25 Szenen hinweg ist die Spitze des Feldes statistisch untrennbar miteinander verbunden.
FINDING 04 · VISUELLE QUALITÄT
06
Statistisch in drei von vier visuellen Dimensionen mit dem Marktführer gleichauf
GEWINNEN Bei der menschlichen T2VWorldBench-Bewertung liegt TapVid statistisch gesehen mit dem Spitzenreiter Fable 5 in Bezug auf Realismus, Relevanz und Konsistenz zusammen – in beiden Frames – und belegt im vierdimensionalen Verbund einen klaren zweiten von sieben Punkten (86,4), deutlich vor Seedance und Pixeldiffusion L. Was auch immer TapVid rendert, es wird sauber gerendert.
Die vier Dimensionen werden vom gekreuzten Annotator-Panel anhand der Dimensionen-Rubriken mit 1–5 bewertet. Der einzige wesentliche visuelle Unterschied zum Fable 5 ist die Videoqualität (86,0 vs. 90,0); Die anderen drei Dimensionen sind statistische Bindungen.
T2VWORLDBENCH – VIER DIMENSIONEN, ALLE 25 SZENEN
*Mittelwert · 95 % Bootstrap-KI über Szenen · ×100 · * = signifikant vs. TapVid*

TapVid belegt den 2. Platz in Bezug auf Qualität, Realismus und Konsistenz, den 3. Platz in Bezug auf Relevanz (hinter Fable 5 und Code-render R). Relevanz – „sagt es die richtigen Dinge?“ – verhält sich als Inhaltsdimension und wird mit den oben genannten Inhaltsmetriken analysiert.
GEWINNEN Wo die Bewerter völlig einer Meinung sind, erhält TapVid die höchste Bewertung. Bei der Teilmenge mit exakter Übereinstimmung steigt die Videoqualität von TapVid auf 0,97 und überholt damit Fable 5 – die klaren Siege von TapVid sind eindeutig.
FINDING 05 · UNABHÄNGIGE BESTÄTIGUNG
07
Menschliche Anmerkungen, validiert durch die automatisierte Industriestandardmetrik VBench
CHECK Wenn Sie dieselben 25 Szenen blind ausführen, bewertet VBench – das automatisierte Modell hinter der öffentlichen HuggingFace-Bestenliste – jedes Video unabhängig vom menschlichen Panel. Es ordnet die Systeme auf die gleiche Weise wie die Side-by-Side-Präferenz unserer Annotatoren. Spearman ρ = +0,89 zwischen VBench Rahmenqualität und menschlichen Vorlieben; +0,87 ohne ein beliebiges System. Die menschliche Präferenzachse ist kein Artefakt unserer Bewerter – eine unabhängige, auf Papier basierende Maschinenmetrik landet in derselben Reihenfolge.
Ein weit verbreitetes automatisiertes Modell, das ohne Kenntnis der menschlichen Bezeichnungen berechnet wurde, stimmt mit dem menschlichen Gremium hinsichtlich der Rangfolge der Systeme überein – ein Beweis dafür, dass die Bewertung ein echtes, reproduzierbares Signal und keine Eigenheiten des Bewerters erfasst.
AUTOMATISIERTE UND MENSCHLICHE INSTRUMENTE stimmen überein – JEDES GEZEIGTE VIDEO
*x: VBench Bildqualität pro Video (automatisiert) · y: menschliche Gewinnrate jedes Systems · 141 System×Szenenvideos, gefärbt nach System · ×100*

EJeder kleine Punkt ist die automatisierte Bildqualität eines Videos, gefärbt durch das System und platziert an der menschlichen Win-Rate dieses Systems; Die großen Punkte sind die Systemmittelwerte. Die farbigen Wolken stapeln sich in der Reihenfolge der Win-Rate und ihre Zentren steigen von links nach rechts – automatisierte Rahmenqualität und menschliche Präferenz ordnen die Systeme zusammen ( Spearman ρ = +0,89 ). Systeme bleiben unbenannt: Es geht um die Übereinstimmung der beiden Instrumente, nicht um die Position eines einzelnen Systems.
SRC VBench (VBench++, IEEE TPAMI 2025 · Original VBench, CVPR 2024 Highlight) ist der standardmäßige automatisierte Videoqualitäts-Benchmark hinter der öffentlichen HuggingFace-Bestenliste und bewertet sechs Dimensionen pro Clip. Es wurde am 13. und 14. Juli mit dem offiziellen VBench-Long-Codepfad (Commit e946a8d) auf dedizierten GPUs ausgeführt – abgeschlossen, bevor ein Vergleich mit den menschlichen Etiketten möglich war. Der Rahmenqualitätskopf (Ästhetik + Bildqualität) ist die hier verwendete ästhetische Gegenprüfung, die die Qualität berechnet, wenn sie funktioniert, sodass eine fehlgeschlagene Generierung die Systembewertung nicht verzerrt. Jedes Komposit wurde aus den Rohwerten pro Szene neu berechnet und entspricht dem Quellbericht auf die Dezimalzahl genau; Das vollständige Laufprotokoll befindet sich in Anhang A.
DER NÄCHSTE GEWINNT ZUM SCHLIESSEN
08
Zwei Ziele: Marketinginhalte und Ästhetik ohne informativen Handel
Beide Lücken sind gemessen, lokalisiert und von dem, was bereits funktioniert, trennbar. Keiner von beiden fordert, die Abdeckungs- und Bereitstellungsmaschine anzutasten, die den Bereich der Informationsdichte gewinnt.
TAPVID NACH ANWENDUNGSFALL – DIE MARKETING-LÜCKE IST DER INHALT, NICHT DAS Rendering
*Content Fidelity vs. Visual Quality Composite · feldrelativer T-Score · pro Anwendungsfall*

Im Bereich Marketing bleibt die visuelle Qualität von TapVid bei 75, während die Inhaltstreue auf 51 sinkt – die Videos werden sauber gerendert, aber es fehlen erforderliche Fakten. Überall sonst bewegen sich die beiden Achsen gemeinsam bei 68–93.
DAS ÄSTHETISCHE PROGRAMM – BEWEGEN SIE SICH AUF DER ÄSTHETISCHEN ACHSE NACH OBEN, ÜBERNEHMEN SIE DIE INFORMATIVE FÜHRUNG
*x: Informative Qualität · y: Ästhetische Präferenz · T-Scores · alle 25 Szenen*

Da die Präferenz orthogonal zu jeder Qualitätsmetrik ist, ist die Bewegung gerade nach oben – die Erhöhung von Bewegung, Glanz und Attraktivität verschiebt TapVid in die leere obere rechte Ecke der Grenze, ohne etwas von ihrem informativen Vorsprung zu verschwenden.
WEITER Win to close Nr. 1 – Marketinginhalte. Der Zusammenbruch ist die Bereitstellung von Fakten in Marketingszenen, nicht das Rendern – eine gezielte Erweiterung der Coverage-Engine, die bereits vier Anwendungsfälle ermöglicht, kein Neuaufbau. Durch den Abschluss wird der Vorsprung von TapVid im Bereich der informationsdichten Berichterstattung in einen Gesamtvorsprung umgewandelt: Ohne Marketing liegt TapVid bei der Berichterstattung bereits an der Spitze von fünf von sechs Systemen.
NÄCHSTER Sieg zum Abschluss Nr. 2 – ästhetische Präferenz vs. Pixeldiffusion, ohne den Informationsvorsprung zurückzugeben. Präferenz ist empirisch orthogonal zu jeder Qualitätsmetrik, daher ist der Abschluss ein eigenes Programm – Bewegung, Politur, Anklang – und kein Kompromiss, der gegen Berichterstattung oder Lieferung erzwungen wird. Der informationsdichte Rahmen zeigt die Obergrenze: Wo der Inhalt dicht ist, erreicht TapVid bereits die Präferenzparität und behält gleichzeitig die inhaltliche Führung.
APPENDIX
09
Eingefrorenes Protokoll, gesetzte Statistiken, jedes Ergebnis vollständig
Systemversionen sind tagesaktuell mit Quellen versehen; Sampling-Regeln und Fakten-Checklisten wurden festgelegt, bevor es überhaupt ein Video gab; Das Annotator-Panel war blind und vollständig gekreuzt (A–B). Drei unabhängige Schätzer einigen sich auf jede Reihenfolge, alle Zufälligkeiten werden gesetzt und ein unabhängiger Wiederholungslauf reproduziert jedes Artefakt (C–E). Vollständige Bestenlisten mit Konfidenzintervallen für jede Metrik in beiden Frames (F–K). Δ-Spalten sind Mixed-Logit-Log-Odds-Kontraste gegenüber TapVid, sofern nicht anders angegeben; WIN / LOSS = das 95 %-Intervall schließt Null aus, aus der Perspektive von TapVid; TIE = nicht.
SCHLÜSSEL Systembenennung. Der Hauptteil dieses Berichts bezieht sich anhand anonymisierter Bezeichnungen auf drei Systeme. Ihre wahren Identitäten werden hier nur angegeben: Code-Render H = Hyperframes · Code-Render R = Remotion · Pixeldiffusion L = LTX. In den folgenden Tabellen werden die tatsächlichen Produktnamen verwendet.
A · Experimentprotokoll – Versionen, Zeitleiste, Anmerkungsbuch
Timeline (2026) Ausrichtung Mensch↔VBench 14.–16. Juli. Die VBench-Bewertung wurde abgeschlossen, bevor es einen Vergleich mit menschlichen Markierungen gab.
Versionspins – lokal ausgeführte Tools in ihrer neuesten Version seit dem Einfrieren am 6. Juli; gehostete Plattformen beim neuesten Flaggschiffmodell während des Fensters. Alle 16:9, maximale Qualitätseinstellungen, Storyboard-/Planungsfunktionen, wie von jeder Plattform geliefert.
| System | Version · Plattform · Einstellungen | Quelle |
|---|---|---|
| TapVid | interner Build-Strom am Zugriffsfenster | — |
| Fable 5 | Claude Code 2.1.202 · Modell claude-fable-5 (angekündigt am 9. Juni, erneut bereitgestellt am 1. Juli) · Standardeinstellungen | Ankündigung · Änderungsprotokoll |
| Hyperframes | v0.7.37 · Claude Code · Sonnet 5 (veröffentlicht am 30. Juni) · Standardeinstellungen | Veröffentlichung · Sonnet 5 |
| Remotion | v4.0.485 · Codex CLI 0.142.5 · GPT-5.5 (angekündigt am 23. April; GPT-5.6 wurde am 9. Juli nach dem Einfrieren ausgeliefert) · Standardeinstellungen | Veröffentlichung · Codex · GPT-5.5 |
| Veo | Veo 3.1 (angekündigt am 15.10.2025) · Google Flow, Storyboard-Planung von Flow · Qualitätsmodus, 720p | Ankündigung · Modi-Dokument |
| LTX | LTX-2.3 (veröffentlicht im März 2026) · LTX Studio, Storyboard-Planung von LTX Studio mit GPT-Image-2 · Pro-Modus, 1080p | Veröffentlichung · GPT-Image-2 |
| Seedance | Seedance 2.0 (angekündigt am 12. Februar) · Jimeng – ByteDances offizielle Verbraucherplattform – Agentenmodus, Story-Film-Skill · VIP-Modus (höchste Qualität), 720p | Ankündigung · Jimeng |
Prompt-Herkunft. Alle 25 Briefs und ihre Faktenchecklisten wurden mit Claude Opus auf Claude Code verfasst, von Menschen überprüft und vor Beginn der Generierung eingefroren. Wenn die KI-Autorenschaft die Schriftsätze auf die Sprache eines Systems ausrichtet, wäre der Nutznießer Fable 5 – ein Konkurrent – und nicht TapVid.
Das Hauptbuch mit 6.760 Anmerkungen. Eine Zeile pro Annotator × Szene × System × Element: Faktencheck 2.326 (168 Fakten) + TeachQuiz Verständnis 2.062 (149 Fragen) + T2VWorldBench vier Dimensionen 1.384 (346 Video×Bewertereinheiten × 4) + Textgenauigkeit 692 (346 Einheiten × Klasse + Junk-Flag) + Side-by-Side-Präferenz 296 = 6,760 . Jede Zählung kann aus dem Rohexport neu berechnet werden.
VBench run. Offizieller VBench-Long-Code (vbench2_beta_long, commit e946a8d) auf 5× NVIDIA L4, ein Shard pro Anwendungsfall, ~6 h Wall; Umgebung angeheftet und von Grund auf auf einer neuen Instanz reproduziert; Die Ergebnis-JSONs pro Zelle und die Ausführungsprotokolle werden beibehalten. Eingabenormalisierung und die >3,7M-Auswertungsarithmetik: Anhang E .
B · Ausgearbeitetes Beispiel – ein Briefing durch die gesamte Pipeline
Der Brief (How-To-Szene 1): *„Das Papier, das knallt – Ein Origami-Zappelspielzeug ohne Kleber“*, Ziel 5:00, 16:9. Wie jedes Briefing handelt es sich um ein vollständig spezifiziertes Produktionsdokument, das für alle sieben Systeme identisch ist: Art Direction mit einer exakten Hex-Palette, Beleuchtung und Kamerasprache, eine Einstellungsliste für neun Szenen mit vollständigem Voice-Over-Text und Bewegungsnotizen pro Szene sowie eine einzige Master-Eingabeaufforderung – z. * „… die drei farbcodierten Papiere (Indigo 6×6 äußere Box, bernsteinfarbener 5×5 Innenknopf, violette 9×4 Feder), die gemeinsame Blintz-Faltung, die beide Boxen bildet… der klebefreie Verschluss, bei dem Klappen unter angrenzende Kanten gesteckt werden…“* Die gesamte Informationsnutzlast befindet sich im Schriftsatz, sodass Abdeckungsfehler dem System und nicht der Eingabeaufforderung zuzuschreiben sind.
Seine Checkliste mit erforderlichen Fakten (mit dem Briefing verfasst, vor der Generierung eingefroren; Stationselemente auf Englisch gerendert). Eine Tatsache wird nur dann gutgeschrieben, wenn sie wörtlich und lesbar auf dem Bildschirm erscheint – Kommentatoren können Bild für Bild wiedergeben:
- Äußeres Kartonpapier: 6×6 cm
- Inneres Knopfpapier: 5×5 cm
- Federpapier: 9×4 cm
- Das Versprechen ohne Kleber: kein Kleber, kein Klebeband, nirgendwo
- Die Schlüsselfalte mit Namen: blintzfalte (Ecken zur Mitte)
A TeachQuiz Verständnisitem (beantwortet nach dem Ansehen; das „Video hat dies nicht bereitgestellt“-Escape wird falsch bewertet): *„Was ist die Schlüsselfalte, die beide Boxen gemeinsam haben?“* – Talfalte / blintzfalte (Ecken zur Mitte) / Squashfalte / das Video lieferte diese Informationen nicht.
Wie es abgeschnitten hat. Die gleichen Elemente haben an anderer Stelle in dieser Szene echte Fehler gemacht – einschließlich der Faltnamenfrage –, bei der es sich um die Diskriminierung handelt, auf deren Messung der Benchmark ausgelegt ist.
C · Statistische Methoden – Schätzer, Seeds und unabhängige Nachverifizierung
Estimators. Binäre Stationen (Abdeckung, Lieferung): Bayesianischer gemischter logistischer Regressionswert ~ System + (1|Szene) + (1|Element), TapVid als Referenz. Abgestufte Stationen (Text, Abmessungen): Szenencluster-robustes OLS mit Annotator-Fixeffekten. Zustellung zusätzlich durch Weglassen eines einmaligen Informationsgewinns. Drei unabhängige Schätzer – Rohraten, Informationsgewinn, gemischter Logit – erzeugen in beiden Frames die identische Systemordnung.
Uncertainty. 95 % CIs aus dem Bootstrap auf Szenenebene (Neuabtastung der 25 Szenen, B = 3000, fester Startwert); Signifikanz = das 95 %-Intervall schließt Null aus; Ergebnisse werden als Stufen gemeldet, bei denen sich die Intervalle überschneiden, niemals als Ränge mit falscher Genauigkeit. VBench: Skillings-Mack-Omnibus pro Dimension (Methodenunterschiede signifikant bei p = 8e-18 bis 1e-9 über 23 vollständige Szenenblöcke), post-hoc-paarweiser Wilcoxon-Vorzeichenrang mit Holm-Korrektur. Human↔VBench-Alignment: Spearman-Rangkorrelation, Stresstest durch 2000-fachen Bootstrap, Leave-One-System-Out und Permutationstests (alle gesetzt).
Reproduzierbarkeit – unabhängig erneut überprüft. Die gesamte Zufälligkeit der Analyse wird geseedet, Rohdaten (der vollständige Annotationsexport und die VBench-Bewertungen pro Szene) werden mit der Analyse geliefert und jede Metrik verfügt über ein eigenes Reproduktionsskript mit einem Befehl unter angehefteten Abhängigkeiten (Python 3.14.5 · Numpy 2.5.1 · Pandas 3.0.3 · scipy 1.18.0 · statsmodels 0.14.6 · matplotlib 3.11.0 · openpyxl 3.1.5). Bei einer unabhängigen erneuten Ausführung in einer neuen Umgebung wurden alle 55 festgeschriebenen Ergebnisartefakte neu generiert: jedes deterministische Ausgabebyte war identisch, alle 15 Ziffern waren pixelidentisch und die Variationsspalten mit gemischten Modellen stimmten mit den logarithmischen Quoten ≤6e-06 überein – mit , wobei sich das Signifikanzurteil nirgends änderte .
D · Zuverlässigkeit, Methode und Einschränkungen
Rater-Robustheit durch Design. Das Panel ist vollständig gekreuzt – jeder Annotator hat jedes System bewertet – sodass die Rater-Striktheit einen Vergleich zwischen Systemen nicht beeinflussen kann. Das Hinzufügen eines Annotator-Zufallseffekts verschiebt Kontraste um höchstens 0,16 (Lieferung) / 0,31 (Abdeckung) Log-Odds ohne Signifikanzumkehr.
Inter-Rater-Übereinstimmung pro Metrik. Lieferung: 73,6 % Rohübereinstimmung, Gwet AC1 0,59. Abdeckung: 67,2 %, AC1 0,42 – der Annotator-Effekt ist die dominierende Belästigungsquelle (SD 0,98), daher ist der absolute Abdeckungsgrad bewerterabhängig, auch wenn dies beim Vergleich nicht der Fall ist. Text: innerhalb einer Note 91 %, gewichtet κ 0,27 – die lauteste Bewertung. WorldBench-Dimensionen: innerhalb von eins 79–85 %, gewichtet κ 0,24–0,35. Ästhetische Präferenz: gewichtet κ 0,07 – aggregierte Gewinnraten über 296 Vergleiche sind aussagekräftig; Einzelurteile sind dies nicht, was auch die Orthogonalitätskorrelationen gegen Null abschwächt.
Limitations. Die Lieferung ist relativ zu diesem Sieben-System-Feld und nicht über Benchmark-Läufe mit einem anderen Feld hinweg vergleichbar. Das Verstehen wird im offenen Buch verwaltet; Die mittlere Obergrenze von 0,86 komprimiert die Systemunterschiede, und ein Closed-Book-Run ist die Schärfung mit der höchsten Hebelwirkung. 25 Szenen (5 pro Anwendungsfall) mit 2 Bewertern pro Video, gebunden an die Auflösung pro Anwendungsfall – die oberen Ebenen sind nicht vollständig getrennt. In der Berichterstattung wird eine Tatsache nur dann anerkannt, wenn sie wörtlich und lesbar ist. Mixed-Logit-Intervalle sind variierend (antikonservativ); Die großen signifikanten Kontraste sind sicher. Die Sterntopologie der Arena unterstützt keine Konkurrenz-gegen-Konkurrent-Rangliste und keine absolute ästhetische Bewertung. Bei T-Scores handelt es sich um feldbezogene Annehmlichkeiten, nicht um absolute Noten. Eine Station mit Fakten pro Sekunde Bandbreite ist definiert, wurde aber in dieser Runde nicht berechnet.
E · VBench ↔ menschliche Ausrichtung – Methode
Instruments. VBench Die Rahmenqualität ist der Mittelwert der Dimensionen „Ästhetische Qualität“ und „Bildqualität“ des Modells, berechnet quality-when-it-works (eine fehlgeschlagene Generation wird ausgeschlossen, nicht mit 0 bewertet). Die menschliche Präferenz ist die Side-by-Side-Siegrate gegenüber TapVid. Die Korrelation besteht über die sechs Konkurrenzsysteme – TapVid ist der Sterntopologie-Anker jedes Vergleichs und daher kein aufgetragener Punkt.
| Ausrichtung (VBench Rahmenqualität ↔ menschliche Präferenz) | Spearman ρ |
|---|---|
| Insgesamt | +0.89 |
| Leave-One-System-Out (Worst Case) | +0.87 |
| Professionell | +0.94 |
| Nachrichten | +0.77 |
| Marketing | +0.70 |
| Anleitung | +0.48 |
| Erklärer | −0.33 |
Das Gesamtbild übersteht 2000-faches Bootstrap-Resampling und Leave-One-System-Out; n = 6 Systemgrenzen formale Bedeutung. „Explainer“ ist das Segment, in dem Zuschauer Bewegung über Frame-Polish belohnen, sodass die Frame-Qualitätsmetrik dort einen anderen Hinweis verfolgt. Jedes VBench-Komposit wurde aus den Rohwerten pro Szene neu berechnet und entspricht dem Quellbericht auf die Dezimalzahl genau.
Run-Herkunft und >3,7 Mio. Anzahl. VBench-Long ( vbench2_beta_long at commit e946a8d ; VBench++, IEEE TPAMI 2025) wurde am 13. und 14. Juli 2026 auf NVIDIA L4-GPUs ausgeführt – bevor es einen Vergleich mit menschlichen Bezeichnungen gab. Die Eingaben wurden pro Szene normalisiert, sodass kein System ein Codierungsartefakt erhält: 720p-Obergrenze (nie hochskaliert), ein einheitliches 24-fps-Frame-Raster, nahezu verlustfreie Neucodierung. Sechs Dimensionen pro Video; Vier von ihnen punkten *jedes Bild* (jeweils 24 Vorwärtsbewegungen/s), die Bewegungsglätte beträgt 11,5/s und der Dynamikgrad 7,5/s – 116 Vorwärtsbewegungen pro Sekunde des Filmmaterials. Über die 32.141 Sekunden des aufgezeichneten Videos: 3,73 Millionen Modellbewertungen auf Frame-Ebene . Eine weitere erneute Konsistenzprüfung bei längengekürzten Builds (oben nicht gezählt) bestätigte, dass die Videolänge den Vergleich nicht verfälscht: Native-Trim-Deltas alle < 0,0025.
F · Zusammengesetzte Scorecard – Informationsqualität und die drei Achsen
Feldbezogene T-Scores: 70 = der Mittelwert dieser sieben Systeme, alle 10 Punkte = 1 SD. Informationsqualität = gleichgewichtiger Mittelwert der Achsen „Content Fidelity“ und „Visual Quality“. Die ästhetische Präferenz wird aus der Arena abgeleitet und neben den Informationsachsen angegeben, niemals innerhalb dieser – sie verläuft umgekehrt zu ihnen. Gesamtqualität (Inhalt + visuelle + ästhetische Präferenz)/3 ist die Überschrift des Szenarios mit hoher Informationsdichte.
Alle 25 Szenen
| System | Informative Qualität | 95 % KI | Inhalt | Visuell | Ästhetische Präferenz |
|---|---|---|---|---|---|
| Fable 5 | 85.4 | [78.3, 92.1] | 82.6 | 88.2 | 52.3 |
| TapVid | 78.2 | [69.3, 86.6] | 77.1 | 79.2 | 61.7 |
| Remotion | 72.3 | [61.5, 82.2] | 76.6 | 68.1 | 69.2 |
| Hyperframes | 71.8 | [59.3, 83.0] | 73.3 | 70.2 | 68.1 |
| Veo | 64.8 | [51.7, 77.0] | 66.0 | 63.6 | 74.6 |
| Seedance | 61.3 | [46.8, 75.1] | 60.3 | 62.2 | 83.1 |
| LTX | 56.3 | [41.8, 70.8] | 54.1 | 58.5 | 81.0 |
Szenen mit hoher Informationsdichte (Professionell, Nachrichten, Anleitungen, Erklärungen)
| System | Gesamtqualität (C+V+P)/3 | Inhalt | Visuell | Ästhetische Präferenz | Informative Qualität |
|---|---|---|---|---|---|
| TapVid | 75.2 | 83.6 | 80.3 | 61.7 | 82.0 |
| Fable 5 | 75.0 | 82.8 | 88.1 | 54.2 | 85.5 |
| Seedance | 73.5 | 71.7 | 69.7 | 79.1 | 70.7 |
| LTX | 70.0 | 60.2 | 74.8 | 75.1 | 67.5 |
| Remotion | 69.7 | 77.5 | 65.9 | 65.7 | 71.7 |
| Hyperframes | 69.0 | 72.9 | 68.3 | 65.7 | 70.6 |
| Veo | 68.4 | 71.0 | 61.7 | 72.4 | 66.3 |
Bootstrap-CIs über die 25 Szenen überschneiden sich stark: Die von den Daten unterstützten Ebenen sind Fable 5 · TapVid · Remotion/Hyperframes · das Pixeltrio. Der Gesamtqualitätsunterschied zwischen TapVid und Fable 5 (75,2 vs. 75,0) liegt innerhalb des Rauschens. Das Ranking ist robust gegenüber der Methode (PCA vs. Achsenmittelwert), der Zuverlässigkeitsgewichtung und der Gruppierung der Relevanz. Die ästhetische Präferenz von TapVid ist zu 0,5 in der Sterntopologie der Arena verankert; Die Variation pro Anwendungsfall bleibt bei der Konkurrenz bestehen.
G · Sachliche Berichterstattung – beide Frames
Alle 25 Szenen – Anteil der erforderlichen Fakten auf dem Bildschirm, wörtlich und lesbar; 95 % Bootstrap-CI; Mixed-Logit-Kontrast.
| System | Abdeckung | 95 % KI | Δ vs. TapVid | 95 % KI | Ergebnis |
|---|---|---|---|---|---|
| Fable 5 | 0.790 | [0.717, 0.860] | +0.094 | [−0.183, +0.370] | KRAWATTE |
| TapVid | 0.773 | [0.699, 0.843] | — | ||
| Remotion | 0.759 | [0.668, 0.845] | −0.166 | [−0.417, +0.085] | KRAWATTE |
| Hyperframes | 0.745 | [0.642, 0.842] | −0.199 | [−0.448, +0.050] | KRAWATTE |
| Seedance | 0.611 | [0.506, 0.710] | −0.826 | [−1.052, −0.601] | GEWINNEN |
| Veo | 0.596 | [0.494, 0.697] | −0.867 | [−1.091, −0.642] | GEWINNEN |
| LTX | 0.541 | [0.433, 0.658] | −1.179 | [−1.400, −0.958] | GEWINNEN |
Szenen mit hoher Informationsdichte
| System | Abdeckung | 95 % KI | Δ vs. TapVid | 95 % KI | Ergebnis |
|---|---|---|---|---|---|
| TapVid | 0.836 | [0.773, 0.890] | — | ||
| Fable 5 | 0.792 | [0.710, 0.863] | −0.291 | [−0.601, +0.020] | KRAWATTE |
| Remotion | 0.765 | [0.669, 0.857] | −0.520 | [−0.801, −0.239] | GEWINNEN |
| Hyperframes | 0.727 | [0.607, 0.835] | −0.681 | [−0.952, −0.409] | GEWINNEN |
| Seedance | 0.677 | [0.578, 0.770] | −0.922 | [−1.182, −0.662] | GEWINNEN |
| Veo | 0.601 | [0.497, 0.714] | −1.213 | [−1.464, −0.963] | GEWINNEN |
| LTX | 0.545 | [0.418, 0.671] | −1.553 | [−1.798, −1.307] | GEWINNEN |
Abdeckung ↔ Bereitstellung: Pearson r = 0,70 über 173 Videos; gepooltes OLS ergibt P(verstanden | auf dem Bildschirm) = 0,96 und einen Boden außerhalb des Bildschirms von 0,36; ein gemischter Logit stimmt zu (0,945 / 0,30). Die absolute Höhe der Deckung hängt vom Rater ab (siehe D); Der Systemvergleich ist nicht der Fall.
H · TeachQuiz Informationslieferung – beide Rahmen
Alle 25 Szenen – Rohverständnis-Korrekturrate, Mixed-Logit-Vorhersage P (richtig) bei einer typischen Szene/Frage und Kontrast.
| System | Rohpreis | Voraussichtlich P | Δ vs. TapVid | 95 % KI | Ergebnis |
|---|---|---|---|---|---|
| Fable 5 | 0.821 | 0.868 | +0.243 | [−0.091, +0.576] | KRAWATTE |
| Remotion | 0.812 | 0.857 | +0.147 | [−0.167, +0.461] | KRAWATTE |
| TapVid | 0.795 | 0.838 | — | ||
| Hyperframes | 0.789 | 0.834 | −0.028 | [−0.330, +0.274] | KRAWATTE |
| Veo | 0.785 | 0.830 | −0.052 | [−0.353, +0.249] | KRAWATTE |
| LTX | 0.715 | 0.756 | −0.509 | [−0.786, −0.233] | GEWINNEN |
| Seedance | 0.691 | 0.730 | −0.647 | [−0.918, −0.377] | GEWINNEN |
Szenen mit hoher Informationsdichte
| System | Rohpreis | Δ vs. TapVid | 95 % KI | Ergebnis |
|---|---|---|---|---|
| Fable 5 | 0.846 | +0.056 | [−0.342, +0.453] | KRAWATTE |
| TapVid | 0.845 | — | ||
| Veo | 0.840 | +0.005 | [−0.368, +0.378] | KRAWATTE |
| Remotion | 0.832 | −0.067 | [−0.433, +0.299] | KRAWATTE |
| Hyperframes | 0.790 | −0.393 | [−0.731, −0.054] | GEWINNEN |
| Seedance | 0.786 | −0.423 | [−0.759, −0.087] | GEWINNEN |
| LTX | 0.752 | −0.650 | [−0.971, −0.329] | GEWINNEN |
Die Lieferung erfolgt relativ zu diesem Sieben-System-Feld (Leave-One-Out-Gain / Field-Baseline-Logit); Die Verwaltung erfolgt nach dem Open-Book-Prinzip, was die Unterschiede in Richtung der mittleren Obergrenze von 0,86 komprimiert. Drei Schätzer (Raw, Gain D, Mixed Logit) einigen sich auf die Reihenfolge in beiden Frames.
I · T2VTextBench Textgenauigkeit und T2VWorldBench Abmessungen
T2VTextBench Textgenauigkeit – vierstufige Note auf [0,1]; Cluster-robuster Kontrast vs. TapVid. * = 95 %-KI ohne Null.
| System | Alle 25 | 95 % KI | Informationsreich | 95 % KI | Δ alle-25 |
|---|---|---|---|---|---|
| Fable 5 | 0.783 | [0.714, 0.850] | 0.750 | [0.681, 0.825] | +0.062 |
| TapVid | 0.740 | [0.660, 0.820] | 0.769 | [0.675, 0.856] | — |
| Hyperframes | 0.700 | [0.615, 0.785] | 0.706 | [0.613, 0.794] | −0.009 |
| Remotion | 0.695 | [0.610, 0.785] | 0.688 | [0.594, 0.781] | −0.050 |
| Seedance | 0.640 | [0.535, 0.740] | 0.700 | [0.594, 0.806] | −0.087 |
| Veo | 0.630 | [0.530, 0.730] | 0.650 | [0.531, 0.762] | −0.090 |
| LTX | 0.580 | [0.500, 0.660] | 0.619 | [0.537, 0.694] | −0.145* |
T2VWorldBench, alle 25 Szenen – mittlerer Grad pro Dimension und Papierzusammensetzung. * = signifikant vs. TapVid (Cluster-robustes OLS).
| System | Qualität | Realismus | Relevanz | Konsistenz | Zusammengesetzt |
|---|---|---|---|---|---|
| Fable 5 | 0.900* | 0.909 | 0.891 | 0.909 | 0.902* |
| TapVid | 0.860 | 0.880 | 0.844 | 0.872 | 0.864 |
| Remotion | 0.800 | 0.860 | 0.860 | 0.824 | 0.836 |
| Hyperframes | 0.812 | 0.852 | 0.816 | 0.844 | 0.831 |
| Veo | 0.800 | 0.804 | 0.808 | 0.824 | 0.809 |
| Seedance | 0.808 | 0.808 | 0.772* | 0.796* | 0.796* |
| LTX | 0.792 | 0.784* | 0.688* | 0.792* | 0.764* |
Die Zusammensetzung ist intern gültig (Cronbach α = 0,91), faltet jedoch eine inhaltsbezogene Achse: Relevanz korreliert stärker mit Lieferung/Abdeckung (+0,77) als mit den visuellen Dimensionen seiner Geschwister (0,61–0,66). Informationsreicher Rahmen: TapVid bleibt in jeder Dimension Zweiter; Lediglich die Qualitäts- und Composite-Abstände zu Fable 5 bleiben signifikant.
J · Ästhetische Präferenz (Arena-Stil) – beide Frames, beide Lesarten
Star-Topologie: Jeder Vergleich ist TapVid gegen einen Konkurrenten im gleichen Auftrag (296 Vergleiche). Die Gewinnrate zählt Unentschieden als die Hälfte; Gleichstand ohne Verlust für TapVid; beides wird gemeldet. Urteile aus binomialen gemischten Logits im Vergleich zur 0,5-No-Preference-Linie.
Alle 25 Szenen
| vs | Gewinnrate | 95 % KI | Kein Verlust | 95 % KI | Urteil |
|---|---|---|---|---|---|
| Fable 5 | 0.587 | [0.482, 0.683] | 0.696 | [0.577, 0.808] | TapVid verliert nicht* |
| Hyperframes | 0.440 | [0.347, 0.531] | 0.560 | [0.458, 0.667] | werfen |
| Remotion | 0.430 | [0.338, 0.519] | 0.540 | [0.433, 0.643] | werfen |
| Veo | 0.380 | [0.297, 0.464] | 0.480 | [0.389, 0.571] | werfen |
| LTX | 0.320 | [0.217, 0.417] | 0.380 | [0.267, 0.500] | TapVid verliert* |
| Seedance | 0.300 | [0.206, 0.393] | 0.400 | [0.286, 0.500] | TapVid verliert* |
| Insgesamt | 0.407 | [0.35, 0.47] | 0.507 | [0.44, 0.57] | weniger bevorzugt als das Feld* |
Szenen mit hoher Informationsdichte – Gesamtgewinnrate 0,432 [0,37, 0,50], Nichtverlust 0,530: Parität. Die erheblichen verlustfreien Defizite verschwinden; Bei strengen Entscheidungsvergleichen bleibt nur Seedance deutlich bevorzugt.
| vs | Gewinnrate | 95 % KI | Kein Verlust | 95 % KI |
|---|---|---|---|---|
| Fable 5 | 0.569 | [0.450, 0.692] | 0.667 | [0.542, 0.800] |
| Remotion | 0.463 | [0.354, 0.568] | 0.575 | [0.458, 0.692] |
| Hyperframes | 0.463 | [0.361, 0.563] | 0.600 | [0.500, 0.714] |
| Veo | 0.400 | [0.304, 0.500] | 0.500 | [0.385, 0.607] |
| LTX | 0.375 | [0.250, 0.500] | 0.425 | [0.292, 0.545] |
| Seedance | 0.338 | [0.225, 0.450] | 0.425 | [0.286, 0.567] |
Die Präferenz ist empirisch orthogonal zu den informativen Metriken: Die Korrelation des TapVid-Vorteils pro Video bei jeder Metrik mit dem Arena-Ergebnis ergibt −0,22 bis −0,01 (n = 148 Zellen) – alles negativ oder nahe Null. „Nicht-Niederlage“ ist die positive Lesart (20 % der Vergleiche sind Unentschieden); Aus diesem Grund werden beide angezeigt.
K · Rangliste pro Anwendungsfall – wobei TapVid gewinnt und verliert
Signifikante Gewinne/Verluste im Vergleich zu TapVid pro Anwendungsfall (95 %-Intervall ohne Null). Zellen listen Konkurrenten auf; „-“ = keine.
| Anwendungsfall | Abdeckung: TapVid schlägt | verliert gegen | Lieferung: TapVid schlägt | verliert gegen |
|---|---|---|---|---|
| Professionell | Fable 5, Hyperframes, Veo, LTX | — | Fable 5, LTX | Seedance |
| Nachrichten | Remotion, Veo, LTX, Seedance | — | Remotion, LTX, Seedance | — |
| Anleitung | Remotion, Hyperframes, Veo, LTX | — | Veo | — |
| Erklärer | LTX, Seedance | Fable 5 | Seedance | Fable 5 |
| Marketing | Seedance | Fable 5, Remotion, Hyperframes | Seedance | Fable 5, Remotion, Hyperframes |
Kein System gewinnt überall: Seedance führt bei der professionellen Bereitstellung, bricht jedoch beim Marketing ein (P 0,30); Veo knüpft an die Spitze der Nachrichtenübermittlung an, ist aber bei den Anleitungen der schlechteste Anbieter. TapVids Arena-Gewinnrate nach Anwendungsfall: Professional 0,450, News 0,433, Explainer 0,429, How-To 0,417, Marketing 0,308. Zusammengesetzte Informationsqualität von TapVid nach Anwendungsfall: News 87, How-To 89, Explainer 81, Professional 71, Marketing 63.
10
Versuchen Sie es mit TapVid
Verwandeln Sie bereitgestellte Assets und genehmigte Kopien in einen überprüfbaren Erklärvideo-Workflow. TapVid erkunden.
11
Referenzen und Zitate
Zu den unterstützenden Bewertungsmethoden gehören T2VTextBench, T2VWorldBench und das Text-to-Video Human Evaluation Protocol.
Recommended citation (APA): Law, D. (2026, September 6). AI video benchmark: Accuracy vs aesthetics (Version 1.0). TapVid Research. https://tapvid.ai/blog/information-dense-ai-video-benchmark
@techreport{law2026aiVideoBenchmark,
author = {Derek Law},
title = {AI Video Benchmark: Accuracy vs Aesthetics},
institution = {TapVid Research},
year = {2026},
month = {September},
url = {https://tapvid.ai/blog/information-dense-ai-video-benchmark},
note = {Version 1.0; July 2026 benchmark run}
}12
Über den Autor

Derek Law ist CTO und Mitbegründer von TapVid. Seine Arbeit wird von einer einfachen These geleitet: Die Einschränkung der KI ist die Schnittstelle, nicht die Intelligenz. Zuvor arbeitete er an Alexa AI und GenUI für Amazon AGI.



