TapVid
    API & MCPPreiseBlogÜber uns
    Blog›KI-Video-Benchmark: Genauigkeit vs. Ästhetik
    Zurück zum Blog

    KI-Video-Benchmark: Genauigkeit vs. Ästhetik

    Sehen Sie, was 6.760 Blindbewertungen über die sachliche Berichterstattung, das Zuschauerverständnis, die visuelle Qualität und die Ästhetik von KI-generierten Videos verraten.

    Forschung
    Derek LawDerek Law7. September 2026 · 29 Min. Lesezeit7. Sept. 2026 · 29 Min. LesezeitDiscord
    Derek LawDerek LawCTO & Co-founder, TapVid

    Vernetze dich mit dem Autor, triff andere Video-Creator und sieh dir praxisnahe Tutorials an.

    Unserem Discord beitreten
    7. September 202629 Min. Lesezeit
    KI-Video-Benchmark zum Vergleich von Genauigkeit, Verständnis, visueller Qualität und Ästhetik auf sieben Systemen
    Zusammenfassen mit6 Assistenten
    ChatGPTPerplexityTapVidvideoClaudeGeminiGrok
    Videos direkt mit deinem KI-Agenten erstellenTapVid API & MCP verbinden→

    In diesem Artikel

    1. 01Urteil zum KI-Video-Benchmark: Zuerst kommt es auf den Inhalt an, auf den es ankommt – überall sonst ausgewogen
    2. 02Entwickelt für Videos, die informieren und nicht unterhalten sollen
    3. 03Informatives Video ist eine Kompromissgrenze – und TapVid hält den Balancepunkt
    4. 04Fakten auf den Bildschirm zu bringen, ist die verbindliche Vorgabe – und TapVid schafft es am besten
    5. 05Zuschauer lernen von TapVid genauso viel wie von jedem anderen System auf diesem Gebiet
    6. 06Statistisch in drei von vier visuellen Dimensionen mit dem Marktführer gleichauf
    7. 07Menschliche Anmerkungen, validiert durch die automatisierte Industriestandardmetrik VBench
    8. 08Zwei Ziele: Marketinginhalte und Ästhetik ohne informativen Handel
    9. 09Eingefrorenes Protokoll, gesetzte Statistiken, jedes Ergebnis vollständig
    10. 10Versuchen Sie es mit TapVid
    11. 11Referenzen und Zitate
    12. 12Über den Autor
    Zusammenfassen mitAPI & MCP →
    ChatGPTPerplexityTapVidClaudeGeminiGrok

    TL;DR

    Bei informationsreichen Videos ist TapVid führend.

    Dieser KI-Video-Benchmark wurde für Videos entwickelt, die informieren – belehrend, redaktionell, erklärend – und nicht unterhaltsam sein sollen. In den Bereichen mit hoher Informationsdichte, auf die es abzielt, liegt TapVid eindeutig an der Spitze bei der sachlichen Berichterstattung, belegt den ersten Platz bei der Informationsbereitstellung TeachQuiz und ist in sieben Systemen Spitzenreiter bei der Gesamtqualität. Die unabhängige, branchenübliche automatisierte Metrik VBench reproduziert die Präferenz des menschlichen Gremiums und bestätigt die Genauigkeit der Bewertung.

    01

    Urteil zum KI-Video-Benchmark: Zuerst kommt es auf den Inhalt an, auf den es ankommt – überall sonst ausgewogen

    Informationsreiche Szenen – Beruf, Nachrichten, Anleitungen, Bildung – sind die Zieldomäne des Benchmarks, und dort gewinnt TapVid. In allen 25 Szenen ist TapVid der klare 2. von 7 in der Informationsqualität und der einzige Code-Renderer, der auf beiden Informationsachsen stark ist .

    Gesamtqualität – informativ + ästhetisch 75,2 T Nr. 1 von 7 für Arbeiten mit hoher Informationsdichte – das einzige System, das auf allen Achsen gleichzeitig hoch ist.

    Aesthetic Preference vs. Fable 5, der Informationsführer 58,7% Wird dem besten Informationssystem der Branche bei der Parallelansicht vorgezogen – und verliert deutlich nicht.

    Faktische Berichterstattung – informationsreiche Szenen 83,6% Der klare Feldführer. Deutlich vor 5 von 6 Mitbewerbern, wenn es darum geht, die erforderlichen Fakten auf den Bildschirm zu bringen.

    TeachQuiz Informationsübermittlung – informationsreiche Szenen 84,5% Gleicher Platz. Zuschauer beantworten Verständnisfragen sowohl nach TapVid als auch nach jedem anderen System in diesem Bereich.

    GESAMTQUALITÄT – INFORMATIV + ÄSTHETISCH · INFORMATIONSREICHE SZENEN

    *(Inhaltstreue + visuelle Qualität + ästhetische Präferenz) / 3 · feldrelativer T-Score (70 = Feldmittelwert, 10 = 1 SD)*

    GESAMTQUALITÄT – INFORMATIV + ÄSTHETISCH · INFORMATIONSREICHE SZENEN
    GESAMTQUALITÄT – INFORMATIV + ÄSTHETISCH · INFORMATIONSREICHE SZENEN

    Bide Frames werden überall gemeldet. Headline Claims verwenden den informationsdichten Frame (UC1–UC4) als Benchmark-Ziele – hier gezeigt, wo TapVid die Gesamtqualität anführt; In allen 25 Szenen belegt TapVid den 2. von 7 Plätzen in der Informationsqualität (T 78 gegenüber 85 von Fable 5). Vollständige Scorecards mit Konfidenzintervallen finden Sie im Anhang.

    DER MASSSTAB

    02

    Entwickelt für Videos, die informieren und nicht unterhalten sollen

    Jeder der fünf Anwendungsfälle basiert auf realem Quellmaterial und wird anhand von fünf absichtsgesteuerten Szenen bewertet: Der Auftrag spezifiziert die Fakten, mit denen ein Betrachter davonkommen sollte, und menschliche Annotatoren messen, ob dies der Fall ist. Das Ziel sind Videos mit hoher Informationsdichte und klarer Absicht – lehrreich, redaktionell, erklärend – und kein ästhetischer oder unterhaltsamer Inhalt.

    DAS FELD – SIEBEN SYSTEME, ZWEI PARADIGMEN

    SystemGeschirr / ModellFamilie
    TapVidCode-gerendertes VideoCode-Rendering
    Fable 5Claude Code · Fable 5Code-Rendering
    Code-Rendering HClaude Code · Sonnet 5Code-Rendering
    Code-Rendering RCodex · GPT-5.5Code-Rendering
    Pixeldiffusion Loffizielles Studio · Pro-Modus, 1080pPixeldiffusion
    SeedanceSeedance 2.0 · Jimeng · VIP-Modus, 720pPixeldiffusion
    VeoVeo 3.1 · Google Flow · Qualitätsmodus, 720pPixeldiffusion

    Alle Systeme haben zugegriffen 2026 6.–12. Juli: Lokal ausgeführte Tools sind seit dem 6. Juli auf ihre neueste Version eingefroren, gehostete Systeme auf dem neuesten Flaggschiffmodell auf ihrer offiziellen Plattform – jedes System mit seiner maximalen Qualitätseinstellung, 16:9. Genaue Versionspins mit Quellen finden Sie in Anhang A.

    FÜNF ANWENDUNGSFÄLLE, QUELLENMATERIAL AUS DER REALEN WELT

    AnwendungsfallQuellenmaterial
    Professionelles Unternehmen / SelbstlernenGDPval-Aufgaben – Professionelle und technische Dienstleistungen, Regierung, Fertigung, Finanzen
    Nachrichtenredaktion2025–26 umfasst: Economist, FT, Bloomberg, Nature, Science
    How-To-LebensstilTop #HowTo YouTube – Basteln/Heimwerken, Kunst, Fitness, Denkweise, Rätsel
    Erklärer-AusbildungMeistgesehenes „AP-Examen erklärt“ – Geschichte, Psychologie, Analysis, Biologie, Geographie
    Produktmarketing / VertriebBranchenübergreifende Einführungsvideos zu den wertvollsten Unternehmen der NASDAQ

    Vor der Generierung festgelegte Stichprobenregeln. Jeder Anwendungsfall zeichnet seine fünf Szenen nach einer vordefinierten Regel: Clustern des Quellpools, zufällige Stichprobe einer pro Cluster (Top-Branchen, Veröffentlichungen, Inhaltskategorien, AP-Themen, NASDAQ-Sektoren). Bei jedem Briefing handelt es sich um eine ausführliche Eingabeaufforderung zur Videogenerierung, die die gesamte Informationsnutzlast enthält, erstellt und eingefroren wird, bevor ein System irgendetwas generiert. Die Checkliste mit den erforderlichen Fakten (168 Fakten im gesamten Benchmark) und die Verständnisfragen (149) wurden gleichzeitig verfasst und von Menschen überprüft. Ein vollständig ausgearbeitetes Beispiel finden Sie in Anhang B.

    WIE DAS FELD GELAUFEN WURDE – EIN SCHUSS, DIESELBE BRIEF, TOP-EINSTELLUNGEN

    • Identische Eingaben: Jedes System erhielt wörtlich die gleichen kurzen Anweisungen – kein pro-System-Prompt-Engineering.
    • Best-of-1: eine Generation pro Szene, nie kuratiert; Schwere Fehler wurden bis zum Erfolg wiederholt (höchstens 3 Wiederholungsversuche beobachtet).
    • Dauer wie generiert: vom Auftrag festgelegte Ziellängen; Die tatsächliche Leistung jedes Systems wird unverändert verwendet (System durchschnittlich 1,1–4,2 Minuten).
    • Die 173/175-Buchhaltung: Die Sicherheitsregeln von Fable 5 lehnten 2 seiner 25 Schriftsätze ab. Anstatt seinen Opus-Fallback zu ersetzen, haben wir Fable 5 nur für seine eigenen 23 Generationen bewertet – kein Konkurrent wurde stillschweigend geschwächt, und fehlende Zellen werden aus den Nennern gestrichen, nie angerechnet.

    DAS ANNOTATOR-PANEL – UNABHÄNGIG, BLIND, VOLLSTÄNDIG GEKREUZT

    • 12 unabhängige Kommentatoren , ausgelagerte Freiberufler, die keinem Systemteam angehören – jeder mit einem Master-Abschluss oder höher von einer der 50 besten Universitäten des QS-Weltrankings, mit zertifizierten Englischkenntnissen.
    • Blind durchgängig:-Videos werden unbeschriftet in zufälliger Reihenfolge präsentiert; Den Kommentatoren wurde nie mitgeteilt, welches System ein Video produziert hat.
    • Vollständig gekreuzt: alle 12 Kommentatoren bewerteten alle 7 Systeme, zwei Bewerter pro Video – ein strenger oder nachsichtiger Bewerter bewegt jedes System gleichermaßen und kann einen Vergleich nicht verzerren.
    • Bewusstes Ansehen, nicht Klickarbeit: ~20 Minuten Anmerkung pro Video von weniger als 5 Minuten, bezahlt zum 4-fachen lokalen Mindestlohn. Kommentiert vom 13.–15. Juli 2026.

    Metriken, die auf veröffentlichten Methoden basieren und von Menschen gemessen werden

    Jedes Video wird von einem vollständig gekreuzten Kommentatorgremium bewertet – jeder Kommentator hat jedes System bewertet, sodass ein strenger oder nachsichtiger Bewerter alle Systeme gleichermaßen anpasst und einen Vergleich nicht verzerren kann. Das Gremium produzierte 6.760 menschliche Anmerkungen über fünf Stationen, die auf veröffentlichten Methoden basieren – drei davon wurden von Experten begutachtet bei ICML, WACV und IEEE TPAMI / CVPR – und jedes Video wird *auch* mit dem automatisierten Modell VBench bewertet: >3,7 Millionen Modellbewertungen auf Frame-Ebene .

    • TeachQuiz Informationsbereitstellung (Code2Video, ICML 2026 · arXiv:2510.01174) – wie viele der beabsichtigten Informationen ein Betrachter tatsächlich erhält.
    • Faktische Berichterstattung – Wie viele der Fakten, die das Briefing erfordert, werden wörtlich und lesbar auf dem Bildschirm angezeigt?
    • T2VTextBench Textgenauigkeit (arXiv:2505.04946) – Korrektheit der Titel, Zahlen und Beschriftungen auf dem Bildschirm.
    • T2VWorldBench ( WACV 2026 · arXiv:2507.18107) – vier Qualitätsdimensionen: Videoqualität, Realismus, Relevanz, Konsistenz.
    • Aesthetic Preference – Arena-ähnliche, direkte Vergleiche mit TapVid.
    • VBench (VBench++, IEEE TPAMI 2025 · Original VBench, CVPR 2024 Highlight · das Modell hinter der öffentlichen HuggingFace-Bestenliste) – branchenübliche automatisierte Videoqualitätssuite, >3.7 Millionen Modellbewertungen auf Frame-Ebene .

    VBench ist eine unabhängige, maschinenbasierte Gegenprüfung unserer menschlichen Anmerkungen: Die Bewertung der Rahmenqualität reproduziert unser menschliches Präferenzranking, sodass sich die beiden Instrumente gegenseitig bestätigen (Ergebnis 05).

    Die Rankings sind robust gegenüber der Art und Weise, wie Sie sie berechnen: drei unabhängige Schätzer – Rohraten, ausgelassener Informationsgewinn und Logistikmodelle mit gemischten Effekten – erzeugen die identische Reihenfolge, und zuverlässigkeitsgewichtete Varianten und PCA-Varianten lassen sie unverändert. Da sich Marketing wie eine andere Aufgabenfamilie als die vier Anwendungsfälle mit hoher Informationsdichte verhält, wird jedes Ergebnis in zwei Frames gemeldet: alle 25 Szenen und der informationsreiche Frame (Professional, News, How-To, Explainer). Vollständige Tabellen für beide finden Sie im Anhang.

    FINDING 01 · DER VOLLFELD-FRAME

    03

    Informatives Video ist eine Kompromissgrenze – und TapVid hält den Balancepunkt

    WIN Das Feld ist eine Kompromissgrenze: Bei der Informationsqualität lautet die Reihenfolge Fable 5 > TapVid > alle anderen; Bei der ästhetischen Präferenz wird die Reihenfolge genau umgekehrt. TapVid ist der einzige Code-Renderer mit hohen Werten auf beiden Informationsachsen – Inhaltstreue 77, visuelle Qualität 79, jeweils 2. von 7 – der Gleichgewichtspunkt der Grenze.

    Die ästhetische Präferenz wird im Arena-Stil gemessen – zwei Videos desselben Briefings nebeneinander – und erfasst etwas, was die informativen Rubriken nicht tun: Ihre Korrelation mit jeder informativen Metrik ist negativ bis null (–0,22 bis –0,01). Code-Renderer kaufen informative Qualität; Pixeldiffusion erkauft ästhetischen Reiz. Die Grenze unten stellt alle sieben Systeme in beiden Frames in diesen Kompromiss.

    DIE INFORMATIV-ÄSTHETISCHE GRENZE

    *x: Informationsqualität · y: Ästhetische Präferenz · feldrelative T-Scores (70 = Feldmittelwert) · Szenen mit hoher Informationsdichte*

    DIE INFORMATIV-ÄSTHETISCHE GRENZE
    DIE INFORMATIV-ÄSTHETISCHE GRENZE

    TapVid ist das einzige System im grünen Quadranten – sehr informativ und ästhetisch bevorzugt – in beiden Frames. Bei Szenen mit hoher Informationsdichte bewegt sich TapVid zum Ellbogen der Grenze (Informationsqualität 82, innerhalb von 3,5 T vom Spitzenreiter), während der ästhetische Rand der Pixeldiffusion auf Parität schrumpft; In allen 25 Szenen liegen Seedance und Pixeldiffusion L über dem angezeigten Präferenzbereich. Die ästhetische Präferenz wird neben der Informationsqualität angegeben und nie gemittelt.

    ÄSTHETISCHE GEWINNRATE VON TAPVID – NEBENEINANDER ANSEHEN, ALLE 25 SZENEN

    *Anteil der direkten Vergleiche, bei denen TapVid gewinnt (Unentschieden zählen zur Hälfte) · ×100*

    ÄSTHETISCHE GEWINNRATE VON TAPVID – NEBENEINANDER ANSEHEN, ALLE 25 SZENEN
    ÄSTHETISCHE GEWINNRATE VON TAPVID – NEBENEINANDER ANSEHEN, ALLE 25 SZENEN

    Über 50 = Zuschauer bevorzugen TapVid. Signifikanz aus den Mixed-Logit-Tests ohne Verlust/entscheidender Sieg; Die vollständigen CIs und der verlustfreie Rahmen finden Sie im Anhang.

    ÄSTHETISCHE GEWINNRATE VON TAPVID – NEBENEINANDER ANSEHEN, INFORMATIONSREICHE SZENEN

    *Anteil der direkten Vergleiche, bei denen TapVid gewinnt (Unentschieden zählen zur Hälfte) · ×100*

    ÄSTHETISCHE GEWINNRATE VON TAPVID – NEBENEINANDER ANSEHEN, INFORMATIONSREICHE SZENEN
    ÄSTHETISCHE GEWINNRATE VON TAPVID – NEBENEINANDER ANSEHEN, INFORMATIONSREICHE SZENEN

    Im Zielbereich des Benchmarks schrumpfen die ästhetischen Defizite auf das Gleiche – nur Seedance bleibt bei entscheidenden Vergleichen deutlich bevorzugt.

    SIEG Wird Seite an Seite gegen Fable 5 gezeigt – den informativen Spitzenreiter des Feldes – die Zuschauer bevorzugen TapVid. Gewinnrate 58,7 %, und TapVid verliert deutlich nicht (P = 0,72). Das System, das TapVid bei qualitativ hochwertigen Composites übertrifft, verliert vor den Zuschauern.

    GEWINNEN Bei informationsreichen Arbeiten gibt TapVid bei der inhaltlichen Führung keine Kompromisse bei der Ästhetik ein. Die Gesamtverlustfreiheit steigt auf 53,0 % – Parität – und kein Pixeldiffusionssystem bietet dort einen signifikanten Verlustfreiheitsvorteil. Im Vergleich zu Googles Veo: Vorsprung bei der Informationsqualität (78 vs. 65), deutlicher Vorsprung bei der Abdeckung und ein Präferenzwechsel.

    EINSCHRÄNKUNG In allen 25 Szenen ist die ästhetische Präferenz eine echte Schwäche. Die Gesamtgewinnrate von TapVid liegt bei 40,7 % – deutlich unter der 50 %-Keine-Präferenz-Linie – und wird deutlich weniger bevorzugt als Pixel-diffusion L und Seedance, die Schlusslichter der informativen Rangliste. Die Umkehrung ist der Paradigmen-Kompromiss, der sich auf das Marketing konzentriert; Der Glattstellungsplan befasst sich direkt damit.

    FINDING 02 · FAKTENBERICHT

    04

    Fakten auf den Bildschirm zu bringen, ist die verbindliche Vorgabe – und TapVid schafft es am besten

    GEWINNEN Bei Szenen mit hoher Informationsdichte bringt TapVid 83,6 % der erforderlichen Fakten auf den Bildschirm – der absolute Spitzenreiter, deutlich vor 5 von 6 Mitbewerbern. In allen 25 Szenen liegt es statistisch gleichauf mit dem Spitzenreiter Fable 5 und deutlich vor jedem Pixeldiffusionssystem.

    Die Abdeckung ist die anspruchsvollste Messgröße des Benchmarks: Das Feld teilt sich in zwei klare Ebenen auf, wobei die vier Code-Renderer (74–79 % der Daten auf dem Bildschirm) deutlich von den drei Pixeldiffusionssystemen (54–61 %) entfernt sind.

    FAKTENABDECKUNG – ANTEIL DER ERFORDERLICHEN FAKTEN AUF DEM BILDSCHIRM

    *Mittelwert · 95 % Bootstrap-CI über Szenen · Szenen mit hoher Informationsdichte · ×100*

    FAKTENABDECKUNG – ANTEIL DER ERFORDERLICHEN FAKTEN AUF DEM BILDSCHIRM
    FAKTENABDECKUNG – ANTEIL DER ERFORDERLICHEN FAKTEN AUF DEM BILDSCHIRM

    Info-dichter Rahmen: TapVid 83,6 [77,3–89,0] führt direkt ; Die Lücke zu jedem System außer Fable 5 ist statistisch signifikant (gemischt-logitisches 95 %-KI schließt 0 aus). Alle 25 Frames: Fable 5 79,0, TapVid 77,3 – ein statistischer Gleichstand – wobei Seedance, Veo und Pixeldiffusion L in beiden Frames deutlich zurückliegen.

    ABDECKUNG FÖRDERT DIE LIEFERUNG – EIN PUNKT PRO VIDEO, 173 VIDEOS

    *x: Sachliche Berichterstattung · y: TeachQuiz Informationslieferung (korrekter Tarif) · ×100*

    ABDECKUNG FÖRDERT DIE LIEFERUNG – EIN PUNKT PRO VIDEO, 173 VIDEOS
    ABDECKUNG FÖRDERT DIE LIEFERUNG – EIN PUNKT PRO VIDEO, 173 VIDEOS

    GEWINNEN Sobald eine Tatsache auf dem Bildschirm erscheint, erfassen die Zuschauer sie in etwa 95 % der Fälle. Abdeckung und Auslieferung korrelieren bei r = 0,70 über 173 Videos hinweg, und die angepasste Linie reicht von einer No-Fact-Untergrenze von 36 % bis zu einer Bildschirmobergrenze von 96 %. Das Verstehen ist fast ein gelöster Schritt – das Spiel ist Berichterstattung, und TapVid spielt es am besten.

    ABDECKUNG NACH ANWENDUNGSFALL – MODELLVORHERSAGES P(FAKTEN AUF DEM BILDSCHIRM)

    *mixed-logit vorhergesagte Wahrscheinlichkeit pro Anwendungsfall · ×100*

    ABDECKUNG NACH ANWENDUNGSFALL – MODELLVORHERSAGES P(FAKTEN AUF DEM BILDSCHIRM)
    ABDECKUNG NACH ANWENDUNGSFALL – MODELLVORHERSAGES P(FAKTEN AUF DEM BILDSCHIRM)

    GEWINNEN Sie TapVid-Leads oder -Gleichstände für den Coverage-Lead in vier von fünf Anwendungsfällen. Es liegt mit Abstand an der Spitze von News (81,9) und How-To (86,7) und liegt bei Professional deutlich vor vier Mitbewerbern – darunter dem Gesamtführer Fable 5.

    EINSCHRÄNKUNG Marketing ist die Ausnahme. Die Abdeckung von TapVid sinkt dort auf 53,8 % – das Schlusslicht der Code-Renderer, hinter Fable 5, Code-render R und Code-render H. Die gleiche Lücke prägt die Marketing-Spalte jeder Metrik; Der Glattstellungsplan behandelt es als ein Problem.

    FINDING 03 · TEACHQUIZ-INFORMATIONSLIEFERUNG

    05

    Zuschauer lernen von TapVid genauso viel wie von jedem anderen System auf diesem Gebiet

    GEWINNEN Bei Szenen mit hoher Informationsdichte belegt TapVid den ersten Platz bei der Informationsbereitstellung TeachQuiz – Zuschauer beantworten 84,5 % der Verständnisfragen richtig – und übertrifft drei Systeme (Code-Render H, Seedance, Pixeldiffusion L) deutlich. Über alle 25 Szenen hinweg sind die Top 5 statistisch untrennbar miteinander verbunden; TapVid liegt deutlich vor Pixel-Diffusion L und Seedance.

    Die Bereitstellung erfolgt nach dem TeachQuiz-Protokoll: Nach dem Ansehen beantworten die Kommentatoren Multiple-Choice-Fragen zu den Fakten, die im Briefing gefordert werden, und jedes Video wird anhand einer Feldbasislinie pro Frage bewertet. Drei unabhängige Schätzer – rohe korrekte Rate, ausgelassener Informationsgewinn und ein Logit mit gemischten Effekten – einigen sich auf die Reihenfolge.

    TEACHQUIZ-INFORMATIONSLIEFERUNG – VERSTEHEN, RICHTIG

    *rohe korrekte Rate · Signifikanz vs. TapVid aus Mixed-Effects-Logit · Szenen mit hoher Informationsdichte · ×100*

    TEACHQUIZ-INFORMATIONSLIEFERUNG – VERSTEHEN, RICHTIG
    TEACHQUIZ-INFORMATIONSLIEFERUNG – VERSTEHEN, RICHTIG

    TapVid ist in beiden Frames erstklassig. Vollständige Gewinn-/Unentschieden-/Verlusttabellen pro Anwendungsfall finden Sie im Anhang.

    LIEFERUNG NACH ANWENDUNGSFALL – VERSTEHEN RICHTIG-RATE

    *rohe korrekte Rate pro Anwendungsfall · Balken mit 95 % Bootstrap-CI über die Szenen des Anwendungsfalls · ×100*

    LIEFERUNG NACH ANWENDUNGSFALL – VERSTEHEN RICHTIG-RATE
    LIEFERUNG NACH ANWENDUNGSFALL – VERSTEHEN RICHTIG-RATE

    TapVid ist Spitzenreiter bei News (88,3) und How-To (89,7) – laut Mixed-Logit-Inferenz übertrifft es Code-render R, Pixel-diffusion L und Seedance bei News und Veo bei How-To deutlich und verliert in beiden Punkten ohne Gegentreffer. Professional und Explainer liegen im Mittelfeld; Marketing ist die Lücke, auf die der Abschlussplan abzielt. Jeder Anwendungsfall basiert auf 5 Szenen, daher sind die CIs breit gefächert; Signifikanzaufrufe stammen aus dem gemischten Logit pro Anwendungsfall im Anhang .

    T2VTEXTBENCH-TEXTGENAUIGKEIT – BILDSCHIRMTITEL, ZAHLEN UND ETIKETTEN

    *Vierstufiger Grad zugeordnet zu [0,1] · 95 % Bootstrap-CI · Szenen mit hoher Informationsdichte · ×100*

    T2VTEXTBENCH-TEXTGENAUIGKEIT – BILDSCHIRMTITEL, ZAHLEN UND ETIKETTEN
    T2VTEXTBENCH-TEXTGENAUIGKEIT – BILDSCHIRMTITEL, ZAHLEN UND ETIKETTEN

    WIN TapVid rendert Bildschirmtext am besten in Szenen mit hohem Informationsgehalt. Über alle 25 Szenen hinweg ist die Spitze des Feldes statistisch untrennbar miteinander verbunden.

    FINDING 04 · VISUELLE QUALITÄT

    06

    Statistisch in drei von vier visuellen Dimensionen mit dem Marktführer gleichauf

    GEWINNEN Bei der menschlichen T2VWorldBench-Bewertung liegt TapVid statistisch gesehen mit dem Spitzenreiter Fable 5 in Bezug auf Realismus, Relevanz und Konsistenz zusammen – in beiden Frames – und belegt im vierdimensionalen Verbund einen klaren zweiten von sieben Punkten (86,4), deutlich vor Seedance und Pixeldiffusion L. Was auch immer TapVid rendert, es wird sauber gerendert.

    Die vier Dimensionen werden vom gekreuzten Annotator-Panel anhand der Dimensionen-Rubriken mit 1–5 bewertet. Der einzige wesentliche visuelle Unterschied zum Fable 5 ist die Videoqualität (86,0 vs. 90,0); Die anderen drei Dimensionen sind statistische Bindungen.

    T2VWORLDBENCH – VIER DIMENSIONEN, ALLE 25 SZENEN

    *Mittelwert · 95 % Bootstrap-KI über Szenen · ×100 · * = signifikant vs. TapVid*

    T2VWORLDBENCH – VIER DIMENSIONEN, ALLE 25 SZENEN
    T2VWORLDBENCH – VIER DIMENSIONEN, ALLE 25 SZENEN

    TapVid belegt den 2. Platz in Bezug auf Qualität, Realismus und Konsistenz, den 3. Platz in Bezug auf Relevanz (hinter Fable 5 und Code-render R). Relevanz – „sagt es die richtigen Dinge?“ – verhält sich als Inhaltsdimension und wird mit den oben genannten Inhaltsmetriken analysiert.

    GEWINNEN Wo die Bewerter völlig einer Meinung sind, erhält TapVid die höchste Bewertung. Bei der Teilmenge mit exakter Übereinstimmung steigt die Videoqualität von TapVid auf 0,97 und überholt damit Fable 5 – die klaren Siege von TapVid sind eindeutig.

    FINDING 05 · UNABHÄNGIGE BESTÄTIGUNG

    07

    Menschliche Anmerkungen, validiert durch die automatisierte Industriestandardmetrik VBench

    CHECK Wenn Sie dieselben 25 Szenen blind ausführen, bewertet VBench – das automatisierte Modell hinter der öffentlichen HuggingFace-Bestenliste – jedes Video unabhängig vom menschlichen Panel. Es ordnet die Systeme auf die gleiche Weise wie die Side-by-Side-Präferenz unserer Annotatoren. Spearman ρ = +0,89 zwischen VBench Rahmenqualität und menschlichen Vorlieben; +0,87 ohne ein beliebiges System. Die menschliche Präferenzachse ist kein Artefakt unserer Bewerter – eine unabhängige, auf Papier basierende Maschinenmetrik landet in derselben Reihenfolge.

    Ein weit verbreitetes automatisiertes Modell, das ohne Kenntnis der menschlichen Bezeichnungen berechnet wurde, stimmt mit dem menschlichen Gremium hinsichtlich der Rangfolge der Systeme überein – ein Beweis dafür, dass die Bewertung ein echtes, reproduzierbares Signal und keine Eigenheiten des Bewerters erfasst.

    AUTOMATISIERTE UND MENSCHLICHE INSTRUMENTE stimmen überein – JEDES GEZEIGTE VIDEO

    *x: VBench Bildqualität pro Video (automatisiert) · y: menschliche Gewinnrate jedes Systems · 141 System×Szenenvideos, gefärbt nach System · ×100*

    AUTOMATISIERTE UND MENSCHLICHE INSTRUMENTE stimmen überein – JEDES GEZEIGTE VIDEO
    AUTOMATISIERTE UND MENSCHLICHE INSTRUMENTE stimmen überein – JEDES GEZEIGTE VIDEO

    EJeder kleine Punkt ist die automatisierte Bildqualität eines Videos, gefärbt durch das System und platziert an der menschlichen Win-Rate dieses Systems; Die großen Punkte sind die Systemmittelwerte. Die farbigen Wolken stapeln sich in der Reihenfolge der Win-Rate und ihre Zentren steigen von links nach rechts – automatisierte Rahmenqualität und menschliche Präferenz ordnen die Systeme zusammen ( Spearman ρ = +0,89 ). Systeme bleiben unbenannt: Es geht um die Übereinstimmung der beiden Instrumente, nicht um die Position eines einzelnen Systems.

    SRC VBench (VBench++, IEEE TPAMI 2025 · Original VBench, CVPR 2024 Highlight) ist der standardmäßige automatisierte Videoqualitäts-Benchmark hinter der öffentlichen HuggingFace-Bestenliste und bewertet sechs Dimensionen pro Clip. Es wurde am 13. und 14. Juli mit dem offiziellen VBench-Long-Codepfad (Commit e946a8d) auf dedizierten GPUs ausgeführt – abgeschlossen, bevor ein Vergleich mit den menschlichen Etiketten möglich war. Der Rahmenqualitätskopf (Ästhetik + Bildqualität) ist die hier verwendete ästhetische Gegenprüfung, die die Qualität berechnet, wenn sie funktioniert, sodass eine fehlgeschlagene Generierung die Systembewertung nicht verzerrt. Jedes Komposit wurde aus den Rohwerten pro Szene neu berechnet und entspricht dem Quellbericht auf die Dezimalzahl genau; Das vollständige Laufprotokoll befindet sich in Anhang A.

    DER NÄCHSTE GEWINNT ZUM SCHLIESSEN

    08

    Zwei Ziele: Marketinginhalte und Ästhetik ohne informativen Handel

    Beide Lücken sind gemessen, lokalisiert und von dem, was bereits funktioniert, trennbar. Keiner von beiden fordert, die Abdeckungs- und Bereitstellungsmaschine anzutasten, die den Bereich der Informationsdichte gewinnt.

    TAPVID NACH ANWENDUNGSFALL – DIE MARKETING-LÜCKE IST DER INHALT, NICHT DAS Rendering

    *Content Fidelity vs. Visual Quality Composite · feldrelativer T-Score · pro Anwendungsfall*

    TAPVID NACH ANWENDUNGSFALL – DIE MARKETING-LÜCKE IST DER INHALT, NICHT DAS Rendering
    TAPVID NACH ANWENDUNGSFALL – DIE MARKETING-LÜCKE IST DER INHALT, NICHT DAS Rendering

    Im Bereich Marketing bleibt die visuelle Qualität von TapVid bei 75, während die Inhaltstreue auf 51 sinkt – die Videos werden sauber gerendert, aber es fehlen erforderliche Fakten. Überall sonst bewegen sich die beiden Achsen gemeinsam bei 68–93.

    DAS ÄSTHETISCHE PROGRAMM – BEWEGEN SIE SICH AUF DER ÄSTHETISCHEN ACHSE NACH OBEN, ÜBERNEHMEN SIE DIE INFORMATIVE FÜHRUNG

    *x: Informative Qualität · y: Ästhetische Präferenz · T-Scores · alle 25 Szenen*

    DAS ÄSTHETISCHE PROGRAMM – BEWEGEN SIE SICH AUF DER ÄSTHETISCHEN ACHSE NACH OBEN, ÜBERNEHMEN SIE DIE INFORMATIVE FÜHRUNG
    DAS ÄSTHETISCHE PROGRAMM – BEWEGEN SIE SICH AUF DER ÄSTHETISCHEN ACHSE NACH OBEN, ÜBERNEHMEN SIE DIE INFORMATIVE FÜHRUNG

    Da die Präferenz orthogonal zu jeder Qualitätsmetrik ist, ist die Bewegung gerade nach oben – die Erhöhung von Bewegung, Glanz und Attraktivität verschiebt TapVid in die leere obere rechte Ecke der Grenze, ohne etwas von ihrem informativen Vorsprung zu verschwenden.

    WEITER Win to close Nr. 1 – Marketinginhalte. Der Zusammenbruch ist die Bereitstellung von Fakten in Marketingszenen, nicht das Rendern – eine gezielte Erweiterung der Coverage-Engine, die bereits vier Anwendungsfälle ermöglicht, kein Neuaufbau. Durch den Abschluss wird der Vorsprung von TapVid im Bereich der informationsdichten Berichterstattung in einen Gesamtvorsprung umgewandelt: Ohne Marketing liegt TapVid bei der Berichterstattung bereits an der Spitze von fünf von sechs Systemen.

    NÄCHSTER Sieg zum Abschluss Nr. 2 – ästhetische Präferenz vs. Pixeldiffusion, ohne den Informationsvorsprung zurückzugeben. Präferenz ist empirisch orthogonal zu jeder Qualitätsmetrik, daher ist der Abschluss ein eigenes Programm – Bewegung, Politur, Anklang – und kein Kompromiss, der gegen Berichterstattung oder Lieferung erzwungen wird. Der informationsdichte Rahmen zeigt die Obergrenze: Wo der Inhalt dicht ist, erreicht TapVid bereits die Präferenzparität und behält gleichzeitig die inhaltliche Führung.

    APPENDIX

    09

    Eingefrorenes Protokoll, gesetzte Statistiken, jedes Ergebnis vollständig

    Systemversionen sind tagesaktuell mit Quellen versehen; Sampling-Regeln und Fakten-Checklisten wurden festgelegt, bevor es überhaupt ein Video gab; Das Annotator-Panel war blind und vollständig gekreuzt (A–B). Drei unabhängige Schätzer einigen sich auf jede Reihenfolge, alle Zufälligkeiten werden gesetzt und ein unabhängiger Wiederholungslauf reproduziert jedes Artefakt (C–E). Vollständige Bestenlisten mit Konfidenzintervallen für jede Metrik in beiden Frames (F–K). Δ-Spalten sind Mixed-Logit-Log-Odds-Kontraste gegenüber TapVid, sofern nicht anders angegeben; WIN / LOSS = das 95 %-Intervall schließt Null aus, aus der Perspektive von TapVid; TIE = nicht.

    SCHLÜSSEL Systembenennung. Der Hauptteil dieses Berichts bezieht sich anhand anonymisierter Bezeichnungen auf drei Systeme. Ihre wahren Identitäten werden hier nur angegeben: Code-Render H = Hyperframes · Code-Render R = Remotion · Pixeldiffusion L = LTX. In den folgenden Tabellen werden die tatsächlichen Produktnamen verwendet.

    A · Experimentprotokoll – Versionen, Zeitleiste, Anmerkungsbuch

    Timeline (2026) Ausrichtung Mensch↔VBench 14.–16. Juli. Die VBench-Bewertung wurde abgeschlossen, bevor es einen Vergleich mit menschlichen Markierungen gab.

    Versionspins – lokal ausgeführte Tools in ihrer neuesten Version seit dem Einfrieren am 6. Juli; gehostete Plattformen beim neuesten Flaggschiffmodell während des Fensters. Alle 16:9, maximale Qualitätseinstellungen, Storyboard-/Planungsfunktionen, wie von jeder Plattform geliefert.

    SystemVersion · Plattform · EinstellungenQuelle
    TapVidinterner Build-Strom am Zugriffsfenster—
    Fable 5Claude Code 2.1.202 · Modell claude-fable-5 (angekündigt am 9. Juni, erneut bereitgestellt am 1. Juli) · StandardeinstellungenAnkündigung · Änderungsprotokoll
    Hyperframesv0.7.37 · Claude Code · Sonnet 5 (veröffentlicht am 30. Juni) · StandardeinstellungenVeröffentlichung · Sonnet 5
    Remotionv4.0.485 · Codex CLI 0.142.5 · GPT-5.5 (angekündigt am 23. April; GPT-5.6 wurde am 9. Juli nach dem Einfrieren ausgeliefert) · StandardeinstellungenVeröffentlichung · Codex · GPT-5.5
    VeoVeo 3.1 (angekündigt am 15.10.2025) · Google Flow, Storyboard-Planung von Flow · Qualitätsmodus, 720pAnkündigung · Modi-Dokument
    LTXLTX-2.3 (veröffentlicht im März 2026) · LTX Studio, Storyboard-Planung von LTX Studio mit GPT-Image-2 · Pro-Modus, 1080pVeröffentlichung · GPT-Image-2
    SeedanceSeedance 2.0 (angekündigt am 12. Februar) · Jimeng – ByteDances offizielle Verbraucherplattform – Agentenmodus, Story-Film-Skill · VIP-Modus (höchste Qualität), 720pAnkündigung · Jimeng

    Prompt-Herkunft. Alle 25 Briefs und ihre Faktenchecklisten wurden mit Claude Opus auf Claude Code verfasst, von Menschen überprüft und vor Beginn der Generierung eingefroren. Wenn die KI-Autorenschaft die Schriftsätze auf die Sprache eines Systems ausrichtet, wäre der Nutznießer Fable 5 – ein Konkurrent – ​​und nicht TapVid.

    Das Hauptbuch mit 6.760 Anmerkungen. Eine Zeile pro Annotator × Szene × System × Element: Faktencheck 2.326 (168 Fakten) + TeachQuiz Verständnis 2.062 (149 Fragen) + T2VWorldBench vier Dimensionen 1.384 (346 Video×Bewertereinheiten × 4) + Textgenauigkeit 692 (346 Einheiten × Klasse + Junk-Flag) + Side-by-Side-Präferenz 296 = 6,760 . Jede Zählung kann aus dem Rohexport neu berechnet werden.

    VBench run. Offizieller VBench-Long-Code (vbench2_beta_long, commit e946a8d) auf 5× NVIDIA L4, ein Shard pro Anwendungsfall, ~6 h Wall; Umgebung angeheftet und von Grund auf auf einer neuen Instanz reproduziert; Die Ergebnis-JSONs pro Zelle und die Ausführungsprotokolle werden beibehalten. Eingabenormalisierung und die >3,7M-Auswertungsarithmetik: Anhang E .

    B · Ausgearbeitetes Beispiel – ein Briefing durch die gesamte Pipeline

    Der Brief (How-To-Szene 1): *„Das Papier, das knallt – Ein Origami-Zappelspielzeug ohne Kleber“*, Ziel 5:00, 16:9. Wie jedes Briefing handelt es sich um ein vollständig spezifiziertes Produktionsdokument, das für alle sieben Systeme identisch ist: Art Direction mit einer exakten Hex-Palette, Beleuchtung und Kamerasprache, eine Einstellungsliste für neun Szenen mit vollständigem Voice-Over-Text und Bewegungsnotizen pro Szene sowie eine einzige Master-Eingabeaufforderung – z. * „… die drei farbcodierten Papiere (Indigo 6×6 äußere Box, bernsteinfarbener 5×5 Innenknopf, violette 9×4 Feder), die gemeinsame Blintz-Faltung, die beide Boxen bildet… der klebefreie Verschluss, bei dem Klappen unter angrenzende Kanten gesteckt werden…“* Die gesamte Informationsnutzlast befindet sich im Schriftsatz, sodass Abdeckungsfehler dem System und nicht der Eingabeaufforderung zuzuschreiben sind.

    Seine Checkliste mit erforderlichen Fakten (mit dem Briefing verfasst, vor der Generierung eingefroren; Stationselemente auf Englisch gerendert). Eine Tatsache wird nur dann gutgeschrieben, wenn sie wörtlich und lesbar auf dem Bildschirm erscheint – Kommentatoren können Bild für Bild wiedergeben:

    • Äußeres Kartonpapier: 6×6 cm
    • Inneres Knopfpapier: 5×5 cm
    • Federpapier: 9×4 cm
    • Das Versprechen ohne Kleber: kein Kleber, kein Klebeband, nirgendwo
    • Die Schlüsselfalte mit Namen: blintzfalte (Ecken zur Mitte)

    A TeachQuiz Verständnisitem (beantwortet nach dem Ansehen; das „Video hat dies nicht bereitgestellt“-Escape wird falsch bewertet): *„Was ist die Schlüsselfalte, die beide Boxen gemeinsam haben?“* – Talfalte / blintzfalte (Ecken zur Mitte) / Squashfalte / das Video lieferte diese Informationen nicht.

    Wie es abgeschnitten hat. Die gleichen Elemente haben an anderer Stelle in dieser Szene echte Fehler gemacht – einschließlich der Faltnamenfrage –, bei der es sich um die Diskriminierung handelt, auf deren Messung der Benchmark ausgelegt ist.

    C · Statistische Methoden – Schätzer, Seeds und unabhängige Nachverifizierung

    Estimators. Binäre Stationen (Abdeckung, Lieferung): Bayesianischer gemischter logistischer Regressionswert ~ System + (1|Szene) + (1|Element), TapVid als Referenz. Abgestufte Stationen (Text, Abmessungen): Szenencluster-robustes OLS mit Annotator-Fixeffekten. Zustellung zusätzlich durch Weglassen eines einmaligen Informationsgewinns. Drei unabhängige Schätzer – Rohraten, Informationsgewinn, gemischter Logit – erzeugen in beiden Frames die identische Systemordnung.

    Uncertainty. 95 % CIs aus dem Bootstrap auf Szenenebene (Neuabtastung der 25 Szenen, B = 3000, fester Startwert); Signifikanz = das 95 %-Intervall schließt Null aus; Ergebnisse werden als Stufen gemeldet, bei denen sich die Intervalle überschneiden, niemals als Ränge mit falscher Genauigkeit. VBench: Skillings-Mack-Omnibus pro Dimension (Methodenunterschiede signifikant bei p = 8e-18 bis 1e-9 über 23 vollständige Szenenblöcke), post-hoc-paarweiser Wilcoxon-Vorzeichenrang mit Holm-Korrektur. Human↔VBench-Alignment: Spearman-Rangkorrelation, Stresstest durch 2000-fachen Bootstrap, Leave-One-System-Out und Permutationstests (alle gesetzt).

    Reproduzierbarkeit – unabhängig erneut überprüft. Die gesamte Zufälligkeit der Analyse wird geseedet, Rohdaten (der vollständige Annotationsexport und die VBench-Bewertungen pro Szene) werden mit der Analyse geliefert und jede Metrik verfügt über ein eigenes Reproduktionsskript mit einem Befehl unter angehefteten Abhängigkeiten (Python 3.14.5 · Numpy 2.5.1 · Pandas 3.0.3 · scipy 1.18.0 · statsmodels 0.14.6 · matplotlib 3.11.0 · openpyxl 3.1.5). Bei einer unabhängigen erneuten Ausführung in einer neuen Umgebung wurden alle 55 festgeschriebenen Ergebnisartefakte neu generiert: jedes deterministische Ausgabebyte war identisch, alle 15 Ziffern waren pixelidentisch und die Variationsspalten mit gemischten Modellen stimmten mit den logarithmischen Quoten ≤6e-06 überein – mit , wobei sich das Signifikanzurteil nirgends änderte .

    D · Zuverlässigkeit, Methode und Einschränkungen

    Rater-Robustheit durch Design. Das Panel ist vollständig gekreuzt – jeder Annotator hat jedes System bewertet – sodass die Rater-Striktheit einen Vergleich zwischen Systemen nicht beeinflussen kann. Das Hinzufügen eines Annotator-Zufallseffekts verschiebt Kontraste um höchstens 0,16 (Lieferung) / 0,31 (Abdeckung) Log-Odds ohne Signifikanzumkehr.

    Inter-Rater-Übereinstimmung pro Metrik. Lieferung: 73,6 % Rohübereinstimmung, Gwet AC1 0,59. Abdeckung: 67,2 %, AC1 0,42 – der Annotator-Effekt ist die dominierende Belästigungsquelle (SD 0,98), daher ist der absolute Abdeckungsgrad bewerterabhängig, auch wenn dies beim Vergleich nicht der Fall ist. Text: innerhalb einer Note 91 %, gewichtet κ 0,27 – die lauteste Bewertung. WorldBench-Dimensionen: innerhalb von eins 79–85 %, gewichtet κ 0,24–0,35. Ästhetische Präferenz: gewichtet κ 0,07 – aggregierte Gewinnraten über 296 Vergleiche sind aussagekräftig; Einzelurteile sind dies nicht, was auch die Orthogonalitätskorrelationen gegen Null abschwächt.

    Limitations. Die Lieferung ist relativ zu diesem Sieben-System-Feld und nicht über Benchmark-Läufe mit einem anderen Feld hinweg vergleichbar. Das Verstehen wird im offenen Buch verwaltet; Die mittlere Obergrenze von 0,86 komprimiert die Systemunterschiede, und ein Closed-Book-Run ist die Schärfung mit der höchsten Hebelwirkung. 25 Szenen (5 pro Anwendungsfall) mit 2 Bewertern pro Video, gebunden an die Auflösung pro Anwendungsfall – die oberen Ebenen sind nicht vollständig getrennt. In der Berichterstattung wird eine Tatsache nur dann anerkannt, wenn sie wörtlich und lesbar ist. Mixed-Logit-Intervalle sind variierend (antikonservativ); Die großen signifikanten Kontraste sind sicher. Die Sterntopologie der Arena unterstützt keine Konkurrenz-gegen-Konkurrent-Rangliste und keine absolute ästhetische Bewertung. Bei T-Scores handelt es sich um feldbezogene Annehmlichkeiten, nicht um absolute Noten. Eine Station mit Fakten pro Sekunde Bandbreite ist definiert, wurde aber in dieser Runde nicht berechnet.

    E · VBench ↔ menschliche Ausrichtung – Methode

    Instruments. VBench Die Rahmenqualität ist der Mittelwert der Dimensionen „Ästhetische Qualität“ und „Bildqualität“ des Modells, berechnet quality-when-it-works (eine fehlgeschlagene Generation wird ausgeschlossen, nicht mit 0 bewertet). Die menschliche Präferenz ist die Side-by-Side-Siegrate gegenüber TapVid. Die Korrelation besteht über die sechs Konkurrenzsysteme – TapVid ist der Sterntopologie-Anker jedes Vergleichs und daher kein aufgetragener Punkt.

    Ausrichtung (VBench Rahmenqualität ↔ menschliche Präferenz)Spearman ρ
    Insgesamt+0.89
    Leave-One-System-Out (Worst Case)+0.87
    Professionell+0.94
    Nachrichten+0.77
    Marketing+0.70
    Anleitung+0.48
    Erklärer−0.33

    Das Gesamtbild übersteht 2000-faches Bootstrap-Resampling und Leave-One-System-Out; n = 6 Systemgrenzen formale Bedeutung. „Explainer“ ist das Segment, in dem Zuschauer Bewegung über Frame-Polish belohnen, sodass die Frame-Qualitätsmetrik dort einen anderen Hinweis verfolgt. Jedes VBench-Komposit wurde aus den Rohwerten pro Szene neu berechnet und entspricht dem Quellbericht auf die Dezimalzahl genau.

    Run-Herkunft und >3,7 Mio. Anzahl. VBench-Long ( vbench2_beta_long at commit e946a8d ; VBench++, IEEE TPAMI 2025) wurde am 13. und 14. Juli 2026 auf NVIDIA L4-GPUs ausgeführt – bevor es einen Vergleich mit menschlichen Bezeichnungen gab. Die Eingaben wurden pro Szene normalisiert, sodass kein System ein Codierungsartefakt erhält: 720p-Obergrenze (nie hochskaliert), ein einheitliches 24-fps-Frame-Raster, nahezu verlustfreie Neucodierung. Sechs Dimensionen pro Video; Vier von ihnen punkten *jedes Bild* (jeweils 24 Vorwärtsbewegungen/s), die Bewegungsglätte beträgt 11,5/s und der Dynamikgrad 7,5/s – 116 Vorwärtsbewegungen pro Sekunde des Filmmaterials. Über die 32.141 Sekunden des aufgezeichneten Videos: 3,73 Millionen Modellbewertungen auf Frame-Ebene . Eine weitere erneute Konsistenzprüfung bei längengekürzten Builds (oben nicht gezählt) bestätigte, dass die Videolänge den Vergleich nicht verfälscht: Native-Trim-Deltas alle < 0,0025.

    F · Zusammengesetzte Scorecard – Informationsqualität und die drei Achsen

    Feldbezogene T-Scores: 70 = der Mittelwert dieser sieben Systeme, alle 10 Punkte = 1 SD. Informationsqualität = gleichgewichtiger Mittelwert der Achsen „Content Fidelity“ und „Visual Quality“. Die ästhetische Präferenz wird aus der Arena abgeleitet und neben den Informationsachsen angegeben, niemals innerhalb dieser – sie verläuft umgekehrt zu ihnen. Gesamtqualität (Inhalt + visuelle + ästhetische Präferenz)/3 ist die Überschrift des Szenarios mit hoher Informationsdichte.

    Alle 25 Szenen

    SystemInformative Qualität95 % KIInhaltVisuellÄsthetische Präferenz
    Fable 585.4[78.3, 92.1]82.688.252.3
    TapVid78.2[69.3, 86.6]77.179.261.7
    Remotion72.3[61.5, 82.2]76.668.169.2
    Hyperframes71.8[59.3, 83.0]73.370.268.1
    Veo64.8[51.7, 77.0]66.063.674.6
    Seedance61.3[46.8, 75.1]60.362.283.1
    LTX56.3[41.8, 70.8]54.158.581.0

    Szenen mit hoher Informationsdichte (Professionell, Nachrichten, Anleitungen, Erklärungen)

    SystemGesamtqualität (C+V+P)/3InhaltVisuellÄsthetische PräferenzInformative Qualität
    TapVid75.283.680.361.782.0
    Fable 575.082.888.154.285.5
    Seedance73.571.769.779.170.7
    LTX70.060.274.875.167.5
    Remotion69.777.565.965.771.7
    Hyperframes69.072.968.365.770.6
    Veo68.471.061.772.466.3

    Bootstrap-CIs über die 25 Szenen überschneiden sich stark: Die von den Daten unterstützten Ebenen sind Fable 5 · TapVid · Remotion/Hyperframes · das Pixeltrio. Der Gesamtqualitätsunterschied zwischen TapVid und Fable 5 (75,2 vs. 75,0) liegt innerhalb des Rauschens. Das Ranking ist robust gegenüber der Methode (PCA vs. Achsenmittelwert), der Zuverlässigkeitsgewichtung und der Gruppierung der Relevanz. Die ästhetische Präferenz von TapVid ist zu 0,5 in der Sterntopologie der Arena verankert; Die Variation pro Anwendungsfall bleibt bei der Konkurrenz bestehen.

    G · Sachliche Berichterstattung – beide Frames

    Alle 25 Szenen – Anteil der erforderlichen Fakten auf dem Bildschirm, wörtlich und lesbar; 95 % Bootstrap-CI; Mixed-Logit-Kontrast.

    SystemAbdeckung95 % KIΔ vs. TapVid95 % KIErgebnis
    Fable 50.790[0.717, 0.860]+0.094[−0.183, +0.370]KRAWATTE
    TapVid0.773[0.699, 0.843]—
    Remotion0.759[0.668, 0.845]−0.166[−0.417, +0.085]KRAWATTE
    Hyperframes0.745[0.642, 0.842]−0.199[−0.448, +0.050]KRAWATTE
    Seedance0.611[0.506, 0.710]−0.826[−1.052, −0.601]GEWINNEN
    Veo0.596[0.494, 0.697]−0.867[−1.091, −0.642]GEWINNEN
    LTX0.541[0.433, 0.658]−1.179[−1.400, −0.958]GEWINNEN

    Szenen mit hoher Informationsdichte

    SystemAbdeckung95 % KIΔ vs. TapVid95 % KIErgebnis
    TapVid0.836[0.773, 0.890]—
    Fable 50.792[0.710, 0.863]−0.291[−0.601, +0.020]KRAWATTE
    Remotion0.765[0.669, 0.857]−0.520[−0.801, −0.239]GEWINNEN
    Hyperframes0.727[0.607, 0.835]−0.681[−0.952, −0.409]GEWINNEN
    Seedance0.677[0.578, 0.770]−0.922[−1.182, −0.662]GEWINNEN
    Veo0.601[0.497, 0.714]−1.213[−1.464, −0.963]GEWINNEN
    LTX0.545[0.418, 0.671]−1.553[−1.798, −1.307]GEWINNEN

    Abdeckung ↔ Bereitstellung: Pearson r = 0,70 über 173 Videos; gepooltes OLS ergibt P(verstanden | auf dem Bildschirm) = 0,96 und einen Boden außerhalb des Bildschirms von 0,36; ein gemischter Logit stimmt zu (0,945 / 0,30). Die absolute Höhe der Deckung hängt vom Rater ab (siehe D); Der Systemvergleich ist nicht der Fall.

    H · TeachQuiz Informationslieferung – beide Rahmen

    Alle 25 Szenen – Rohverständnis-Korrekturrate, Mixed-Logit-Vorhersage P (richtig) bei einer typischen Szene/Frage und Kontrast.

    SystemRohpreisVoraussichtlich PΔ vs. TapVid95 % KIErgebnis
    Fable 50.8210.868+0.243[−0.091, +0.576]KRAWATTE
    Remotion0.8120.857+0.147[−0.167, +0.461]KRAWATTE
    TapVid0.7950.838—
    Hyperframes0.7890.834−0.028[−0.330, +0.274]KRAWATTE
    Veo0.7850.830−0.052[−0.353, +0.249]KRAWATTE
    LTX0.7150.756−0.509[−0.786, −0.233]GEWINNEN
    Seedance0.6910.730−0.647[−0.918, −0.377]GEWINNEN

    Szenen mit hoher Informationsdichte

    SystemRohpreisΔ vs. TapVid95 % KIErgebnis
    Fable 50.846+0.056[−0.342, +0.453]KRAWATTE
    TapVid0.845—
    Veo0.840+0.005[−0.368, +0.378]KRAWATTE
    Remotion0.832−0.067[−0.433, +0.299]KRAWATTE
    Hyperframes0.790−0.393[−0.731, −0.054]GEWINNEN
    Seedance0.786−0.423[−0.759, −0.087]GEWINNEN
    LTX0.752−0.650[−0.971, −0.329]GEWINNEN

    Die Lieferung erfolgt relativ zu diesem Sieben-System-Feld (Leave-One-Out-Gain / Field-Baseline-Logit); Die Verwaltung erfolgt nach dem Open-Book-Prinzip, was die Unterschiede in Richtung der mittleren Obergrenze von 0,86 komprimiert. Drei Schätzer (Raw, Gain D, Mixed Logit) einigen sich auf die Reihenfolge in beiden Frames.

    I · T2VTextBench Textgenauigkeit und T2VWorldBench Abmessungen

    T2VTextBench Textgenauigkeit – vierstufige Note auf [0,1]; Cluster-robuster Kontrast vs. TapVid. * = 95 %-KI ohne Null.

    SystemAlle 2595 % KIInformationsreich95 % KIΔ alle-25
    Fable 50.783[0.714, 0.850]0.750[0.681, 0.825]+0.062
    TapVid0.740[0.660, 0.820]0.769[0.675, 0.856]—
    Hyperframes0.700[0.615, 0.785]0.706[0.613, 0.794]−0.009
    Remotion0.695[0.610, 0.785]0.688[0.594, 0.781]−0.050
    Seedance0.640[0.535, 0.740]0.700[0.594, 0.806]−0.087
    Veo0.630[0.530, 0.730]0.650[0.531, 0.762]−0.090
    LTX0.580[0.500, 0.660]0.619[0.537, 0.694]−0.145*

    T2VWorldBench, alle 25 Szenen – mittlerer Grad pro Dimension und Papierzusammensetzung. * = signifikant vs. TapVid (Cluster-robustes OLS).

    SystemQualitätRealismusRelevanzKonsistenzZusammengesetzt
    Fable 50.900*0.9090.8910.9090.902*
    TapVid0.8600.8800.8440.8720.864
    Remotion0.8000.8600.8600.8240.836
    Hyperframes0.8120.8520.8160.8440.831
    Veo0.8000.8040.8080.8240.809
    Seedance0.8080.8080.772*0.796*0.796*
    LTX0.7920.784*0.688*0.792*0.764*

    Die Zusammensetzung ist intern gültig (Cronbach α = 0,91), faltet jedoch eine inhaltsbezogene Achse: Relevanz korreliert stärker mit Lieferung/Abdeckung (+0,77) als mit den visuellen Dimensionen seiner Geschwister (0,61–0,66). Informationsreicher Rahmen: TapVid bleibt in jeder Dimension Zweiter; Lediglich die Qualitäts- und Composite-Abstände zu Fable 5 bleiben signifikant.

    J · Ästhetische Präferenz (Arena-Stil) – beide Frames, beide Lesarten

    Star-Topologie: Jeder Vergleich ist TapVid gegen einen Konkurrenten im gleichen Auftrag (296 Vergleiche). Die Gewinnrate zählt Unentschieden als die Hälfte; Gleichstand ohne Verlust für TapVid; beides wird gemeldet. Urteile aus binomialen gemischten Logits im Vergleich zur 0,5-No-Preference-Linie.

    Alle 25 Szenen

    vsGewinnrate95 % KIKein Verlust95 % KIUrteil
    Fable 50.587[0.482, 0.683]0.696[0.577, 0.808]TapVid verliert nicht*
    Hyperframes0.440[0.347, 0.531]0.560[0.458, 0.667]werfen
    Remotion0.430[0.338, 0.519]0.540[0.433, 0.643]werfen
    Veo0.380[0.297, 0.464]0.480[0.389, 0.571]werfen
    LTX0.320[0.217, 0.417]0.380[0.267, 0.500]TapVid verliert*
    Seedance0.300[0.206, 0.393]0.400[0.286, 0.500]TapVid verliert*
    Insgesamt0.407[0.35, 0.47]0.507[0.44, 0.57]weniger bevorzugt als das Feld*

    Szenen mit hoher Informationsdichte – Gesamtgewinnrate 0,432 [0,37, 0,50], Nichtverlust 0,530: Parität. Die erheblichen verlustfreien Defizite verschwinden; Bei strengen Entscheidungsvergleichen bleibt nur Seedance deutlich bevorzugt.

    vsGewinnrate95 % KIKein Verlust95 % KI
    Fable 50.569[0.450, 0.692]0.667[0.542, 0.800]
    Remotion0.463[0.354, 0.568]0.575[0.458, 0.692]
    Hyperframes0.463[0.361, 0.563]0.600[0.500, 0.714]
    Veo0.400[0.304, 0.500]0.500[0.385, 0.607]
    LTX0.375[0.250, 0.500]0.425[0.292, 0.545]
    Seedance0.338[0.225, 0.450]0.425[0.286, 0.567]

    Die Präferenz ist empirisch orthogonal zu den informativen Metriken: Die Korrelation des TapVid-Vorteils pro Video bei jeder Metrik mit dem Arena-Ergebnis ergibt −0,22 bis −0,01 (n = 148 Zellen) – alles negativ oder nahe Null. „Nicht-Niederlage“ ist die positive Lesart (20 % der Vergleiche sind Unentschieden); Aus diesem Grund werden beide angezeigt.

    K · Rangliste pro Anwendungsfall – wobei TapVid gewinnt und verliert

    Signifikante Gewinne/Verluste im Vergleich zu TapVid pro Anwendungsfall (95 %-Intervall ohne Null). Zellen listen Konkurrenten auf; „-“ = keine.

    AnwendungsfallAbdeckung: TapVid schlägtverliert gegenLieferung: TapVid schlägtverliert gegen
    ProfessionellFable 5, Hyperframes, Veo, LTX—Fable 5, LTXSeedance
    NachrichtenRemotion, Veo, LTX, Seedance—Remotion, LTX, Seedance—
    AnleitungRemotion, Hyperframes, Veo, LTX—Veo—
    ErklärerLTX, SeedanceFable 5SeedanceFable 5
    MarketingSeedanceFable 5, Remotion, HyperframesSeedanceFable 5, Remotion, Hyperframes

    Kein System gewinnt überall: Seedance führt bei der professionellen Bereitstellung, bricht jedoch beim Marketing ein (P 0,30); Veo knüpft an die Spitze der Nachrichtenübermittlung an, ist aber bei den Anleitungen der schlechteste Anbieter. TapVids Arena-Gewinnrate nach Anwendungsfall: Professional 0,450, News 0,433, Explainer 0,429, How-To 0,417, Marketing 0,308. Zusammengesetzte Informationsqualität von TapVid nach Anwendungsfall: News 87, How-To 89, Explainer 81, Professional 71, Marketing 63.

    10

    Versuchen Sie es mit TapVid

    Verwandeln Sie bereitgestellte Assets und genehmigte Kopien in einen überprüfbaren Erklärvideo-Workflow. TapVid erkunden.

    11

    Referenzen und Zitate

    Zu den unterstützenden Bewertungsmethoden gehören T2VTextBench, T2VWorldBench und das Text-to-Video Human Evaluation Protocol.

    Recommended citation (APA): Law, D. (2026, September 6). AI video benchmark: Accuracy vs aesthetics (Version 1.0). TapVid Research. https://tapvid.ai/blog/information-dense-ai-video-benchmark

    @techreport{law2026aiVideoBenchmark,
      author = {Derek Law},
      title = {AI Video Benchmark: Accuracy vs Aesthetics},
      institution = {TapVid Research},
      year = {2026},
      month = {September},
      url = {https://tapvid.ai/blog/information-dense-ai-video-benchmark},
      note = {Version 1.0; July 2026 benchmark run}
    }

    12

    Über den Autor

    Derek Law
    Derek Law

    Derek Law ist CTO und Mitbegründer von TapVid. Seine Arbeit wird von einer einfachen These geleitet: Die Einschränkung der KI ist die Schnittstelle, nicht die Intelligenz. Zuvor arbeitete er an Alexa AI und GenUI für Amazon AGI.

    So wurde dieser Artikel geprüft

    Grundlage: Der redaktionelle Veröffentlichungsnachweis von TapVid für diesen ArtikelBelege: Autorenangabe, Veröffentlichungshistorie und Quellenlinks, wenn externe Aussagen sie erfordern

    Artikelversion7. September 2026

    Über den AutorDerek Law

    CTO & Co-founder, TapVid

    Derek Law is CTO and co-founder of TapVid. His work is guided by a simple thesis: the constraint on AI is the interface, not intelligence. Previously, he worked on Alexa AI and GenUI for Amazon AGI.

    Alle 1 Artikel ansehen →

    Derek Law lädt dich ein, dich auf Discord mit anderen Video-Creatorn auszutauschen.

    Derek auf Discord beitreten →
    Verwandeln Sie genehmigte Assets und Kopien in ein überprüfbares Erklärvideo

    Nutze deine vorhandenen Materialien

    Von deinenDateienDateienzum veröffentlichungsfertigen Video

    WEB→ VIDEOPPT→ VIDEOPDF→ VIDEOASSETS→ VIDEOAUDIO→ VIDEOVIDEO→ VIDEOTALKING HEAD→ VIDEOWEB→ VIDEOPPT→ VIDEOPDF→ VIDEOASSETS→ VIDEOAUDIO→ VIDEOVIDEO→ VIDEOTALKING HEAD→ VIDEO

    Weiterlesen

    Ähnliche Artikel

    Video-Abschlussrate 2026: Sieben Definitionen Geprüfte Forschungsabdeckung
    Forschung·11 Min. Lesezeit

    Video-Abschlussrate 2026: Sieben Definitionen geprüft

    Sieben First-Party-Definitionen zeigen, wie Wiedergaben, Starts, Impressionen, Zuschauer und Meilensteinzahlen die Abschlussrate von Videos beeinflussen.

    4. Sept. 2026

    Benchmark für KI-Video-Workflows auf Basis von 6.464 zugeordneten TapVid-Nutzern
    Forschung·11 Min. Lesezeit

    Benchmark für KI-Video-Workflows: 6.464 Nutzer analysiert

    Eine zugeordnete Kohorte von 6.464 TapVid-Nutzern zeigt, warum Briefing, Skript, gültiges Video, Wiedergabe, Export und Teilen jeweils eigene Workflow-Kennzahlen benötigen.

    2. Sept. 2026

    Mit TapVid schnell ein animiertes Video erstellen, ohne Qualität einzubüßen
    Anleitung·10 Min. Lesezeit

    So erstellen Sie schnell ein animiertes Video ohne Qualitätsverlust

    Eine schnelle, qualitätssichere Methode für Teams und Creator, die unter echtem Zeitdruck ein animiertes Video erstellen müssen.

    16. Apr. 2026

    Bereit für dein erstes Video?

    Schließen Sie sich Tausenden von Produktteams an, die mit KI in Minuten professionelle Videos erstellen.

    Dein erstes Video in unter 5 Minuten →Demo buchen →
    Tapvid

    TapVid verwandelt die Materialien, die dein Unternehmen bereits hat, in ein präzises Video, das die Aufgabe klar erklärt und sofort veröffentlicht werden kann.

    TikTokInstagramXDiscordYouTube

    TapVid

    Funktionen

    KI-Erklärvideo-GeneratorKI-Motion-Graphics-GeneratorKI-Produktdemo-Video-GeneratorProduktdemo-Video-MakerErklärvideo-VorlagenVideoproduktionsplan-VorlageVideo-Creative-Briefing-VorlageUnternehmensvideo-VorlageVideo-Sales-Letter-VorlageVideo-ProduktionsangebotsvorlagePromo-Video-VorlageVideo-ProduktionsvorlageKI-Produktvideo-GeneratorKI-B-Roll-GeneratorTalking-Head-Video-OptimiererKI-Video-KlonerPrompt to VideoText-zu-Video-KIText zu Motion GraphicsMaker für animierte VideosMaker für animierte ErklärvideosGenerator für kinetische TypografieMaker für animierte DiagrammeMaker für animierte CollagenKostenloser KI-Video-Generator

    In Video umwandeln

    Screenshot zu VideoBild zu VideoAssets to VideoAudio to VideoVideo-zu-Video-KIPDF zu VideoPPT zu VideoArtikel zu VideoBlog zu VideoURL zu VideoSkript zu VideoGoogle Slides zu VideoWord zu VideoSOP als Video

    Anwendungsfälle

    KI-Lernvideo-MakerSaaS-ErklärvideoKI-VideoautomatisierungSaaS-VideoproduktionIndustrievideo-ProduktionProduktlaunch-Video-MakerKI-Werbevideo-GeneratorKI-Dokumentarfilm-MakerMaker für animierte Social-Media-VideosInfografik-Video-MakerPodcast zu VideoWhiteboard-Animations-MakerWhiteboard-ErklärvideoE-Commerce-VideoanzeigenStartup-ErklärvideoCase-Study-VideoBildungsvideoTutorial-VideoKunden-OnboardingHelp-Center-VideoAPI-Docs-Video

    Lösungen

    ErklärvideoProduktdemo-VideoMeeting-Recap-VideoWebinar-ClipsMarketing-VideoFeature-AnkündigungWettbewerbsvergleichNewsletter-VideoLandingpage-VideoInvestor-Pitch-Video

    Ausgewählte Guides

    Video-Prompt-BibliothekGemini Omni 1.1 Flash Prompt-BibliothekMiniMax H3 Prompt-BibliothekBeste YouTube-Nischen ohne GesichtGuide zur Collage-Animation

    Unternehmen

    Alle FunktionenÜber unsBlogPreiseKontakt

    © 2026 TapVid. Alle Rechte vorbehalten.

    Datenschutz
    Nutzungsbedingungen