TapVid
    API & MCP요금제블로그회사 소개
    블로그›AI 비디오 벤치마크: 정확성과 미학
    블로그로 돌아가기

    AI 비디오 벤치마크: 정확성과 미학

    6,760개의 블라인드 평가를 통해 AI 생성 비디오의 사실적 범위, 시청자 이해도, 시각적 품질 및 미학에 대해 무엇을 알 수 있는지 알아보세요.

    리서치
    Derek LawDerek Law2026년 9월 7일 · 29분 분량2026년 9월 7일 · 29분 분량Discord
    Derek LawDerek LawCTO & Co-founder, TapVid

    저자 및 다른 영상 크리에이터와 교류하고 실전 튜토리얼을 시청하세요.

    Discord 참여하기
    2026년 9월 7일29분 분량
    7개 시스템 전반에 걸쳐 정확성, 이해도, 시각적 품질, 미학을 비교하는 AI 비디오 벤치마크
    다음 도구로 요약어시스턴트 6개
    ChatGPTPerplexityTapVidvideoClaudeGeminiGrok
    AI 에이전트에서 영상 만들기TapVid API & MCP 연결→

    이 글의 목차

    1. 01AI 비디오 벤치마크 평결: 중요한 콘텐츠에 우선 — 다른 모든 곳에서는 균형 유지
    2. 02재미가 아닌 정보를 제공해야 하는 비디오를 위해 제작됨
    3. 03유익한 비디오는 절충점이며 TapVid는 균형점을 유지합니다.
    4. 04화면에 사실을 표시하는 것이 바인딩 제약 조건이며 TapVid가 이를 가장 잘 수행합니다.
    5. 05시청자는 현장의 모든 시스템에서만큼 TapVid에서 많은 것을 배웁니다.
    6. 064개의 시각적 차원 중 3개 차원에서 리더와 통계적으로 연결됨
    7. 07VBench 업계 표준 자동화 지표로 검증된 사람의 주석
    8. 08두 가지 목표: 마케팅 콘텐츠와 정보 거래가 없는 미적 매력
    9. 09동결된 프로토콜, 시드된 통계, 모든 결과 전체
    10. 10TapVid를 사용해 보세요
    11. 11참고문헌 및 인용
    12. 12저자 소개
    다음 도구로 요약API & MCP →
    ChatGPTPerplexityTapVidClaudeGeminiGrok

    TL;DR

    정보 밀도가 높은 영상에서는 TapVid가 선두를 달리고 있습니다.

    이 AI 비디오 벤치마크는 inform(교육, 편집, 설명)가 재미가 없는 비디오용으로 제작되었습니다. 정보 밀도가 높은 장면에서 TapVid는 완전한 사실 범위 선두를 차지하고 TeachQuiz 정보 전달 부문에서 공동 1위를 차지했으며 7개 시스템에서 전체 품질 부문에서 1위를 차지했습니다. 독립적인 업계 표준 자동화 측정 지표인 VBench는 ​​인간 패널의 선호도를 재현하여 평가의 엄격함을 확인합니다.

    01

    AI 비디오 벤치마크 평결: 중요한 콘텐츠에 우선 — 다른 모든 곳에서는 균형 유지

    전문, 뉴스, 노하우, 교육 등 정보가 많은 장면은 벤치마크의 대상 도메인이며 TapVid가 승리하는 곳입니다. 25개 장면 모두에서 TapVid는 정보 품질 측면에서 7위 중 2위를 차지했으며 는 두 정보 축 모두에서 강력한 유일한 코드 렌더러입니다.

    전체 품질 — 정보 + 미학 75.2 T 정보 밀도가 높은 작업에 대한 7개 중 1위 — 모든 축에서 동시에 높은 수준을 차지하는 유일한 시스템입니다.

    미학적 선호도 대 정보 리더인 Fable 5 58.7% 나란히 보기에서 해당 분야 최고의 정보 시스템보다 선호되며 크게 잃지 않습니다.

    사실 보도 — 정보 밀도가 높은 장면 83.6% 노골적인 현장 선두입니다. 화면에 필수 정보를 표시하는 데 있어서 경쟁업체 6개 중 5개보다 훨씬 앞서 있습니다.

    TeachQuiz 정보 전달 — 정보 밀도가 높은 장면 84.5% 공동 1위. 시청자는 현장의 모든 시스템 이후뿐만 아니라 TapVid 이후에도 이해력 질문에 답합니다.

    전반적인 품질 — 정보 + 미적 · 정보 밀도가 높은 장면

    *(콘텐츠 충실도 + 시각적 품질 + 미적 선호도) / 3 · 필드 상대 T 점수(70 = 필드 평균, 10 = 1 SD)*

    전반적인 품질 — 정보 + 미적 · 정보 밀도가 높은 장면
    전반적인 품질 — 정보 + 미적 · 정보 밀도가 높은 장면

    두 프레임 모두 어디에서나 보고됩니다. 헤드라인 주장은 벤치마크 대상인 정보 밀도 프레임(UC1–UC4)을 사용합니다. 여기에 표시되어 있으며 TapVid가 전체 품질에서 1위를 차지합니다. 25개 장면 모두에서 TapVid는 정보 품질(T 78 대 Fable 5의 85)에서 7위 중 2위를 차지했습니다. 신뢰 구간이 포함된 전체 스코어카드는 부록에 있습니다.

    벤치마크

    02

    재미가 아닌 정보를 제공해야 하는 비디오를 위해 제작됨

    5가지 사용 사례 각각은 실제 소스 자료를 기반으로 하며 5가지 의도 중심 장면에서 평가됩니다. 개요는 시청자가 확인해야 할 사실을 지정하고 인간 주석자는 그러한 사실을 측정합니다. 목표는 심미적이거나 오락적인 콘텐츠가 아닌 정보 밀도가 높고 의도가 명확한 비디오(교육, 편집, 설명)입니다.

    분야 — 7개 시스템, 2개 패러다임

    체계하네스 / 모델가족
    TapVid코드 렌더링된 비디오코드 렌더링
    Fable 5Claude Code · Fable 5코드 렌더링
    코드렌더링 HClaude Code · Sonnet 5코드 렌더링
    코드렌더링 RCodex · GPT-5.5코드 렌더링
    픽셀 확산 L공식 스튜디오 · 프로 모드, 1080p픽셀 확산
    SeedanceSeedance 2.0 · Jimeng · VIP 모드, 720p픽셀 확산
    VeoVeo 3.1 · Google Flow · 품질 모드, 720p픽셀 확산

    2026 7월 6일~12에 액세스한 모든 시스템: 7월 6일자로 최신 릴리스에서 동결된 로컬 실행 도구, 공식 플랫폼의 최신 플래그십 모델로 호스팅된 시스템 — 모든 시스템은 최대 품질 설정인 16:9로 설정되었습니다. 소스가 포함된 정확한 버전 핀은 부록 A에 있습니다.

    5가지 사용 사례, 실제 소스 자료

    사용 사례소스 자료
    전문기업/자율학습GDPval 작업 — 전문 및 기술 서비스, 정부, 제조, 금융
    뉴스 사설2025~26년 커버: Economist, FT, Bloomberg, Nature, Science
    라이프스타일 노하우인기 #HowTo YouTube — 공예/DIY, 예술, 피트니스, 사고방식, 퍼즐
    설명자 교육가장 많이 본 "AP 시험 설명" - 역사, 심리학, 미적분, 생물학, 지리
    마케팅 제품/판매부문별 NASDAQ 가장 가치 있는 기업 출시 동영상

    생성 전에 수정된 샘플링 규칙. 각 사용 사례는 사전 정의된 규칙에 따라 5개의 장면을 그립니다. 즉, 소스 풀을 클러스터링하고 클러스터당 하나를 무작위로 샘플링합니다(최고 산업, 출판, 콘텐츠 카테고리, AP 주제, NASDAQ 부문). 모든 브리핑은 시스템이 아무것도 생성하기 전에 작성되고 동결된 완전한 정보 페이로드를 전달하는 매우 상세한 비디오 생성 프롬프트입니다.; 필수 사실 체크리스트(벤치마크 전체에 걸쳐 168개 사실)와 이해력 질문(149개)이 동시에 작성되어 사람의 검토를 거쳤습니다. 전체 작업 예제는 부록 B에 있습니다.

    필드 운영 방법 - 한 번의 샷, 동일한 간략한, 최고 설정

    • 동일한 입력: 모든 시스템은 동일한 간략한 축어를 수신했습니다. 즉, 시스템별 프롬프트 엔지니어링이 전혀 없습니다.
    • Best-of-1: 장면당 1세대, 선별되지 않음. 심각한 실패는 성공할 때까지 재시도됩니다(최대 3번의 재시도 관찰).
    • 생성된 Durations: 브리핑에 의해 설정된 목표 길이; 각 시스템의 실제 출력은 있는 그대로 사용됩니다(시스템 평균 1.1~4.2분).
    • 173/175 회계: Fable 5의 안전 규칙은 25개 보고서 중 2개를 거부했습니다. Opus 폴백을 대체하는 대신 우리는 Fable 5 자체의 23세대에 대해서만 점수를 매겼습니다. 경쟁자가 조용히 약화되지 않았으며 누락된 셀이 분모에서 삭제되어 귀속되지 않았습니다.

    주석 패널 — 독립형, 블라인드형, 완전 교차형

    • 12 독립적인 주석자는 어떤 시스템 팀에도 소속되지 않은 아웃소싱 프리랜서입니다. 이들은 각각 QS 세계 순위 상위 50대 대학에서 석사 학위 이상을 소지하고 인증된 영어 능력을 갖추고 있습니다.
    • 전체 블라인드: 동영상은 라벨이 지정되지 않은 상태로 무작위 순서로 표시됩니다. 주석 작성자에게는 어떤 시스템이 비디오를 생성했는지 알려주지 않았습니다.
    • 완전 교차: 12명의 주석자가 모두 비디오당 2명의 평가자로 7개 시스템을 모두 평가했습니다. 엄격하거나 관대한 평가자는 모든 시스템을 동등하게 이동하며 비교를 편향시킬 수 없습니다.
    • 클릭 작업이 아닌 고의적 시청: 5분 미만의 동영상당 최대 20분의 주석, 현지 최저 임금의 4배로 지급됩니다. 2026년 7월 13~15일에 주석이 추가되었습니다.

    공개된 방법을 기반으로 사람이 측정한 측정항목

    모든 비디오는 완전히 교차된 주석 패널에 의해 채점됩니다. 모든 주석자는 모든 시스템을 평가하므로 엄격하거나 관대한 평가자는 모든 시스템을 동등하게 이동하며 비교를 편향시킬 수 없습니다. 패널은 게시된 방법을 기반으로 5개 스테이션에서 6,760개의 인간 주석를 생성했으며 그 중 3개는 ICML, WACV 및 IEEE TPAMI / CVPR에서 동료 검토를 거쳤으며 모든 동영상은 *또한* VBench 자동화 모델로 점수가 매겨졌습니다. >370만 프레임 수준 모델 평가 .

    • TeachQuiz 정보 전달 (Code2Video, ICML 2026 · arXiv:2510.01174) — 시청자가 실제로 획득한 의도한 정보의 양.
    • 사실적 보도 — 개요에서 요구하는 사실, 화면에 표시되는 사실의 수, 문자 그대로, 읽을 수 있는 내용.
    • T2VTextBench 텍스트 정확도 (arXiv:2505.04946) — 화면 제목, 숫자 및 레이블의 정확성.
    • T2VWorldBench ( WACV 2026 · arXiv:2507.18107) — 4가지 품질 차원: 비디오 품질, 사실성, 관련성, 일관성.
    • 미적 선호 — 경기장 스타일로 TapVid를 나란히 비교합니다.
    • VBench (VBench++, IEEE TPAMI 2025 · 원본 VBench, CVPR 2024 하이라이트 · 공개 HuggingFace 순위표 뒤에 있는 모델) — 업계 표준 자동화된 비디오 품질 제품군, >370만 프레임 수준 모델 평가 .

    VBench는 인간 주석 에 대한 독립적인 기계 기반 교차 검사입니다. 프레임 품질 평가는 인간 선호도 순위를 재현하므로 두 계측기가 서로를 확증합니다( 발견 05 ).

    순위는 계산 방법에 따라 강력합니다. 세 개의 독립 추정기(원시 비율, 일회성 정보 획득 및 혼합 효과 로지스틱 모델)는 동일한 순서를 생성하고 신뢰도 가중치 및 PCA 변형은 이를 변경하지 않습니다. 마케팅은 정보 집약적인 네 가지 사용 사례와는 다른 작업 계열로 작동하기 때문에 every 결과는 두 개의 프레임, 즉 25개 장면 모두와 정보 집약적 프레임(Professional, News, How-To, explainer)으로 보고됩니다. 두 가지에 대한 전체 표는 부록에 있습니다.

    FINDING 01 · 전체 필드 프레임E

    03

    유익한 비디오는 절충점이며 TapVid는 균형점을 유지합니다.

    WIN 이 분야는 절충 영역입니다. 정보 품질에서는 순서가 Fable 5 > TapVid > 다른 모든 사람입니다. 미적 선호에서는 순서가 정확히 반전됩니다. TapVid는 두 가지 정보 축(Content Fidelity 77, Visual Quality 79, 7/7 중 2번째)에서 모두 높은 유일한 코드 렌더러입니다.

    미적 선호도는 경기장 스타일(동일한 개요의 두 비디오를 나란히 놓고) 측정되며 정보 기준표에서 확인할 수 없는 부분을 포착합니다. 즉, 모든 정보 지표와의 상관 관계는 음수 대 영(-0.22 ~ -0.01)입니다. 코드 렌더러는 유익한 품질을 구매합니다. 픽셀 확산은 미적 매력을 구매합니다. 아래 프론티어는 두 프레임 모두에서 7개 시스템을 모두 절충합니다.

    정보-미적 개척지

    *x: 정보 품질 · y: 미적 선호도 · 필드 상대 T 점수(70 = 필드 평균) · 정보 밀도가 높은 장면*

    정보-미적 개척지
    정보-미적 개척지

    TapVid는 두 프레임 모두에서 매우 유익하고 미학적으로 선호되는 녹색 사분면의 유일한 시스템입니다. 경계는 내리막으로 이어집니다. 정보 품질은 Fable 5 > TapVid > 나머지 순서를 지정하고 미적 선호도는 이를 끝까지 반전시킵니다. 정보 밀도가 높은 장면에서 TapVid는 최전선의 팔꿈치(정보 품질 82, 리더의 3.5T 이내)로 이동하는 반면 픽셀 확산 미적 가장자리는 패리티로 축소됩니다. 25개 장면 모두에서 Seedance와 Pixel-diffusion L은 표시된 기본 설정 범위보다 높습니다. 미적 선호도는 정보 품질 옆에 보고되며 평균이 적용되지 않습니다.

    TAPVID의 미적 승률 — 나란히 보기, 25개 장면 모두

    *비교 시 TapVid 승리 비율(동점은 절반) · ×100*

    TAPVID의 미적 승률 — 나란히 보기, 25개 장면 모두
    TAPVID의 미적 승률 — 나란히 보기, 25개 장면 모두

    50 이상 = 시청자가 TapVid를 선호합니다. 혼합 로짓 무손실 / 결정적인 승리 테스트의 중요성; 전체 CI와 무손실 프레임은 부록에 있습니다.

    TAPVID의 미적 승률 — 나란히 보기, 정보가 많은 장면

    *비교 시 TapVid 승리 비율(동점은 절반) · ×100*

    TAPVID의 미적 승률 — 나란히 보기, 정보가 많은 장면
    TAPVID의 미적 승률 — 나란히 보기, 정보가 많은 장면

    벤치마크의 대상 도메인에서는 미학적 결함이 동등하게 줄어들었습니다. Seedance만이 결정적인 비교에서 여전히 선호됩니다.

    WIN 해당 분야의 정보 리더인 Fable 5와 나란히 표시되며 시청자는 TapVid를 선호합니다. 승률 58.7%, TapVid는 크게 패하지 않습니다(P = 0.72). 고품질 합성물에서 TapVid를 능가하는 시스템은 시청자 앞에서 패배합니다.

    WIN 정보 집약적인 작업에서 TapVid는 콘텐츠를 주도하면서 미학적 측면을 전혀 양보하지 않습니다. 전체 비손실은 53.0%(패리티)로 증가하며 픽셀 확산 시스템은 거기에서 상당한 비손실 이점을 제공하지 않습니다. Google의 Veo에 비해 정보 품질(78 대 65)에서 앞서고 적용 범위에서 훨씬 앞서며 선호도가 높습니다.

    제한 사항 25개 장면 모두에서 미적 선호도가 진짜 약점입니다. TapVid의 전체 승률은 40.7%로, 비선호선 50%보다 훨씬 낮으며, 정보 순위 최하위인 Pixel-diffusion L 및 Seedance보다 선호도가 훨씬 낮습니다. 반전은 마케팅에 집중된 패러다임 트레이드오프입니다. 폐쇄 계획은 이를 직접적으로 해결합니다.

    FINDING 02 · 사실적 취재

    04

    화면에 사실을 표시하는 것이 바인딩 제약 조건이며 TapVid가 이를 가장 잘 수행합니다.

    WIN 정보가 많은 장면에서 TapVid는 필요한 사실의 83.6%를 화면에 표시합니다. 이는 경쟁업체 6개 중 5개보다 훨씬 앞서 있는 현장 선두입니다. 25개 장면 모두에서 통계적으로 선두 Fable 5와 동률을 이루고 있으며 모든 픽셀 확산 시스템보다 훨씬 앞서 있습니다.

    적용 범위는 벤치마크의 가장 눈에 띄는 지표입니다. 필드는 2개의 깨끗한 계층으로 분할되며, 4개의 코드 렌더러(화면에 표시된 사실의 74~79%)가 3개의 픽셀 확산 시스템(54~61%)에서 멀리 떨어져 있습니다.

    사실적 범위 - 화면에 표시된 필수 사실의 공유

    *평균 · 장면에 대한 95% 부트스트랩 CI · 정보 밀도가 높은 장면 · ×100*

    사실적 범위 - 화면에 표시된 필수 사실의 공유
    사실적 범위 - 화면에 표시된 필수 사실의 공유

    정보 밀도 프레임: TapVid 83.6 [77.3–89.0]이 완전히 앞서갑니다. ; Fable 5를 제외한 모든 시스템과의 격차는 통계적으로 유의미합니다(혼합 로짓 95% CI는 0을 제외함). All-25 프레임: Fable 5 79.0, TapVid 77.3 - 통계적 동점 - Seedance, Veo 및 Pixel-diffusion L이 두 프레임 모두에서 크게 뒤처져 있습니다.

    적용 범위가 배송을 촉진합니다 - 동영상당 1개 지점, 173개 동영상

    *x: 사실적 보도 · y: TeachQuiz 정보 전달(정확한 비율) · ×100*

    적용 범위가 배송을 촉진합니다 - 동영상당 1개 지점, 173개 동영상
    적용 범위가 배송을 촉진합니다 - 동영상당 1개 지점, 173개 동영상

    승리 일단 화면에 사실이 나타나면 시청자는 ~95%의 시간 동안 그것을 얻습니다. 173개의 비디오에서 적용 범위와 전달의 상관 관계는 r = 0.70이며 적합선은 사실이 없는 바닥 36%에서 화면 상한선 96%까지 이어집니다. 이해력은 거의 해결된 단계입니다. 게임은 적용 범위이며 TapVid는 가장 잘 플레이합니다.

    사용 사례별 적용 범위 - 모델 예측 P(화면상의 사실)

    *사용 사례별 혼합 로짓 예측 확률 · ×100*

    사용 사례별 적용 범위 - 모델 예측 P(화면상의 사실)
    사용 사례별 적용 범위 - 모델 예측 P(화면상의 사실)

    WIN TapVid는 5가지 사용 사례 중 4가지에서 적용 범위 선두에 대해 선두 또는 동점을 기록했습니다. News(81.9) 및 How-To(86.7)를 완전히 리드하고 있으며 Professional에서는 전체 리더인 Fable 5를 포함한 4개의 경쟁사보다 훨씬 앞서 있습니다.

    제한 사항 마케팅은 예외입니다. TapVid의 적용 범위는 Fable 5, Code-render R 및 Code-render H 뒤의 코드 렌더러 하단인 53.8%로 떨어집니다. 동일한 간격이 모든 지표의 마케팅 열을 형성합니다. 폐쇄 계획은 이를 하나의 문제로 취급합니다.

    FINDING 03 · TEACHQUIZ 정보 전달 Y

    05

    시청자는 현장의 모든 시스템에서만큼 TapVid에서 많은 것을 배웁니다.

    WIN 정보 밀도가 높은 장면에서 TapVid는 TeachQuiz 정보 전달에서 1위를 차지했습니다. 시청자는 이해 질문의 84.5%에 정확하게 답했으며, 세 가지 시스템(코드 렌더 H, Seedance, 픽셀 확산 L)을 훨씬 능가했습니다. 25개 장면 전체에서 상위 5개 장면은 통계적으로 분리될 수 없습니다. TapVid는 Pixel-diffusion L 및 Seedance보다 훨씬 앞서 있습니다.

    전달은 TeachQuiz 프로토콜을 따릅니다. 시청 후 주석 작성자는 필요한 요약에 대한 객관식 질문에 답하고 각 비디오는 질문별 필드 기준에 따라 점수가 매겨집니다. 원시 정확한 비율, 일회성 정보 이득 및 혼합 효과 로짓 등 세 가지 독립적인 추정자가 순서에 동의합니다.

    TEACHQUIZ 정보 전달 — 이해 정확도

    *원시 정확률 · 혼합 효과 로짓의 TapVid 대비 유의성 · 정보 밀도가 높은 장면 · ×100*

    TEACHQUIZ 정보 전달 — 이해 정확도
    TEACHQUIZ 정보 전달 — 이해 정확도

    TapVid는 두 프레임 모두에서 최상위 수준입니다. 전체 사용 사례별 승/무/패 표는 부록에 있습니다.

    사용 사례별 전달 — 이해 정확도

    *사용 사례별 원시 정확한 비율 · 사용 사례 장면에 대한 95% 부트스트랩 CI가 있는 막대 · ×100*

    사용 사례별 전달 — 이해 정확도
    사용 사례별 전달 — 이해 정확도

    TapVid는 News(88.3) 및 How-To(89.7)에서 최상위 수준입니다. — 혼합 로짓 추론에 따르면 News의 Code-render R, Pixel-diffusion L 및 Seedance 및 How-To의 Veo를 훨씬 능가하며 어느 쪽도 지지 않습니다. Professional과 explainer는 미드필드입니다. 마케팅은 폐쇄 계획이 목표로 하는 격차입니다. 각 사용 사례는 5개 장면에 있으므로 CI가 넓습니다. 유의성 호출은 부록의 사용 사례별 혼합 로짓에서 나옵니다.

    T2VTEXTBENCH 텍스트 정확도 - 화면 제목, 숫자 및 라벨

    *[0,1]에 매핑된 4계층 등급 · 95% 부트스트랩 CI · 정보 밀도가 높은 장면 · ×100*

    T2VTEXTBENCH 텍스트 정확도 - 화면 제목, 숫자 및 라벨
    T2VTEXTBENCH 텍스트 정확도 - 화면 제목, 숫자 및 라벨

    WIN TapVid는 정보가 많은 장면에서 화면 텍스트를 가장 잘 렌더링합니다. 25개 장면 전체에서 필드 상단은 통계적으로 분리될 수 없습니다.

    FINDING 04 · 시각적 품질

    06

    4개의 시각적 차원 중 3개 차원에서 리더와 통계적으로 연결됨

    WIN T2VWorldBench 인간 평가에서 TapVid는 두 프레임 모두에서 현실성, 관련성 및 일관성 측면에서 선두 Fable 5와 통계적으로 동률을 이루었으며 4차원 복합(86.4)에서 확실히 7점 만점에 2위를 기록했습니다. 이는 Seedance 및 픽셀 확산 L보다 훨씬 앞서 있습니다. TapVid가 렌더링하는 것이 무엇이든 깔끔하게 렌더링됩니다.

    4개 차원은 차원별 루브릭에 대해 교차된 주석 패널에 의해 1~5점으로 평가됩니다. Fable 5와의 중요한 시각적 차이 중 하나는 비디오 품질(86.0 대 90.0)입니다. 다른 세 가지 차원은 통계적으로 연결되어 있습니다.

    T2VWORLDBENCH — 4차원, 25개 장면 모두

    *평균 등급 · 장면에 대한 95% 부트스트랩 CI · ×100 · * = TapVid에 비해 유의미함*

    T2VWORLDBENCH — 4차원, 25개 장면 모두
    T2VWORLDBENCH — 4차원, 25개 장면 모두

    TapVid는 품질, 사실성 및 일관성 부문에서 2위, 관련성 부문에서 3위(Fable 5 및 코드 렌더 R 뒤)입니다. 관련성("올바른 내용을 말하는가")은 콘텐츠 차원으로 작동하며 위의 콘텐츠 측정항목으로 분석됩니다.

    WIN 평가자가 완전히 동의하는 경우 TapVid가 가장 높은 평가를 내립니다. 정확한 일치 부분 집합에서 TapVid의 비디오 품질은 0.97로 상승하여 Fable 5를 능가합니다. TapVid의 확실한 승리는 분명합니다.

    FINDING 05 · 독립적인 확증

    07

    VBench 업계 표준 자동화 지표로 검증된 사람의 주석

    확인 공개 HuggingFace 순위표 뒤에 있는 자동화 모델인 VBench는 동일한 25개 장면에서 블라인드 실행을 통해 인간 패널과 독립적으로 모든 비디오의 점수를 매깁니다. 주석 작성자의 병렬 선호도와 동일한 방식으로 시스템의 순서를 지정합니다. Spearman ρ = VBench 프레임 품질과 인간 선호도 사이에서 +0.89; +0.87 하나의 시스템을 제외합니다. 인간의 선호 축은 우리 평가자의 인공물이 아닙니다. 종이 기반의 독립적인 기계 지표가 동일한 순서로 배치됩니다.

    사람의 라벨에 대한 지식 없이 계산된 널리 사용되는 자동화 모델은 시스템 순위에 대한 사람 패널의 의견에 동의합니다. 이는 평가자가 평가자의 특이성보다는 실제적이고 재현 가능한 신호를 포착한다는 증거입니다.

    자동화된 기기와 인간의 기기가 일치함 - 표시된 모든 동영상

    *x: VBench 비디오당 프레임 품질(자동화) · y: 각 시스템의 휴먼 승률 · 141 시스템×시스템별로 색상이 지정된 장면 비디오 · ×100*

    자동화된 기기와 인간의 기기가 일치함 - 표시된 모든 동영상
    자동화된 기기와 인간의 기기가 일치함 - 표시된 모든 동영상

    각 작은 점은 하나의 비디오의 자동화된 프레임 품질이며, 시스템별로 색상이 지정되고 해당 시스템의 인간 승률에 배치됩니다. 큰 점은 시스템 수단을 의미합니다. 색깔이 있는 구름은 승률 순서로 쌓이고 중앙은 왼쪽에서 오른쪽으로 올라갑니다. 자동화된 프레임 품질과 인간 선호도가 시스템의 순위를 함께 매깁니다( Spearman ρ = +0.89 ). 시스템은 이름이 지정되지 않은 채로 남아 있습니다. 요점은 한 시스템의 위치가 아니라 두 도구의 일치입니다.

    SRC VBench(VBench++, IEEE TPAMI 2025 · 원본 VBench, CVPR 2024 하이라이트)는 공개 HuggingFace 리더보드 뒤에 있는 표준 자동화 비디오 품질 벤치마크로, 클립당 6차원의 점수를 매깁니다. 이는 7월 13~14일에 전용 GPU에서 공식 VBench-Long 코드 경로(e946a8d 커밋)로 실행되었으며 인간 레이블과의 비교가 존재하기 전에 완료되었습니다. 프레임 품질 헤드(미적 + 이미징 품질)는 여기서 사용된 미적 교차 검사이며 작동 시 품질을 계산하므로 실패한 생성이 시스템 점수를 왜곡하지 않습니다. 모든 합성은 장면별 원시 점수에서 다시 계산되었으며 소스 보고서를 소수점과 일치시킵니다. 전체 실행 프로토콜은 부록 A에 있습니다.

    다음 승리는 CLOSE입니다

    08

    두 가지 목표: 마케팅 콘텐츠와 정보 거래가 없는 미적 매력

    두 가지 격차는 모두 측정되고, 지역화되며, 이미 작동하는 것과 분리 가능합니다. 정보 밀도가 높은 도메인을 획득하는 적용 범위 및 전달 엔진을 건드릴 필요도 없습니다.

    사용 사례별 TAPVID — 마케팅 격차는 렌더링이 아니라 콘텐츠입니다

    *콘텐츠 충실도 대 시각적 품질 종합 · 현장 기준 T-점수 · 사용 사례별*

    사용 사례별 TAPVID — 마케팅 격차는 렌더링이 아니라 콘텐츠입니다
    사용 사례별 TAPVID — 마케팅 격차는 렌더링이 아니라 콘텐츠입니다

    마케팅에서 TapVid의 시각적 품질은 75로 유지되는 반면 콘텐츠 충실도는 51로 떨어집니다. 즉, 비디오가 깔끔하게 렌더링되지만 필수 사실이 누락됩니다. 다른 곳에서는 두 축이 68-93에서 함께 움직입니다.

    미적 프로그램 — 미적 축을 높이고 정보 선두를 유지하세요

    *x: 정보 품질 · y: 미적 선호도 · T-점수 · 전체 25개 장면*

    미적 프로그램 — 미적 축을 높이고 정보 선두를 유지하세요
    미적 프로그램 — 미적 축을 높이고 정보 선두를 유지하세요

    선호도는 모든 품질 지표와 직교하기 때문에 움직임은 똑바로 입니다. 모션, 세련미 및 매력을 높이는 것은 유익한 리드를 전혀 소비하지 않고 TapVid를 개척지의 빈 오른쪽 상단 모서리로 이동시킵니다.

    NEXT 승리로 마무리 #1 — 마케팅 콘텐츠. 붕괴는 렌더링이 아닌 마케팅 현장에서의 사실 전달입니다. 즉, 재구축이 아닌 이미 4가지 사용 사례를 이끌고 있는 커버리지 엔진의 목표 확장입니다. 이를 닫으면 TapVid의 정보 밀도가 높은 적용 범위 리드가 전체 필드 리드로 전환됩니다. 마케팅을 제외하면 TapVid는 이미 적용 범위에서 6개 시스템 중 5개 시스템 중 5위를 차지했습니다.

    NEXT Win to close #2 — 정보 제공을 포기하지 않고 미적 선호 대 픽셀 확산. 선호도는 모든 품질 지표와 경험적으로 직교하므로 이를 종료하는 것은 적용 범위나 전달을 강제하는 거래가 아닌 자체 프로그램(모션, 광택, 매력)입니다. 정보 밀도 프레임은 상한선을 보여줍니다. 콘텐츠가 밀도가 높은 곳에서는 TapVid가 콘텐츠 선두를 유지하면서 이미 선호 패리티에 도달했습니다.

    부록

    09

    동결된 프로토콜, 시드된 통계, 모든 결과 전체

    시스템 버전은 소스와 함께 날짜별로 고정됩니다. 샘플링 규칙과 사실 확인 목록은 비디오가 존재하기 전에 수정되었습니다. 주석자 패널은 블라인드이고 완전히 교차되었습니다(A–B). 세 명의 독립적인 추정자가 모든 순서에 동의하고 모든 무작위성이 시드되며 독립적인 재실행을 통해 모든 아티팩트(C–E)가 재현됩니다. 두 프레임(F–K)에서 모든 지표에 대한 신뢰 구간이 포함된 순위표를 완성하세요. Δ 열은 별도의 언급이 없는 한 TapVid에 대한 혼합 로짓 로그 승산 대비입니다. WIN / LOSS = TapVid의 관점에서 95% 간격은 0을 제외합니다. TIE = 그렇지 않습니다.

    KEY 시스템 이름 지정. 이 보고서의 본문은 익명화된 레이블로 세 가지 시스템을 나타냅니다. 여기에만 명시된 그들의 실제 신원은 다음과 같습니다. 코드 렌더링 H = Hyperframes · 코드 렌더링 R = Remotion · 픽셀 확산 L = LTX. 아래 표에는 실제 제품명이 사용되었습니다.

    A · 실험 프로토콜 — 버전, 타임라인, 주석 원장

    Timeline(2026). 브리핑 + 7월 6일 이전에 작성 및 동결된 사실 체크리스트 → 7월 6일 시스템 동결 → 모든 세대 7월 6~12일 → VBench-Long 점수 7월 13~14일 → 인간 주석 7월 13~15일(첫 번째 응답 7월 13일 09:41, 마지막 7월 15일 04:33) → 통계 및 인간←VBench 정렬 7월 14~16일. 인간 라벨 비교가 존재하기 전에 VBench 점수 매기기가 완료되었습니다.

    Version pins — 7월 6일 동결 당시 최신 릴리스에서 로컬로 실행되는 도구입니다. 해당 기간 동안 최신 주력 모델의 플랫폼을 호스팅했습니다. 모든 16:9, 최대 품질 설정, 스토리보드/기획 기능은 각 플랫폼에서 제공됩니다.

    체계버전 · 플랫폼 · 설정원천
    TapVid액세스 창의 내부 빌드 전류—
    Fable 5Claude Code 2.1.202 · 모델 claude-fable-5(6월 9일 발표, 7월 1일 재배포) · 기본값공지 · 변경로그
    Hyperframesv0.7.37 · Claude Code · Sonnet 5 (6월 30일 출시) · 기본값출시 · Sonnet 5
    Remotionv4.0.485 · Codex CLI 0.142.5 · GPT-5.5(4월 23일 발표, GPT-5.6은 동결 후 7월 9일 출시) · 기본값출시 · Codex · GPT-5.5
    VeoVeo 3.1(2025년 10월 15일 발표) · Google Flow, Flow별 스토리보드 기획 · 품질 모드, 720p공지 · 모드 문서
    LTXLTX-2.3(2026년 3월 출시) · LTX Studio, GPT-Image-2를 사용하여 LTX Studio에서 스토리보드 기획 · Pro 모드, 1080p출시 · GPT-이미지-2
    SeedanceSeedance 2.0(2월 12일 발표) · Jimeng — ByteDance의 공식 소비자 플랫폼 — 에이전트 모드, 스토리 영화 기술 · VIP 모드(최고 품질), 720p공지 · Jimeng

    신속한 출처. 25개의 브리핑과 해당 사실 체크리스트는 모두 Claude Code에서 Claude Opus로 작성되었으며 사람의 검토를 거쳐 생성이 시작되기 전에 동결되었습니다. AI 저작자가 브리핑을 시스템의 관용구로 편향시키는 경우, 수혜자는 TapVid가 아닌 경쟁자인 Fable 5가 될 것입니다.

    6,760개 주석 원장. 주석자당 한 행 × 장면 × 시스템 × 항목: 사실 확인 2,326(168개 사실) + TeachQuiz 이해도 2,062(149개 질문) + T2VWorldBench 4차원 1,384(346개 비디오×평가자 단위 × 4) + 텍스트 정확도 692(346개 단위 × 등급 + 정크 플래그) + 병렬 우선 순위 296 = 6,760 . 모든 개수는 원시 내보내기에서 다시 계산할 수 있습니다.

    VBench run. 5× NVIDIA L4의 공식 VBench-Long 코드( vbench2_beta_long , 커밋 e946a8d ), 사용 사례당 샤드 1개, 최대 6시간 벽; 새로운 인스턴스에 환경을 고정하고 처음부터 재현합니다. 셀별 결과 JSON 및 실행 로그가 유지됩니다. 입력 정규화 및 >3.7M 평가 산술: 부록 E .

    B · 작업된 예 — 전체 파이프라인에 대한 간략한 설명

    개요(방법 장면 1): *"튀는 종이 — 접착제가 필요 없는 종이접기 장난감"*, 목표 5:00, 16:9. 모든 브리핑과 마찬가지로 이는 정확한 16진수 팔레트, 조명 및 카메라 언어가 포함된 아트 디렉션, 전체 음성 해설 텍스트 및 장면별 모션 노트가 포함된 9개 장면 샷 목록, 단일 마스터 프롬프트 등 7개 시스템 모두에 대해 동일한 완전히 지정된 제작 문서입니다. *"...세 가지 색상으로 구분된 종이(남색 6×6 외부 상자, 호박색 5×5 내부 단추, 보라색 9×4 스프링), 두 상자를 모두 구성하는 공유 블린츠 접기... 인접한 가장자리 아래에 플랩을 집어넣는 접착제가 없는 잠금 장치..."* 전체 정보 페이로드가 브리핑에 있으므로 적용 범위 실패는 프롬프트가 아닌 시스템에 기인합니다.

    It의 필수 사실 체크리스트(간단한 내용으로 작성, 생성 전 고정, 스테이션 항목은 영어로 렌더링됨). 사실은 화면에 그대로 나타나고 읽을 수 있는 경우에만 인정됩니다. 주석자는 프레임별로 재생할 수 있습니다.

    • 외부 상자 용지: 6×6 cm
    • 내부 단추 용지: 5×5 cm
    • 스프링 용지: 9×4cm
    • 접착제가 필요 없다는 약속: 접착제도 없고, 테이프도 필요 없으며 어디서나
    • 키 접기(이름별): blintz 접기(모서리에서 중앙으로)

    A TeachQuiz 이해 항목(시청 후 답변; "비디오가 이것을 제공하지 않음" 이스케이프가 잘못된 점수를 매김): *"두 상자가 공유하는 키 폴드는 무엇입니까?"* — 밸리 폴드 / 블린츠 폴드(모서리가 중앙으로) / 스쿼시 폴드 / 비디오는 이 정보를 제공하지 않았습니다.

    득점 방법. 이 장면에서 TapVid의 평가자 두 명 모두 5/5 사실를 인정하고 12/12 이해력 질문에 올바르게 답변했습니다. 동일한 항목이 이 장면의 다른 분야(폴더 이름 질문 포함)에서 실제로 누락된 항목을 포착했습니다. 이는 벤치마크가 측정하기 위해 구축된 차별입니다.

    C · 통계적 방법 - 추정량, 시드 및 독립적인 재검증

    Estimators. 이진 스테이션(커버리지, 전달): 베이지안 혼합 로지스틱 회귀 값 ~ 시스템 + (1|장면) + (1|항목), TapVid를 참조로 사용합니다. 등급 스테이션(텍스트, 치수): 주석 고정 효과를 갖춘 장면 클러스터 강력한 OLS. Leave-One-Out 정보 획득을 통해 추가로 전달됩니다. 3개의 독립적 추정기(원시율, 정보 이득, 혼합 로짓)는 두 프레임 모두에서 동일한 시스템 순서를 생성합니다.

    Uncertainty. 장면 수준 부트스트랩의 95% CI(25개 장면 리샘플링, B = 3000, 고정 시드) 유의성 = 95% 간격에서 0이 제외됩니다. 결과는 간격이 겹치는 계층으로 보고되며 부정확 순위는 아닙니다. VBench: 차원당 Skillings–Mack 옴니버스(23개의 완전한 장면 블록에 대해 p = 8e-18 ~ 1e-9에서 중요한 방법 차이), Holm 보정을 사용한 사후 쌍 Wilcoxon 부호 순위. Human<VBench 정렬: Spearman 순위 상관 관계, 2000× 부트스트랩으로 스트레스 테스트, 단일 시스템 아웃 유지 및 순열 테스트(모두 시드됨).

    Reproducibility — 독립적으로 재검증됩니다. 모든 분석 무작위성이 시드되고 원시 데이터(전체 주석 내보내기 및 장면별 VBench 점수)가 분석과 함께 제공되며 각 측정항목에는 고정된 종속성(Python 3.14.5 · numpy 2.5.1 · pandas 3.0.3 · scipy)에 따라 자체 단일 명령 재생 스크립트가 있습니다. 1.18.0 · 통계 모델 0.14.6 · matplotlib 3.11.0 · openpyxl 3.1.5). 새로운 환경에서 독립적으로 다시 실행하면 55개의 커밋된 결과 아티팩트가 모두 재생성됩니다. 모든 결정론적 출력 바이트가 동일하고, 15개의 숫자가 모두 픽셀이 동일하며, 변형 혼합 모델 열이 6e-06 로그 확률 이하와 일치하며 유의성 결과가 어디에서나 변경되지 않습니다.

    D · 신뢰성, 방법 및 제한 사항

    Rater 견고성 설계. 패널은 완전히 교차되어 모든 주석자가 모든 시스템을 평가하므로 평가자의 엄격함으로 인해 시스템 간 비교가 편향될 수 없습니다. 주석 임의 효과를 추가하면 유의미한 반전 없이 최대 0.16(전달)/0.31(커버리지) 로그 확률만큼 대비가 이동합니다.

    메트릭당 평가자 간 합의. 전달: 73.6% 원시 합의, Gwet AC1 0.59. 적용 범위: 67.2%, AC1 0.42 — 주석자 효과가 지배적인 방해 소스(sd 0.98)이므로 비교가 되지 않더라도 절대 적용 범위 수준은 평가에 민감합니다. 텍스트: 1학년 내 91%, 가중치 κ 0.27 — 가장 시끄러운 등급입니다. WorldBench 차원: 하나 내 79–85%, 가중치 κ 0.24–0.35. 미적 선호도: 가중치 κ 0.07 — 296번의 비교에 대한 총 승률은 의미가 있습니다. 개별 판단은 그렇지 않으며 직교성 상관 관계가 0으로 약화됩니다.

    Limitations. 전달은 이 7개 시스템 필드와 관련이 있으며 다른 필드의 벤치마크 실행에서는 비교할 수 없습니다. 이해력은 오픈북으로 관리됩니다. 0.86 중앙값 한도는 시스템 차이를 압축하고 비공개 실행은 가장 높은 수준의 샤프닝입니다. 사용 사례별 해상도에 따라 비디오당 2명의 평가자가 있는 25개 장면(사용 사례당 5개) — 최상위 계층은 완전히 분리되지 않습니다. 보장은 말 그대로이고 읽을 수 있는 경우에만 사실을 인정합니다. 혼합 로짓 구간은 변동적입니다(반보존적). 큰 의미 있는 대비는 안전합니다. 경기장의 스타 토폴로지는 경쟁자 대 경쟁사 순위 및 절대적인 미적 점수를 지원하지 않습니다. T-점수는 절대 등급이 아닌 현장 상대적 편의입니다. 초당 사실 대역폭 스테이션이 정의되었지만 이번 라운드에서는 계산되지 않았습니다.

    E · VBench ← 인간 정렬 — 방법

    Instruments. VBench 프레임 품질은 모델의 미적 품질 및 이미징 품질 차원의 평균으로, 작동 시 품질로 계산됩니다(실패한 세대는 제외되며 0점은 부여되지 않음). 인간의 선호는 TapVid에 비해 나란히 승률입니다. 상관 관계는 six 경쟁사 시스템에 대한 것입니다. TapVid는 모든 비교의 스타 토폴로지 앵커이므로 표시된 지점이 아닙니다.

    정렬(VBench 프레임 품질 ⇔ 인간 선호도)Spearman ρ
    전반적인+0.89
    단일 시스템 종료(최악의 경우)+0.87
    전문적인+0.94
    소식+0.77
    마케팅+0.70
    방법+0.48
    설명자−0.33

    전체 기호는 2000× 부트스트랩 리샘플링 및 단일 시스템 아웃을 유지합니다. n = 6 시스템은 형식적 중요성을 제한합니다. 설명자는 시청자가 프레임 다듬기를 통해 모션에 보상을 제공하는 세그먼트이므로 프레임 품질 지표는 그곳에서 다른 단서를 추적합니다. 모든 VBench 합성물은 원시 장면별 점수에서 다시 계산되었으며 소스 보고서를 소수점 이하 자릿수와 일치시킵니다.

    Run 출처 및 >3.7M 개수. VBench-Long( 커밋 e946a8d의 vbench2_beta_long ; VBench++, IEEE TPAMI 2025)는 인간 레이블 비교가 존재하기 전인 2026년 7월 13~14일에 NVIDIA L4 GPU에서 실행되었습니다. 입력은 장면별로 표준화되어 어떤 시스템도 인코딩 아티팩트를 얻지 못합니다. 720p 캡(업스케일링되지 않음), 하나의 균일한 24fps 프레임 그리드, 거의 무손실 재인코딩. 비디오당 6개 크기; 그 중 4개는 *모든 프레임*(각각 초당 24개 모델 전달)을 기록하고, 모션 부드러움은 초당 11.5회, 동적 수준은 초당 7.5회(영상 초당 116개 모델 전달)를 기록합니다. 32,141초의 스코어링된 비디오 전체: 373만 프레임 수준 모델 평가 . 길이가 잘린 빌드(위에 계산되지 않음)에 대한 추가 일관성 재검사를 통해 비디오 길이가 비교를 혼동하지 않는 것으로 확인되었습니다. 기본-트림 델타는 모두 < 0.0025입니다.

    F · 종합 스코어카드 - 정보 품질과 세 가지 축

    필드 상대 T 점수: 70 = 이 7개 시스템의 평균, 10포인트마다 = 1SD. 정보 품질 = 콘텐츠 충실도 및 시각적 품질 축의 동일 가중치 평균. 미적 선호도는 경기장에서 파생되며 정보 축 옆에 보고되며 내부에는 표시되지 않습니다. 이는 정보 축과 반대 방향으로 실행됩니다. 전반적인 품질(콘텐츠 + 시각적 + 미적 선호도)/3은 정보 밀도가 높은 시나리오 헤드라인입니다.

    전체 25개 장면

    체계유익한 품질95% CI콘텐츠시각적미적 취향
    Fable 585.4[78.3, 92.1]82.688.252.3
    TapVid78.2[69.3, 86.6]77.179.261.7
    Remotion72.3[61.5, 82.2]76.668.169.2
    Hyperframes71.8[59.3, 83.0]73.370.268.1
    Veo64.8[51.7, 77.0]66.063.674.6
    Seedance61.3[46.8, 75.1]60.362.283.1
    LTX56.3[41.8, 70.8]54.158.581.0

    정보 밀도가 높은 장면(전문가, 뉴스, 노하우, 설명)

    체계전체 품질(C+V+P)/3콘텐츠시각적미적 취향유익한 품질
    TapVid75.283.680.361.782.0
    Fable 575.082.888.154.285.5
    Seedance73.571.769.779.170.7
    LTX70.060.274.875.167.5
    Remotion69.777.565.965.771.7
    Hyperframes69.072.968.365.770.6
    Veo68.471.061.772.466.3

    25개 장면에 대한 부트스트랩 CI는 광범위하게 겹칩니다. 데이터가 지원하는 계층은 Fable 5 · TapVid · Remotion/Hyperframes · 픽셀 트리오입니다. 전체 품질 TapVid–Fable 5 간격(75.2 대 75.0)은 잡음 내에 있습니다. 순위는 방법(PCA 대 축 평균), 신뢰도 가중치 및 관련성이 그룹화된 위치에 따라 결정됩니다. TapVid의 미적 선호도는 경기장의 별형 토폴로지에 따라 0.5로 고정됩니다. 사용 사례별 변형은 경쟁사에 있습니다.

    G · 사실 보도 — 두 프레임 모두

    모든 25개 장면 — 화면에 필요한 사실을 축어적이고 읽기 쉽게 공유합니다. 95% 부트스트랩 CI; 혼합 로짓 대비.

    체계적용 범위95% CIΔ 대 TapVid95% CI결과
    Fable 50.790[0.717, 0.860]+0.094[−0.183, +0.370]묶다
    TapVid0.773[0.699, 0.843]—
    Remotion0.759[0.668, 0.845]−0.166[−0.417, +0.085]묶다
    Hyperframes0.745[0.642, 0.842]−0.199[−0.448, +0.050]묶다
    Seedance0.611[0.506, 0.710]−0.826[−1.052, −0.601]이기다
    Veo0.596[0.494, 0.697]−0.867[−1.091, −0.642]이기다
    LTX0.541[0.433, 0.658]−1.179[−1.400, −0.958]이기다

    정보 밀도가 높은 장면

    체계적용 범위95% CIΔ 대 TapVid95% CI결과
    TapVid0.836[0.773, 0.890]—
    Fable 50.792[0.710, 0.863]−0.291[−0.601, +0.020]묶다
    Remotion0.765[0.669, 0.857]−0.520[−0.801, −0.239]이기다
    Hyperframes0.727[0.607, 0.835]−0.681[−0.952, −0.409]이기다
    Seedance0.677[0.578, 0.770]−0.922[−1.182, −0.662]이기다
    Veo0.601[0.497, 0.714]−1.213[−1.464, −0.963]이기다
    LTX0.545[0.418, 0.671]−1.553[−1.798, −1.307]이기다

    적용 범위 ← 전달: Pearson r = 173개 동영상에서 0.70; 풀링된 OLS는 P(화면에서 이해됨 | 화면에서) = 0.96 및 화면 밖 바닥에서 0.36을 제공합니다. 혼합 로짓은 일치합니다(0.945 / 0.30). 적용 범위의 절대 수준은 평가에 민감합니다(D 참조). 시스템 간 비교는 그렇지 않습니다.

    H · TeachQuiz 정보 전달 - 두 프레임 모두

    모든 25개 장면 — 일반적인 장면/질문에서 원시 이해 정확률, 혼합 로짓 예측 P(정확함) 및 대비.

    체계원율예측된 PΔ 대 TapVid95% CI결과
    Fable 50.8210.868+0.243[−0.091, +0.576]묶다
    Remotion0.8120.857+0.147[−0.167, +0.461]묶다
    TapVid0.7950.838—
    Hyperframes0.7890.834−0.028[−0.330, +0.274]묶다
    Veo0.7850.830−0.052[−0.353, +0.249]묶다
    LTX0.7150.756−0.509[−0.786, −0.233]이기다
    Seedance0.6910.730−0.647[−0.918, −0.377]이기다

    정보 밀도가 높은 장면

    체계원율Δ 대 TapVid95% CI결과
    Fable 50.846+0.056[−0.342, +0.453]묶다
    TapVid0.845—
    Veo0.840+0.005[−0.368, +0.378]묶다
    Remotion0.832−0.067[−0.433, +0.299]묶다
    Hyperframes0.790−0.393[−0.731, −0.054]이기다
    Seedance0.786−0.423[−0.759, −0.087]이기다
    LTX0.752−0.650[−0.971, −0.329]이기다

    전달은 이 7개 시스템 필드(leave-one-out 이득/필드 기반 로짓)를 기준으로 합니다. 관리는 오픈북 방식으로 차이를 0.86 중앙값 상한선으로 압축합니다. 세 가지 추정기(원시, 이득 D, 혼합 로짓)가 두 프레임의 순서에 동의합니다.

    I · T2VTextBench 문자 정확도 및 T2VWorldBench 치수

    T2VTextBench 텍스트 정확도 — [0,1]의 4단계 등급; 클러스터에 강력한 대비 대 TapVid. * = 95% CI는 0을 제외합니다.

    체계전체 2595% CI정보 집약적95% CIΔ 모두-25
    Fable 50.783[0.714, 0.850]0.750[0.681, 0.825]+0.062
    TapVid0.740[0.660, 0.820]0.769[0.675, 0.856]—
    Hyperframes0.700[0.615, 0.785]0.706[0.613, 0.794]−0.009
    Remotion0.695[0.610, 0.785]0.688[0.594, 0.781]−0.050
    Seedance0.640[0.535, 0.740]0.700[0.594, 0.806]−0.087
    Veo0.630[0.530, 0.730]0.650[0.531, 0.762]−0.090
    LTX0.580[0.500, 0.660]0.619[0.537, 0.694]−0.145*

    T2VWorldBench, 모두 25개 장면 — 치수별 등급 및 종이 합성을 의미합니다. * = TapVid(클러스터 강력한 OLS)에 비해 중요합니다.

    체계품질실재론관련성일관성합성물
    Fable 50.900*0.9090.8910.9090.902*
    TapVid0.8600.8800.8440.8720.864
    Remotion0.8000.8600.8600.8240.836
    Hyperframes0.8120.8520.8160.8440.831
    Veo0.8000.8040.8080.8240.809
    Seedance0.8080.8080.772*0.796*0.796*
    LTX0.7920.784*0.688*0.792*0.764*

    합성물은 내부적으로 유효하지만(Cronbach α = 0.91) 하나의 콘텐츠 지향 축을 접습니다. 관련성은 형제 시각적 차원(0.61–0.66)보다 전달/범위(+0.77)와 더 많은 상관관계가 있습니다. 정보 밀도가 높은 프레임: TapVid는 모든 차원에서 2위를 유지합니다. Fable 5에 대한 품질 및 복합재 격차만 여전히 상당합니다.

    J · 미적 선호도(아레나 스타일) — 두 프레임, 두 판독값 모두

    Star 토폴로지: 모든 비교는 동일한 개요(296개 비교)에 대한 TapVid 대 하나의 경쟁사입니다. 승률은 무승부를 절반으로 계산합니다. TapVid에 대한 비손실 계산 동점; 둘 다보고됩니다. 이항 혼합 로짓과 0.5 비선호선의 결과입니다.

    전체 25개 장면

    대승률95% CI무손실95% CI평결
    Fable 50.587[0.482, 0.683]0.696[0.577, 0.808]TapVid는 지지 않습니다*
    Hyperframes0.440[0.347, 0.531]0.560[0.458, 0.667]던지기
    Remotion0.430[0.338, 0.519]0.540[0.433, 0.643]던지기
    Veo0.380[0.297, 0.464]0.480[0.389, 0.571]던지기
    LTX0.320[0.217, 0.417]0.380[0.267, 0.500]TapVid 패배*
    Seedance0.300[0.206, 0.393]0.400[0.286, 0.500]TapVid 패배*
    전반적인0.407[0.35, 0.47]0.507[0.44, 0.57]해당 분야보다 덜 선호됨*

    정보 밀도가 높은 장면 — 전체 승률 0.432 [0.37, 0.50], 무손실 0.530: 패리티. 상당한 비손실 적자가 사라집니다. 엄격하고 결정적인 비교에서는 Seedance만이 여전히 선호됩니다.

    대승률95% CI무손실95% CI
    Fable 50.569[0.450, 0.692]0.667[0.542, 0.800]
    Remotion0.463[0.354, 0.568]0.575[0.458, 0.692]
    Hyperframes0.463[0.361, 0.563]0.600[0.500, 0.714]
    Veo0.400[0.304, 0.500]0.500[0.385, 0.607]
    LTX0.375[0.250, 0.500]0.425[0.292, 0.545]
    Seedance0.338[0.225, 0.450]0.425[0.286, 0.567]

    선호도는 정보 지표와 경험적으로 직교합니다. 각 지표에 대한 TapVid의 비디오당 이점과 경기장 결과의 상관 관계는 -0.22 ~ -0.01(n = 148 셀)을 제공합니다. 모두 음수이거나 거의 0입니다. 무손실은 긍정적인 판독값입니다(비교의 20%가 동점임). 그 이유로 둘 다 표시됩니다.

    K · 사용 사례별 순위 — TapVid가 승리하고 패배하는 위치

    사용 사례당 TapVid에 비해 상당한 승리/패배(95% 간격에서 0 제외). 셀에는 경쟁자가 나열됩니다. “—” = 없음.

    사용 사례적용 범위: TapVid 비트에게 진다배송 : TapVid 비트에게 진다
    전문적인Fable 5, Hyperframes, Veo, LTX—Fable 5, LTXSeedance
    소식Remotion, Veo, LTX, Seedance—Remotion, LTX, Seedance—
    방법Remotion, Hyperframes, Veo, LTX—Veo—
    설명자LTX, SeedanceFable 5SeedanceFable 5
    마케팅SeedanceFable 5, Remotion, HyperframesSeedanceFable 5, Remotion, Hyperframes

    모든 곳에서 승리하는 시스템은 없습니다. Seedance는 전문적인 제공을 주도하지만 마케팅에서는 붕괴됩니다(P 0.30). Veo는 뉴스 전달 부문에서 선두를 달리고 있지만 How-To 부문에서는 최악입니다. TapVid의 사용 사례별 경기장 승률: Professional 0.450, News 0.433, explainer 0.429, How-To 0.417, Marketing 0.308. TapVid의 사용 사례별 복합 정보 품질: 뉴스 87, How-To 89, 설명 81, 전문가 71, 마케팅 63.

    10

    TapVid를 사용해 보세요

    제공된 자산과 승인된 사본을 검토 가능한 설명 비디오 워크플로로 전환하세요. TapVid 탐색.

    11

    참고문헌 및 인용

    지원되는 평가 방법에는 T2VTextBench, T2VWorldBench 및 텍스트-비디오 인간 평가 프로토콜이 포함됩니다.

    Recommended citation (APA): Law, D. (2026, September 6). AI video benchmark: Accuracy vs aesthetics (Version 1.0). TapVid Research. https://tapvid.ai/blog/information-dense-ai-video-benchmark

    @techreport{law2026aiVideoBenchmark,
      author = {Derek Law},
      title = {AI Video Benchmark: Accuracy vs Aesthetics},
      institution = {TapVid Research},
      year = {2026},
      month = {September},
      url = {https://tapvid.ai/blog/information-dense-ai-video-benchmark},
      note = {Version 1.0; July 2026 benchmark run}
    }

    12

    저자 소개

    Derek Law
    Derek Law

    Derek Law는 TapVid의 CTO이자 공동 창립자입니다. 그의 작업은 간단한 논제에 따라 진행됩니다. AI에 대한 제약은 지능이 아니라 인터페이스입니다. 이전에는 Amazon AGI용 Alexa AI 및 GenUI 작업을 수행했습니다.

    이 글의 검증 방법

    검증 기준: 이 글에 대한 TapVid의 편집 및 게시 기록근거: 작성자 정보, 게시 이력, 외부 주장에 필요한 경우의 출처 링크

    글 버전2026년 9월 7일

    저자 소개Derek Law

    CTO & Co-founder, TapVid

    Derek Law is CTO and co-founder of TapVid. His work is guided by a simple thesis: the constraint on AI is the interface, not intelligence. Previously, he worked on Alexa AI and GenUI for Amazon AGI.

    전체 1개 글 보기 →

    Derek Law 님이 Discord에서 다른 영상 크리에이터들과 대화하도록 초대합니다.

    Discord에서 Derek 님과 함께하기 →
    승인된 자산을 전환하고 검토 가능한 설명 동영상으로 복사하세요.

    이미 가지고 있는 자료를 활용하세요

    가지고 있는파일파일에서 바로 게시할 수 있는 영상으로

    웹→ 영상PPT→ 영상PDF→ 영상소재→ 영상오디오→ 영상영상→ 영상토킹 헤드→ 영상웹→ 영상PPT→ 영상PDF→ 영상소재→ 영상오디오→ 영상영상→ 영상토킹 헤드→ 영상

    계속 읽기

    관련 글

    2026년 비디오 완료율: 7가지 정의 감사된 연구 표지
    리서치·11분 분량

    2026년 비디오 완료율: 감사된 7가지 정의

    7개의 자사 정의는 재생, 시작, 노출, 시청자 및 마일스톤 수가 동영상 완료율을 어떻게 변화시키는지 보여줍니다.

    2026년 9월 4일

    매칭된 TapVid 사용자 6,464명을 기반으로 한 AI 비디오 워크플로 벤치마크
    리서치·11분 분량

    AI 비디오 워크플로 벤치마크: 사용자 6,464명 분석

    매칭된 TapVid 사용자 6,464명의 코호트는 브리프, 스크립트, 유효한 비디오, 시청, 내보내기, 공유에 각각 별도의 워크플로 지표가 필요한 이유를 보여줍니다.

    2026년 9월 2일

    TapVid로 품질 저하 없이 애니메이션 영상을 빠르게 만들기
    사용법·10분 분량

    품질을 잃지 않고 애니메이션 영상을 빠르게 만드는 법

    실제 마감에 쫓기며 애니메이션 영상을 만들어야 하는 팀과 크리에이터를 위한, 빠르면서도 품질을 지키는 방법.

    2026년 4월 16일

    첫 영상을 만들 준비가 되셨나요?

    AI로 몇 분 만에 전문 영상을 만드는 수천 개 제품 팀에 합류하세요.

    5분 안에 첫 영상을 →데모 예약 →
    Tapvid

    TapVid는 비즈니스가 이미 보유한 자료를 내용을 명확하게 설명하고 바로 게시할 수 있는 정확한 영상으로 만듭니다.

    TikTokInstagramXDiscordYouTube

    TapVid

    기능

    AI 설명 영상 생성기AI 모션 그래픽 생성기AI 제품 데모 영상 생성기제품 데모 영상 메이커설명 영상 템플릿영상 제작 계획 템플릿영상 크리에이티브 브리프 템플릿기업 영상 템플릿영상 세일즈 레터 템플릿영상 제작 제안서 템플릿프로모 영상 템플릿영상 제작 템플릿AI 제품 영상 생성기AI B-roll 생성기토킹헤드 영상 강화 도구AI 영상 클로너Prompt to Video텍스트 투 비디오 AI텍스트로 모션 그래픽 만들기애니메이션 영상 메이커애니메이션 설명 영상 메이커키네틱 타이포그래피 생성기애니메이션 차트 메이커애니메이션 콜라주 메이커무료 AI 영상 생성기

    영상으로 변환

    스크린샷을 영상으로이미지를 영상으로Assets to VideoAudio to Video비디오 투 비디오 AIPDF를 영상으로PPT를 영상으로아티클을 영상으로블로그를 영상으로URL을 영상으로스크립트를 영상으로구글 슬라이드를 영상으로Word를 영상으로SOP 영상화

    활용 사례

    AI 학습 영상 메이커SaaS 설명 영상AI 영상 자동화SaaS 영상 제작산업 영상 제작제품 출시 영상 메이커AI 광고 영상 생성기AI 다큐멘터리 영상 메이커애니메이션 소셜 미디어 영상 메이커인포그래픽 영상 제작기팟캐스트를 영상으로화이트보드 애니메이션 메이커화이트보드 설명 영상이커머스 영상 광고스타트업 설명 영상사례 연구 영상교육 영상튜토리얼 영상고객 온보딩도움말 센터 영상API 문서 영상

    솔루션

    설명 영상제품 데모 영상회의 요약 영상웨비나 클립마케팅 영상기능 출시 안내경쟁 제품 비교뉴스레터 영상랜딩 페이지 영상투자자 피치 영상

    추천 가이드

    영상 프롬프트 라이브러리Gemini Omni 1.1 Flash 프롬프트 라이브러리MiniMax H3 프롬프트 라이브러리얼굴 없는 유튜브 추천 주제콜라주 애니메이션 가이드

    회사

    모든 기능소개블로그요금제문의하기

    © 2026 TapVid. All rights reserved.

    개인정보 처리방침
    이용약관