Gemini 3.7 비디오 이해는 기존 영상을 분석하며 새 영상을 만들지는 않습니다. 에이전틱 모드는 어떤 구간과 증거 채널을 더 자세히 볼지 계획합니다. 긴 녹화나 특정 순간 질문에 유용합니다. 이 가이드는 모드 선택과 검증 가능한 요청 방법을 다룹니다.
01
Gemini 3.7 비디오 이해란?
Gemini 3.7은 영상, 오디오, 자막 정보를 한 요청에서 추론합니다. Google 문서는 표준 처리의 기본 시각 샘플링을 초당 1프레임으로 설명합니다. 안정된 영상에는 효율적이지만 짧은 UI 상태나 빠른 동작을 놓칠 수 있습니다.
공식 출시 글에 따르면 에이전틱 처리는 검사 방법을 계획하고 관련 순간을 골라 자막, 오디오, 프레임 속도, 해상도를 조합합니다. 선택된 증거로 작업하므로 정답을 보장하지는 않습니다.
02
에이전틱 모드가 바꾸는 것
정적 샘플링은 일정한 패스로 무엇을 알 수 있는지 묻습니다. 에이전틱 검사는 이 질문에 필요한 다음 증거가 무엇인지 묻습니다. 긴 영상에서 관련 구간을 좁혀 더 자세히 확인할 수 있습니다.
LensWalk 같은 연구도 영상을 어떻게 볼지 계획하는 방향을 다룹니다. 에이전틱은 자동으로 정확하다는 뜻이 아닙니다. 좁은 질문, 명시적 증거, 증거가 없을 때의 거부 규칙이 필요합니다.
03
에이전틱 모드와 정적 샘플링 선택
이벤트를 놓쳤을 때의 영향으로 모드를 고르세요. Google은 긴 영상과 특정 순간 질문에 에이전틱 처리를 권하고, 5분 미만의 지연 민감 영상이나 전체 프레임 정밀도에는 정적 처리도 유용하다고 설명합니다.
| 상황 | 시작 모드 | 이유 |
|---|---|---|
| 짧고 안정된 영상의 넓은 요약 | 정적 | 일관된 처리량이 더 중요합니다. |
| 긴 회의에서 한 결정 찾기 | 에이전틱 | 발화와 짧은 화면 문서를 함께 봅니다. |
| 잠깐 오류가 뜨는 제품 데모 | 에이전틱 | 짧은 시각 상태가 핵심입니다. |
| 빠른 동작의 모든 프레임이 중요 | 높은 프레임 속도의 정적 처리 또는 전용 파이프라인 | 전체 프레임 정밀도가 목적입니다. |
| 짧은 영상의 거친 일괄 분류 | 정적 | 비용과 스키마 예측성이 중요합니다. |
실제 영상으로 두 모드를 시험하세요. 순간 이벤트, 오디오 전용 증거, 답할 수 없는 질문을 포함하고 시간 정확도, 근거 없는 주장, 지연, 스키마 일관성을 비교합니다.
04
프롬프트 전에 입력 계약 만들기
신뢰할 수 있는 요청은 소스, 모드, 질문, 출력, 검증을 정의합니다. 영상 입력을 텍스트보다 앞에 두고 지원 API에서 agentic을 지정하며 시간은 MM:SS로 요구합니다.
{
"input": [
{
"type": "video",
"uri": "YOUR_VIDEO_URI",
"processing": "agentic"
},
{
"type": "text",
"text": "첫 결제 실패를 찾으세요. MM:SS, 보이는 오류 문구, 직전 사용자 동작, 불확실성을 반환하세요."
}
]
}아래 예시는 Google 문서를 축약한 형태이며 TapVid 실행 벤치마크가 아닙니다. 최신 SDK 문법을 확인하세요. File API, Cloud Storage, 지원 YouTube URL, 문서상 100MB 미만의 짧은 인라인 입력을 사용할 수 있습니다.
05
근거 있는 답을 위한 증거 계약
좋은 프롬프트는 질문, 증거 채널, 타임스탬프 출력, 불확실성, 금지된 추론을 정합니다. 보이는 사실과 사람의 의도에 대한 추정을 분리합니다.
- 질문: 정확한 결정이나 이벤트를 정합니다.
- 증거 채널: 자막, 오디오, 화면 글자, UI, 동작.
- 출력: 시간과 짧은 결과를 요구합니다.
- 불확실성: 증거 부족을 밝힙니다.
- 제외: 추론하면 안 되는 결론을 정합니다.
각 결과에 구간, 관찰, 증거 채널, 구체적 근거, 신뢰도를 넣으세요. 영상이 답을 확립하지 못하면 “확인되지 않음”과 부족한 증거를 반환해야 합니다.
이 영상을 {{결정}}에 대해 분석하세요. 결과마다 MM:SS, 관찰, 증거 채널, 구체적 근거, 신뢰도를 반환합니다. 영상에 없는 사실은 추론하지 말고 증거가 없으면 “확인되지 않음”과 부족한 점을 씁니다.06
분석 작업별 복사 가능한 프롬프트
아래 템플릿은 기존 영상 분석용입니다. 자리표시자를 바꾸고 시간과 불확실성 규칙을 유지하며 중요한 결과를 원본에서 확인하세요.
제품 데모 실패 찾기
실패하거나 끝나지 않은 단계를 찾으세요. MM:SS, 직전 동작, 정확한 UI 증거, 발표자의 언급을 반환합니다. 근거 없는 멈춤은 실패로 보지 않습니다.긴 회의에서 결정 추출하기
가격, 출시일, 범위, 담당을 바꾸는 결정을 찾으세요. MM:SS, 결정, 담당자, 기한, 발화 근거를 반환하고 제안과 결정을 구분합니다.승인된 단계와 튜토리얼 비교하기
{{체크리스트}}와 비교해 올바름, 잘못됨, 없음, 불명확으로 표시합니다. MM:SS와 보이는 UI 라벨을 포함하고 내레이션만으로 화면 단계를 증명하지 않습니다.짧은 물리 이벤트 찾기
{{이벤트}}가 눈으로 확인되게 완료된 첫 순간을 찾으세요. 가장 이른 MM:SS, 완료 신호, 가림·흐림·편집에 따른 모호함을 반환합니다.이벤트, 증거, 거부 조건을 정의하는 것이 “깊게” 같은 모호한 형용사보다 검증 가능한 결과를 만듭니다.
07
여러 턴에서 영상 맥락 유지하기
여러 턴 분석은 영상과 처리 상태가 유지될 때만 작동합니다. 첫 질문이 이벤트를 찾고 다음 질문이 관련 사례를 물을 때 마지막 답변만 저장해서는 증거가 유지되지 않습니다.
Interactions API는 이전 상호작용 ID로 이어갈 수 있습니다. 무상태 구현은 관련 처리 호출과 결과를 다시 전달해야 합니다. 소스 ID, 모드, 상호작용 ID, 프롬프트 버전, 출력 스키마를 함께 저장하세요.
08
한계와 실패 유형
에이전틱 검사도 읽을 수 없는 라벨을 복구하지 못합니다. 모델 카드는 환각, 느림, 시간 초과를 한계로 언급합니다. 운영 환경에는 재시도, 제한 시간, 검토 상태, 소스 처리 권한이 필요합니다.
- 환각 세부정보: 시간과 불확실성을 요구합니다.
- 시간 오차: 경계가 중요한 결과를 검토합니다.
- 작은 UI: 더 좋은 원본을 사용합니다.
- 화자 오인: 겹치는 음성을 확인합니다.
- 지연·시간 초과: 재시도와 검토 상태를 둡니다.
- 권리·개인정보: 허가된 소스만 처리합니다.
존재하지 않는 이벤트, 읽을 수 없는 글자, 모호한 화자, 영상으로 알 수 없는 동기도 시험하세요. 자신 있게 답하면 실패입니다.
09
비디오 이해는 비디오 생성이 아닙니다
비디오 이해는 기존 영상에서 결과와 시간을 추출합니다. 생성은 새 영상·오디오를 만들고 편집은 기존 자료를 바꿉니다. 서로 다른 작업입니다.
제작과 편집 예시는 Gemini Omni 비디오 프롬프트 라이브러리를 사용하세요. 분석은 원본으로 돌아갈 수 있어야 하고 생성은 에셋, 승인 문구, 브리프와 맞는지 검토해야 합니다.
한 템플릿으로 두 검사를 대체할 수 없습니다. 새 영상을 만들지 않는 분석도 가치가 있고, 보기 좋은 생성 영상도 라벨이나 에셋이 틀리면 실패입니다.
10
검증된 결과를 설명 영상으로 넘기기
타임스탬프 관찰을 추출하고 사람이 승인한 뒤 승인된 내용만 스크립트로 바꾸고 올바른 에셋을 연결해 문구와 화면의 대응을 검토하세요.
검증된 결과를 설명 영상으로 넘기기
- 1
타임스탬프 관찰을 분석합니다.
- 2
정확하고 유용한 결과를 승인합니다.
- 3
승인된 결과만 스크립트로 바꿉니다.
- 4
각 섹션에 올바른 에셋을 연결합니다.
- 5
생성 후 문구와 에셋 대응을 검토합니다.
TapVid는 Explainer Video Engine입니다. AI 설명 영상 생성기는 제공된 에셋과 승인 문구를 검토 가능한 영상으로 만들지만 상류 분석의 진위를 보장하지 않습니다.
11
실무 평가 체크리스트
실제 소스로 작은 평가 세트를 만들고 관찰 가능한 기준으로 채점하세요. 최신 이름이 아니라 수용 조건을 충족하는 모드가 정답입니다.
- 정확한 구간
- 증거 채널 명시
- 화면·발화 내용의 정확성
- 보이지 않음과 거짓의 구분
- 증거 부족 시 거부
- 빠른 검토 가능성
- 여러 턴의 증거 연속성
- 허용 가능한 지연
모델이나 API가 바뀌면 평가를 반복하세요. 프롬프트와 예상 출력을 버전 관리해 시간, 거부, 지연, 구조 변화를 확인합니다.
12
자주 묻는 질문
Gemini 3.7은 영상을 생성하나요?
Gemini 3.7 Flash는 영상을 분석할 수 있지만 이해와 생성은 다릅니다. 새 영상이 필요하면 생성·편집 흐름을 사용합니다.
에이전틱 영상 이해를 어떻게 켜나요?
지원 모델과 API에서 영상 입력의 processing을 agentic으로 설정합니다. 최신 문법과 제공 여부는 Google 문서를 확인하세요.
모든 영상에 써야 하나요?
아닙니다. 긴 영상과 특정 순간 질문에 적합합니다. 짧고 지연이 중요하거나 전체 정밀도가 필요하면 정적 처리가 맞습니다.
정확한 시간을 보장하나요?
보장하지 않습니다. 관련 구간을 더 자세히 보더라도 중요한 시간과 주장은 검증해야 합니다.
가장 좋은 프롬프트는 무엇인가요?
좁은 질문, 증거 채널, 시간 출력, 불확실성 규칙, 제외 조건을 정의합니다.
프롬프트 라이브러리 주제로 적합한가요?
분석 템플릿은 유용하지만 주된 목적은 기능 이해와 구현입니다. 분석은 가이드에, 생성은 별도 라이브러리에 둡니다.




