The short version
最好的 B-roll 创意来自视频中每一时刻承担的任务。数字用图表,产品操作用录屏,比较用并排画面,例子或故事用具体场景。相关短语或动作开始时让画面出现,主题切换时将其移除。目标不是覆盖每一秒,而是让每次切入都能解释、证明、演示、比较或补充语境。
B-roll 是围绕主线故事出现的辅助影像或图片。在访谈或 talking-head 视频中,说话者通常是 A-roll;在教程、Reel 或产品视频中,主要演示或表演也可能是 A-roll。能帮助观众理解主线的截屏、切入镜头、图解、特写、产品片段和情境画面,都属于 B-roll。很多清单从物件出发:拍桌面、冲咖啡、出门走路、在笔记本电脑上打字。这些镜头容易拍,却不一定有用。说话者在解释获客成本时,咖啡镜头帮助不大,一张简单图表反而更有效。真正的问题不是“我手上有什么素材?”,而是“观众此刻需要看到什么?”本指南提供 35 个可调整的创意、一张形式选择矩阵、一套规划流程,以及判断切入镜头何时有帮助、何时会干扰的明确规则。
01
选择 B-roll 最快的方法,是从叙事语义单元开始
先把脚本拆成语义单元。一个单元是一条可以独立理解的完整想法,例如主张、数字、步骤、比较或例子。一个句子可能只有一个单元,长句也可能包含两三个。
针对每个单元,做四个决定:
- 说清这句话的任务:是在证明观点、解释流程、描述地点、展示产品,还是要求观众行动?
- 选择视觉任务:画面应当证明、演示、定位、比较、简化或补充语境,而不是只做装饰。
- 选择最真实的呈现形式:产品操作用真实录屏,数据用有来源的图表,个人证据用自有素材,抽象概念用图解。
- 设定时间边界:相关短语开始时进入,口述对象发生变化时退出或切换。

一个有用的 B-roll 创意需要通过三项快速检查:
- 语义匹配:观众能否解释为什么这个画面应该配这些话?
- 信息增益:它是否让观点更清楚、更可信或更容易记住?
- 时间匹配:它是否在观众听到所支持观点时出现?
如果三项答案都是否定的,就继续保留说话者画面。人脸不是必须不断盖住的空白。
同样的逻辑适用于脚本型讲解、访谈、教程、产品演示和短视频。没有旁白时,把主要动作当成语义单元。伸手拿工具、产品状态变化、人物抵达地点,都可以成为下一个辅助镜头出现的明确理由。
02
与常见叙事语义单元匹配的 35 个 B-roll 创意
你可以把这张表当作脚本标注表或镜头清单生成器。找到视频中的语句、动作或叙事单元类型,再根据主题和可用来源调整建议画面。时间提示只是起始规则,并非逐帧处方;语速、视觉复杂度、镜头运动和平台格式仍然重要。

| # | 口述语义单元 | B-roll 创意 | 为什么有帮助 | 时间提示 |
|---|---|---|---|---|
| 1 | 一个关键统计数字 | 在说话者旁边动画呈现数字和简短来源 | 不替代说话者也能让量级可见 | 数字出现时进入,解释含义时保持,之后退出 |
| 2 | 一段时间趋势 | 显示简单折线图,只突出相关区间 | 让方向和规模可检查 | 说到趋势时出现,不要在铺垫句提前出现 |
| 3 | 前后对比结果 | 使用同一来源、可直接对应的前后画面 | 把主张变成具体比较 | 先展示“之前”,说到“之后”时切换 |
| 4 | 百分比或比例 | 使用比例条、圆环或 100 格网格 | 帮助理解部分与整体的关系 | 至少保留到观众能读完一次标签 |
| 5 | 有证据的主张 | 展示原始来源、报告摘录或真实产品结果 | 把判断连接到可验证证据 | 只突出真正支持口述主张的那一行 |
| 6 | 三步流程 | 逐步搭建编号 1-2-3 的顺序 | 保留顺序并降低工作记忆负担 | 说到哪一步就加入哪一步 |
| 7 | 实体操作流程 | 展示双手从头到尾完成真实任务 | 说明文字难以讲清的动作 | 在有意义的动作点切换,不要每次手动都切 |
| 8 | 数字化流程 | 录下准确点击、字段和结果 | 把操作说明连接到界面 | 提到控件时放大或裁切到该位置 |
| 9 | 时间线 | 用日期或里程碑组成横向顺序 | 让持续时间和依赖关系易读 | 随旁白移动强调标记 |
| 10 | 检查清单 | 说完并完成一项后再打勾 | 具体强化进度,而不是展示通用待办 | 不要在解释前提前勾选后面的项目 |
| 11 | 方案 A 与方案 B | 使用左右均衡、各有标签的分屏 | 让比较一直留在同一画面 | 先介绍两边,再突出更合适的一边 |
| 12 | 旧方法与新方法 | 把压缩后的旧流程和更简单的新流程并排 | 展示到底改变了什么 | 旁白从旧转到新时移动强调 |
| 13 | 价格或资源权衡 | 用成本和投入组成二维矩阵 | 说明决定不止一个维度 | 保留到结论,让观众能够核对选择 |
| 14 | 好例子与坏例子 | 并排展示条件匹配的两个例子和简短注释 | 让质量标准可观察 | 先给坏例子,再展示修正 |
| 15 | 决策规则 | 动画呈现带“是/否”分支的小流程图 | 把建议变成可以重复执行的动作 | 只沿着旁白正在讲的分支移动 |
| 16 | 被点名的物件 | 展示实物或忠实的特写 | 把抽象解释落到可识别对象 | 第一次说出物件名称时进入 |
| 17 | 被点名的地点 | 使用自有地点素材或准确的建立镜头 | 补充地理与情境信息 | 不要用只符合国家、却不对应地点的天际线 |
| 18 | 人物或组织 | 展示获授权的肖像、标志或官方页面 | 帮助识别主体 | 保留来源信息,不要暗示对方背书 |
| 19 | 具体例子 | 展示真实物件、输出或场景 | 用具体证据替代泛化插图 | 解释相关细节时保持在该对象上 |
| 20 | 包含多个例子的类别 | 快速展示三个带标签的代表性项目 | 通过差异界定类别 | 每项都留出足够识别时间 |
| 21 | 个人回忆 | 使用自有素材、照片或克制的重演 | 补充语境但不假装当时有现场记录 | 可能被误认为真实记录的重演要明确标注 |
| 22 | 挫折或障碍 | 展示真实失败状态、错误、排队或重复操作 | 让问题具体而不是戏剧化 | 先让问题出现,再展示解决方案 |
| 23 | 情绪转折点 | 保留说话者,或只用一个有意义的细节 | 在最私人时刻保留人与人的连接 | 不要用快速蒙太奇打断表情 |
| 24 | 抽象隐喻 | 使用瓶颈或桥梁等简单类比 | 为观众建立心智模型 | 旁白回到字面解释时结束 |
| 25 | 因果关系 | 用方向连接线动画呈现两个事件 | 明确表达所提出的关系 | 来源只显示相关性时不要暗示因果 |
| 26 | 产品功能 | 录下功能准确执行所说动作的过程 | 比静态营销截屏更能展示行为 | 从点击前开始,一直保留到结果出现 |
| 27 | 用户输入与输出 | 把原始输入和生成或编辑后的结果并排 | 显示转换过程并保留来源 | 两边都加标签,并显示必要设置 |
| 28 | 提示词或命令 | 展示准确输入文本和之后的结果状态 | 让流程可复现 | 不要隐藏会实质影响结果的限定条件 |
| 29 | 分析数据证明 | 移除私密数据后展示相关仪表板区间 | 把表现描述落到可观察记录 | 同时突出指标和日期范围 |
| 30 | 限制或失败 | 直接展示不匹配、瑕疵或不支持的情况 | 建立信任并帮助识别边界 | 紧接着说明原因或替代方案 |
| 31 | 切换到新主题 | 使用简短章节卡或视觉重置 | 表达结构,但不假装是证据 | 保持简短,通常短于前后 B-roll |
| 32 | 直接引用 | 展示准确的短引用、说话者和来源 | 保留原话与归属 | 随引用出现,之后回到说话者分析 |
| 33 | 总结 | 把要点重新组织成简短回顾 | 帮助观众巩固刚听到的内容 | 沿用前面已经出现的标签 |
| 34 | 行动号召 | 展示准确的下一屏、按钮、文档或目的地 | 消除下一步行动的不确定性 | 价值和限制说清后再展示 |
| 35 | 结尾承诺 | 回到最强结果或最终转换状态 | 让结尾与中心主张保持视觉连续 | 保持到最后一句,不要再加入新蒙太奇 |
表格有意包含了很多并非实拍镜头的视觉形式。图表、图解、标注或录屏可能比素材库视频更能服务观众。“B-roll”常被用来泛指所有辅助视觉层,但编辑真正需要做的是选择最能解释当前语义单元的形式。
一个来源也能产生多个切法。一段较长的产品录屏可以提供功能主张所需的局部特写、工作流程所需的完整界面,以及结果部分所需的输入输出比较。如果要把较长来源改成多种格式,可以参考这套社交媒体视频工作流,在调整剪辑时保留同一核心信息。
03
每个 B-roll 创意适合哪种视觉形式
不要默认选择最容易制作的形式。应选择能用最少不必要制作,给出最清楚、最真实答案的形式。
| 视觉形式 | 最适合 | 主要优势 | 主要风险 |
|---|---|---|---|
| 自有实拍素材 | 个人故事、地点、实体流程、原创证据 | 具体度高,来源清楚 | 需要规划、拍摄和权限管理 |
| 屏幕录制 | 产品操作、教程、设置、数字流程 | 具体且可复现 | 可能暴露私密数据,或因界面更新而过时 |
| 图解或动态图形 | 流程、系统、比较、抽象概念 | 简化摄像机无法拍到的关系 | 可能暗示没有证据的精确度或因果 |
| 素材库视频 | 一般情境、氛围、常见活动 | 能快速获得完成度较高的素材 | 往往只匹配关键词,不匹配真实语义 |
| AI 生成片段 | 难以拍摄、高成本、说明性或风格化场景 | 视觉概念灵活 | 可能出现事实错误、不一致或披露义务 |
| 只保留说话者 A-roll | 情绪、观点、信任、敏感主张、转场 | 保留眼神交流和真实感 | 所有章节构图相同时可能显得静态 |

拿不准时,以具体程度为准。如果说的是“点击 Export、选择竖屏并开启字幕”,真实录屏比拍一个人打字更好。如果解释三个系统为何依赖同一数据库,图解比服务器机柜更好。如果讲的是困难的个人经历,说话者的脸可能比任何切入镜头都更好。
使用写实的 AI 生成影像时,要加入披露检查。YouTube 官方说明要求创作者披露可能被观众误认为真实人物、地点、场景或事件的写实改动或合成内容。明显不写实的动画和制作辅助会被区别处理,因此请查看发布平台当前的 YouTube 改动内容指南。
04
拍摄前后都适用的 B-roll 规划流程
用这套流程把粗略脚本或提纲变成聚焦的 B-roll 镜头清单。
制作较长或较复杂时,拍摄前先把标记好的语义单元放进简单分镜板。这篇动画分镜指南说明如何在制作前确定每个场景的目的、时长和转场。
- 收集视觉素材前先锁定核心信息。写好或转录旁白,删除重复内容;B-roll 救不了没有清晰转场、不断换主题的脚本。
- 标记语义单元。每个完整主张、步骤、比较、例子或情绪转折结束后换行。
- 分配视觉任务。把每个单元标为证明、演示、比较、定位、简化、补充语境或不需要。
- 风格之前先决定来源。确认需要自有素材、官方来源、录屏、授权素材库还是生成媒体,并在查找时记录权限和归属。
- 选定一种主导视觉语言。视频可以混合实拍和图形,但重复概念应使用重复规则。
- 按照语言而不是时间线空位放置画面。支持的短语开始时进入,语义单元结束时剪掉。
- 分三轮检查:先看事实和语义准确度,再看时机与可读性,最后看节奏、风格、人脸遮挡、字幕和移动端可读性。
访谈时,请对方给出完整回答,并明确说出所谈物件、地点、人物或流程。语言越具体,编辑越容易找到具体画面。没有脚本的 Reel 或教程,应在主要动作发生变化时加标记,再针对这些标记查找 B-roll,而不是先收集随机镜头。
剪辑时,用这份排除清单检查每个插入画面:
- 它支持的是整句话的意义,而不只是一个关键词吗?
- 它会不会暗示不真实的事实、地点、结果或背书?
- 它是否在相关短语之前进入,或在主题改变后仍然保留?
- 它是否挡住了人脸、字幕、产品控件或来源标签?
- 它的视觉风格是否与周围素材和图形冲突?
- 它是否只是重复说话者和字幕已经传达的信息?

任何画面只要未通过前四项检查,就应替换、重新定时或移除。画面更少但准确的简单视频,强于塞满似乎相关却很弱的镜头。
05
什么时候不该加入 B-roll
B-roll 在传递信息或语境时有用;把每次停顿都当成空位时,它就会干扰。
个人坦白、重要观点、敏感限定,或表情本身承载意义的时刻,应保留说话者。眼神交流可能就是观众需要的证据。
不要给精确事实主张配一个泛化画面。拥挤办公室不能证明效率,天际线不能确认城市,没有真实数据和刻度的上升曲线也不能证明增长。
不要比观众理解画面的速度更快地切换。简单物件一秒就能识别,图表、界面或多步骤图解则需要更长时间。如果观众还在解读上一帧,每一两秒换画面并不会自动更吸引人。
B-roll 与字幕冲突或挡住录屏重点时应删除。竖屏视频已经被人物、字幕、平台控件和叠层压缩了安全区域,辅助画面既要适应有限注意力,也要适应有限像素。
来源或使用权不清楚时也不要使用。只有知道素材来自哪里、展示什么、是否允许使用,相关片段才算可以发布。
06
B-roll 创意常见问题
核心规则很简单:每个辅助画面都需要一个在此刻出现的理由。从叙事语义单元出发,选择最真实的视觉任务,让每段 B-roll 都凭自己的作用赢得在成片中的位置。
talking-head 视频中的 B-roll 是什么?
它是叠加在主要说话者画面上或放在旁边的辅助影像,包括切入镜头、录屏、图表、图解、标注、照片和情境素材,用于解释、证明、演示或补充说话内容。
怎样从脚本中找到 B-roll 创意?
把脚本拆成语义单元,再标记为主张、数字、步骤、比较、例子、地点、物件、情绪、产品操作或行动号召。然后选择一个承担明确任务的画面,例如证明、演示、比较或补充语境。
没有额外素材时可以用什么 B-roll?
可以从自己控制的素材开始:裁出主视频细节、捕捉相关屏幕、动画呈现短引用或数字、制作简单图解、拍摄提到的物件,或在主拍后补一个特写。如果都没有增加信息,就保留 A-roll,不要加入泛化素材。
B-roll 应该多久出现一次?
没有统一间隔。句子需要证明、演示、比较、解释或语境时再加入。人脸本身承载意义,或新画面只是重复时,应保留说话者。画面的复杂度决定它需要停留多久。
应该用素材库视频还是自己拍?
具体度、来源或个人证据重要时,用自有素材;只需要一般语境、且不会暗示精确事实时可以用素材库。产品操作优先录屏,系统关系优先图解,难以拍摄的说明性场景可以用 AI 片段,但要检查准确性、权利和披露要求。
访谈应该拍哪些 B-roll 镜头?
拍摄受访者进入或使用地点、双手进行相关操作、有意义的物件、周围环境、与他人的互动,以及访谈中提到的流程或结果。尽量拍全景、中景和特写,让编辑无需编造新主体也能改变景别。
Turn them into a clear, publishable video
Keep reading
Related stories

如何让 Talking Head 视频更吸引人:视觉层剪辑指南
常见建议是加入跳切、缩放、字幕和 B-roll。这些技巧可能有帮助,但效果清单并不能告诉你某一句话究竟该配什么。本指南提供一套以转录稿为核心的判断方法:从已经拍好的素材开始,最后得到一份支持原始表演、而不是取代它的视觉计划。
Aug 12, 2026

Synthesia 与 HeyGen 对比(2026):你该选哪一个?
根据2026年最新套餐信息,对比 Synthesia 与 HeyGen 在培训、营销、本地化、价格、版权和工作流适配方面的差异。
Aug 9, 2026

最适合讲解视频的 Jitter 替代方案
寻找 Jitter 替代方案?TapVid 从你的内容——文章、PDF 或链接——生成结构化的讲解视频,而不是在时间轴上一帧帧手动做。免费开始。
Jul 28, 2026

