口播视频用于把一段文案或一段录音生成单条数字人讲解视频。它适合产品介绍、课程讲解、活动通知、政策解读、招商说明和品牌宣传等单人讲解场景。
图片展示了字节跳动AI平台中数字人形象选择与编辑界面。左侧为数字人形象库,有多种形象供选择。中间是选定的数字人形象,为一位穿着围裙的女性。右侧是字幕样式设置界面,可选择字体样式、颜色,还能自定义调节字体大小、行距等。该图片与文档中制作口播视频前准备部分相关,直观呈现了数字人形象选择及字幕样式设置的操作界面,帮助用户了解制作前的准备步骤。
什么时候使用口播视频
| 场景 | 推荐做法 |
|---|
| 有一段现成文案 | 使用文字驱动,让系统生成语音和视频 |
| 有一段真人录音 | 使用音频驱动,保留原录音节奏和语气 |
| 需要快速验证数字人效果 | 先做 20-50 字短口播样片 |
| 需要统一企业讲解风格 | 选择专属形象和专属音色生成 |
制作前准备
| 准备项 | 说明 |
|---|
| 数字人形象 | 可使用公共形象,也可使用形象克隆后的专属形象 |
| 音色 | 文字驱动必须选择音色;音频驱动可直接使用上传音频 |
| 口播文案 | 建议按短句组织,避免一句话过长 |
| 标题 | 用于强化视频主题,可选 |
| 画中画素材 | 商品图、案例图、补充视频,可选 |
| 背景音乐 | 用于提升氛围,可选 |
方式一:文字驱动生成口播
文字驱动适合已经有脚本文案的情况。系统会根据所选音色生成语音,并驱动数字人口型。
操作步骤
- 进入「数字人」页面。
- 在形象列表选择一个数字人,点击「立即使用」,或点击「数字人口播」。
- 在工作台左侧进入「数字人」面板,确认当前形象。
图片展示的是「数字人」页面,左侧有数字人、音色、字幕、标题、画中画、音乐等导航栏。右侧是数字人形象列表,每个形象都有名称、视频上传标识及编号,如“妹子”“妹子2”等。当前选中“公共”音色面板,显示多个数字人形象。该图片与上文“进入「数字人」页面,在形象列表选择一个数字人,点击「立即使用」,或点击「数字人口播」”的操作步骤相关,直观呈现了进入页面后的形象选择界面。
- 进入「音色」面板,选择公共音色或企业专属音色。
图片展示的是字节跳动智能内容平台中“音色”面板界面。左侧有数字人、音色、字幕等导航栏,当前选中“音色”。右侧上方有“公共”“我的”“团队”选项卡,当前选中“公共”。下方列表呈现多个音色选项,如“慵懒温柔小姐姐”“亲和温柔解说员”等,每项显示音色名称、性别、年龄、风格及可使用次数。该图片与上文“进入‘音色’面板,选择公共音色或企业专属音色”的操作步骤相关,直观呈现了音色选择界面。
- 进入「字幕」面板,选择文字驱动。
图片展示的是字幕输入设置界面。左侧有数字人、音色、标题、画中画、音乐等选项,当前选中“字幕”。右侧上方显示“输入设置”,说明口播创作共用一条生成链路,可切换输入源。下方有“文案输入”和“录音/音频输入”两个输入框,其中“文案输入”框被蓝色高亮突出显示。最下方是“请输入口播字幕或脚本文案”输入区域,右侧有“启用字幕”的开关,当前处于开启状态。该界面与文档中口播视频文字驱动生成口播的上下文对应,用于设置字幕相关参数。
- 输入口播文案。
- 如果没有现成文案,可点击「AI 文案」生成初稿。
图片展示的是“AI文案生成”界面。上方提示根据主题生成适合数字人口播的视频脚本。有“文案类型”选项,包括“口播文案”“文案改写”“DeepSeek”“豆包”;“主题描述”区域可输入生成主题、产品卖点、适用场景或改写要求,字数限制为1000;“字数长度”有“短篇”“中篇”“长篇”选项,当前选中“中篇”。界面右下角有“取消”和“生成文案”按钮。该界面与上下文介绍的生成口播视频文案功能相关,用于设置生成文案的类型、主题描述及字数长度等。
- 如果已有文案资产,可点击「文案库」选择并填入。
图片展示的是数字人口播文案库界面。上方标题为“文案库”,下方提示“选择已有文案并快速填充到数字人口播脚本中”。中间有一个搜索框,提示“搜索文案标题或内容”,右侧显示“共0条”文案数据。该图片与上文提到的“如果已有文案资产,可点击「文案库」选择并填入”相呼应,直观呈现了文案库的操作入口及当前状态。
- 根据需要使用翻译功能,生成中文或英文版本。
图片展示的是文案翻译弹窗界面。弹窗标题为“文案翻译”,内容为“将当前文案翻译为目标语言后覆盖字幕”。下方有一个输入框,用于输入文案。左下角有“英文”下拉框,可选择目标语言。右下角有“取消”和“开始翻译”按钮。该弹窗与上文提到的“设置是否启用字幕,并调整字幕样式、字体、颜色、描边、位置和动效”等内容相关,是字幕设置操作中可能涉及的一步。
- 设置是否启用字幕,并调整字幕样式、字体、颜色、描边、位置和动效。
图片展示的是字幕样式设置界面。上方有“字幕样式”“字幕动效”选项卡,当前选中“字幕样式”。界面分为“预设样式”和“自定义调节”两部分。“预设样式”有多种颜色和字体样式的字幕示例。“自定义调节”可选择字体、大小、加粗、斜体、下划线等样式,还可设置文字颜色、背景颜色、描边颜色及透明度。该界面与上文设置字幕样式的内容相关,直观呈现了字幕样式调整的多种选项。
- 进入「标题」面板,填写标题并设置标题样式。
图片展示的是字节跳动智能视频平台中标题编辑界面。左侧有“返回”“数字人”“音色”“字幕”“标题”“画中画”“音乐”等选项,当前“标题”选项被选中。右侧上方显示“标题编辑”,下方提示“在下方输入标题文案,标题会显示在视频顶部”,并有“标题”输入框。该图片与文档中“进入「标题」面板,填写标题并设置标题样式”的内容对应,是设置标题时的操作界面展示。
- 如需插入商品图或案例图,进入「画中画」面板添加素材。
图片展示的是字节跳动智能视频制作平台中“画中画”功能的设置界面。界面左侧有多个功能选项,当前选中“画中画”。右侧有“插入模式”可选手动或智能,视频静音功能可开关,全局比例为9:16可调整,还有“连续文案范围”可逐句点选,但只能选中连续的句子,下方有“从素材库选择”按钮。该图片与文档中“如需插入商品图或案例图,进入‘画中画’面板添加素材”内容对应,直观呈现了画中画功能的设置操作界面。
- 如需背景音乐,进入「音乐」面板选择 BGM。
这张图片展示的是口播视频制作工具的「音乐」面板界面,界面顶部设有“公共”“我的”“团队”三个选项,当前选中“公共”分类,还配有搜索框;左侧为功能导航栏,选中的是“音乐”功能,其他功能选项包括数字人、音色、字幕、标题、画中画等;面板主体区域展示了多个可供选择的音频文件,每个文件旁均配有“使用”按钮,对应前文提到的如需添加背景音乐可进入「音乐」面板选择BGM的操作步骤。
- 在预览区检查人物、字幕、标题、画中画和音乐效果。
图片展示的是数字人测试画面,画面中一位女性身着灰色T恤和米色围裙,背景为室内环境,有绿植和花卉装饰。画面顶部黄色背景上显示“数字人测试”,底部白色字幕写着“大家好我是井云数字人”。右上角有“继续切换”按钮。该图片与文档中“文字驱动生成口播”部分内容相关,是生成的口播视频示例,用于展示数字人测试效果。
- 点击创建任务。
图片展示的是文字驱动生成口播视频时的创建任务界面。上方显示预计消耗52点,余额9710.00点,并有问号图标可查看详情。下方有一个蓝色的“创建任务”按钮。该图片与上文“在预览区检查人物、字幕、标题、画中画和音乐效果”后,点击创建任务的内容对应,是创建任务操作的展示界面。
- 生成完成后,到「资产库 → 视频」查看成片。
方式二:音频驱动生成口播
音频驱动适合已有真人录音、播客切片、课程录音或客户提供录音的情况。系统会尝试识别音频内容作为字幕,并让数字人跟随音频生成。
操作步骤
- 进入口播工作台,选择数字人形象。
- 进入「字幕」面板,将驱动方式切换为音频驱动。
图片展示的是音频驱动生成口播的字幕面板界面。画面中“启用字幕”开关处于开启状态。下方有“上传音频”和“开始录音”按钮,以及“识别字幕”和“清空音频”选项。再往下是“识别字幕”区域,提示在音频驱动模式下字幕由音频识别结果生成,不可手动修改,需重新录制或上传新音频。该图片与上文介绍的音频驱动操作步骤相关,直观呈现了操作时的界面设置情况。
- 上传已有录音,或点击录音直接录制。
- 等待系统上传并识别音频内容。
- 检查识别出的字幕文本。
- 如有错字、漏字或断句不自然,手动修改字幕文本。
- 设置标题、字幕样式、画中画素材和背景音乐。
- 预览确认画面、字幕和素材位置。
- 点击创建任务。
- 生成完成后,到资产库查看视频。
文案怎么写更适合口播
| 写法 | 示例 |
|---|
| 开头直接说明主题 | “今天用一分钟讲清楚这款产品适合哪些客户。” |
| 一句话只讲一个重点 | “第一,它能减少人工整理资料的时间。” |
| 多用自然口语 | “如果你每天都要重复回复客户问题,这个功能会很有用。” |
| 结尾给行动指引 | “如果你想批量生成同类视频,可以继续使用批量口播。” |
示例文案
大家好,今天用一分钟介绍我们的企业知识库功能。
它可以把产品手册、常见问题、培训资料统一沉淀起来,团队成员需要查询时,可以直接向智能体提问。
对于销售、客服和运营团队来说,这能减少重复沟通,也能让对外回复更加统一。
如果你已经准备好资料,可以先创建知识库,再把它绑定到企业智能体中使用。
关键配置说明
| 配置 | 作用 | 建议 |
|---|
| 数字人 | 决定出镜形象 | 选择与业务气质一致的形象 |
| 音色 | 决定口播声音 | 文字驱动必须选择;品牌内容优先用专属音色 |
| 字幕 | 展示口播内容 | 信息密度高的视频建议开启字幕 |
| 标题 | 强化主题 | 用短标题,不要写完整长句 |
| 画中画 | 插入补充素材 | 不要遮挡人物面部和字幕 |
| 音乐 | 增强氛围 | 音量不要压过人声 |
提交前检查
| 检查项 | 判断标准 |
|---|
| 文案 | 是否口语化、句子是否过长 |
| 音色 | 是否符合品牌和视频场景 |
| 字幕 | 是否清晰、是否遮挡人物或商品重点 |
| 标题 | 是否过长,是否影响画面阅读 |
| 画中画 | 是否和当前讲解内容对应 |
| 算力 | 当前余额是否足够完成生成 |
常见问题
文字驱动和音频驱动怎么选?
已有脚本文案时用文字驱动;已有真人录音或想保留原始语气节奏时用音频驱动。
音频识别字幕不准确怎么办?
先手动修改识别出的字幕,再提交生成。字幕不准确会影响观看体验,也可能影响画中画分段。
生成的视频看起来节奏太慢怎么办?
优先优化文案。减少长句和重复表达,把内容拆成更短、更直接的口播句子。
画中画素材应该怎么加?
先让系统根据文案生成字幕片段,再选择连续字幕片段添加对应素材。素材最好和当前讲解内容同步出现。
生成失败怎么办?
检查数字人、音色、文案、音频、素材和算力余额是否完整。失败任务可在资产库任务记录中查看原因。