井云-企业版产品使用手册(用户端)
27 分钟

口播视频

口播视频用于把一段文案或一段录音生成单条数字人讲解视频。它适合产品介绍、课程讲解、活动通知、政策解读、招商说明和品牌宣传等单人讲解场景。

井云团队
井云团队2026-06-27 (更新于 2026-06-28)
返回专栏列表

口播视频用于把一段文案或一段录音生成单条数字人讲解视频。它适合产品介绍、课程讲解、活动通知、政策解读、招商说明和品牌宣传等单人讲解场景。

图片展示了字节跳动AI平台中数字人形象选择与编辑界面。左侧为数字人形象库,有多种形象供选择。中间是选定的数字人形象,为一位穿着围裙的女性。右侧是字幕样式设置界面,可选择字体样式、颜色,还能自定义调节字体大小、行距等。该图片与文档中制作口播视频前准备部分相关,直观呈现了数字人形象选择及字幕样式设置的操作界面,帮助用户了解制作前的准备步骤。
图片展示了字节跳动AI平台中数字人形象选择与编辑界面。左侧为数字人形象库,有多种形象供选择。中间是选定的数字人形象,为一位穿着围裙的女性。右侧是字幕样式设置界面,可选择字体样式、颜色,还能自定义调节字体大小、行距等。该图片与文档中制作口播视频前准备部分相关,直观呈现了数字人形象选择及字幕样式设置的操作界面,帮助用户了解制作前的准备步骤。

什么时候使用口播视频

场景推荐做法
有一段现成文案使用文字驱动,让系统生成语音和视频
有一段真人录音使用音频驱动,保留原录音节奏和语气
需要快速验证数字人效果先做 20-50 字短口播样片
需要统一企业讲解风格选择专属形象和专属音色生成

制作前准备

准备项说明
数字人形象可使用公共形象,也可使用形象克隆后的专属形象
音色文字驱动必须选择音色;音频驱动可直接使用上传音频
口播文案建议按短句组织,避免一句话过长
标题用于强化视频主题,可选
画中画素材商品图、案例图、补充视频,可选
背景音乐用于提升氛围,可选

方式一:文字驱动生成口播

文字驱动适合已经有脚本文案的情况。系统会根据所选音色生成语音,并驱动数字人口型。

操作步骤

  1. 进入「数字人」页面。
  2. 在形象列表选择一个数字人,点击「立即使用」,或点击「数字人口播」。
  3. 在工作台左侧进入「数字人」面板,确认当前形象。

图片展示的是「数字人」页面,左侧有数字人、音色、字幕、标题、画中画、音乐等导航栏。右侧是数字人形象列表,每个形象都有名称、视频上传标识及编号,如“妹子”“妹子2”等。当前选中“公共”音色面板,显示多个数字人形象。该图片与上文“进入「数字人」页面,在形象列表选择一个数字人,点击「立即使用」,或点击「数字人口播」”的操作步骤相关,直观呈现了进入页面后的形象选择界面。
图片展示的是「数字人」页面,左侧有数字人、音色、字幕、标题、画中画、音乐等导航栏。右侧是数字人形象列表,每个形象都有名称、视频上传标识及编号,如“妹子”“妹子2”等。当前选中“公共”音色面板,显示多个数字人形象。该图片与上文“进入「数字人」页面,在形象列表选择一个数字人,点击「立即使用」,或点击「数字人口播」”的操作步骤相关,直观呈现了进入页面后的形象选择界面。

  1. 进入「音色」面板,选择公共音色或企业专属音色。

图片展示的是字节跳动智能内容平台中“音色”面板界面。左侧有数字人、音色、字幕等导航栏,当前选中“音色”。右侧上方有“公共”“我的”“团队”选项卡,当前选中“公共”。下方列表呈现多个音色选项,如“慵懒温柔小姐姐”“亲和温柔解说员”等,每项显示音色名称、性别、年龄、风格及可使用次数。该图片与上文“进入‘音色’面板,选择公共音色或企业专属音色”的操作步骤相关,直观呈现了音色选择界面。
图片展示的是字节跳动智能内容平台中“音色”面板界面。左侧有数字人、音色、字幕等导航栏,当前选中“音色”。右侧上方有“公共”“我的”“团队”选项卡,当前选中“公共”。下方列表呈现多个音色选项,如“慵懒温柔小姐姐”“亲和温柔解说员”等,每项显示音色名称、性别、年龄、风格及可使用次数。该图片与上文“进入‘音色’面板,选择公共音色或企业专属音色”的操作步骤相关,直观呈现了音色选择界面。

  1. 进入「字幕」面板,选择文字驱动。

图片展示的是字幕输入设置界面。左侧有数字人、音色、标题、画中画、音乐等选项,当前选中“字幕”。右侧上方显示“输入设置”,说明口播创作共用一条生成链路,可切换输入源。下方有“文案输入”和“录音/音频输入”两个输入框,其中“文案输入”框被蓝色高亮突出显示。最下方是“请输入口播字幕或脚本文案”输入区域,右侧有“启用字幕”的开关,当前处于开启状态。该界面与文档中口播视频文字驱动生成口播的上下文对应,用于设置字幕相关参数。
图片展示的是字幕输入设置界面。左侧有数字人、音色、标题、画中画、音乐等选项,当前选中“字幕”。右侧上方显示“输入设置”,说明口播创作共用一条生成链路,可切换输入源。下方有“文案输入”和“录音/音频输入”两个输入框,其中“文案输入”框被蓝色高亮突出显示。最下方是“请输入口播字幕或脚本文案”输入区域,右侧有“启用字幕”的开关,当前处于开启状态。该界面与文档中口播视频文字驱动生成口播的上下文对应,用于设置字幕相关参数。

  1. 输入口播文案。
  2. 如果没有现成文案,可点击「AI 文案」生成初稿。

图片展示的是“AI文案生成”界面。上方提示根据主题生成适合数字人口播的视频脚本。有“文案类型”选项,包括“口播文案”“文案改写”“DeepSeek”“豆包”;“主题描述”区域可输入生成主题、产品卖点、适用场景或改写要求,字数限制为1000;“字数长度”有“短篇”“中篇”“长篇”选项,当前选中“中篇”。界面右下角有“取消”和“生成文案”按钮。该界面与上下文介绍的生成口播视频文案功能相关,用于设置生成文案的类型、主题描述及字数长度等。
图片展示的是“AI文案生成”界面。上方提示根据主题生成适合数字人口播的视频脚本。有“文案类型”选项,包括“口播文案”“文案改写”“DeepSeek”“豆包”;“主题描述”区域可输入生成主题、产品卖点、适用场景或改写要求,字数限制为1000;“字数长度”有“短篇”“中篇”“长篇”选项,当前选中“中篇”。界面右下角有“取消”和“生成文案”按钮。该界面与上下文介绍的生成口播视频文案功能相关,用于设置生成文案的类型、主题描述及字数长度等。

  1. 如果已有文案资产,可点击「文案库」选择并填入。

图片展示的是数字人口播文案库界面。上方标题为“文案库”,下方提示“选择已有文案并快速填充到数字人口播脚本中”。中间有一个搜索框,提示“搜索文案标题或内容”,右侧显示“共0条”文案数据。该图片与上文提到的“如果已有文案资产,可点击「文案库」选择并填入”相呼应,直观呈现了文案库的操作入口及当前状态。
图片展示的是数字人口播文案库界面。上方标题为“文案库”,下方提示“选择已有文案并快速填充到数字人口播脚本中”。中间有一个搜索框,提示“搜索文案标题或内容”,右侧显示“共0条”文案数据。该图片与上文提到的“如果已有文案资产,可点击「文案库」选择并填入”相呼应,直观呈现了文案库的操作入口及当前状态。

  1. 根据需要使用翻译功能,生成中文或英文版本。

图片展示的是文案翻译弹窗界面。弹窗标题为“文案翻译”,内容为“将当前文案翻译为目标语言后覆盖字幕”。下方有一个输入框,用于输入文案。左下角有“英文”下拉框,可选择目标语言。右下角有“取消”和“开始翻译”按钮。该弹窗与上文提到的“设置是否启用字幕,并调整字幕样式、字体、颜色、描边、位置和动效”等内容相关,是字幕设置操作中可能涉及的一步。
图片展示的是文案翻译弹窗界面。弹窗标题为“文案翻译”,内容为“将当前文案翻译为目标语言后覆盖字幕”。下方有一个输入框,用于输入文案。左下角有“英文”下拉框,可选择目标语言。右下角有“取消”和“开始翻译”按钮。该弹窗与上文提到的“设置是否启用字幕,并调整字幕样式、字体、颜色、描边、位置和动效”等内容相关,是字幕设置操作中可能涉及的一步。

  1. 设置是否启用字幕,并调整字幕样式、字体、颜色、描边、位置和动效。

图片展示的是字幕样式设置界面。上方有“字幕样式”“字幕动效”选项卡,当前选中“字幕样式”。界面分为“预设样式”和“自定义调节”两部分。“预设样式”有多种颜色和字体样式的字幕示例。“自定义调节”可选择字体、大小、加粗、斜体、下划线等样式,还可设置文字颜色、背景颜色、描边颜色及透明度。该界面与上文设置字幕样式的内容相关,直观呈现了字幕样式调整的多种选项。
图片展示的是字幕样式设置界面。上方有“字幕样式”“字幕动效”选项卡,当前选中“字幕样式”。界面分为“预设样式”和“自定义调节”两部分。“预设样式”有多种颜色和字体样式的字幕示例。“自定义调节”可选择字体、大小、加粗、斜体、下划线等样式,还可设置文字颜色、背景颜色、描边颜色及透明度。该界面与上文设置字幕样式的内容相关,直观呈现了字幕样式调整的多种选项。

  1. 进入「标题」面板,填写标题并设置标题样式。

图片展示的是字节跳动智能视频平台中标题编辑界面。左侧有“返回”“数字人”“音色”“字幕”“标题”“画中画”“音乐”等选项,当前“标题”选项被选中。右侧上方显示“标题编辑”,下方提示“在下方输入标题文案,标题会显示在视频顶部”,并有“标题”输入框。该图片与文档中“进入「标题」面板,填写标题并设置标题样式”的内容对应,是设置标题时的操作界面展示。
图片展示的是字节跳动智能视频平台中标题编辑界面。左侧有“返回”“数字人”“音色”“字幕”“标题”“画中画”“音乐”等选项,当前“标题”选项被选中。右侧上方显示“标题编辑”,下方提示“在下方输入标题文案,标题会显示在视频顶部”,并有“标题”输入框。该图片与文档中“进入「标题」面板,填写标题并设置标题样式”的内容对应,是设置标题时的操作界面展示。

  1. 如需插入商品图或案例图,进入「画中画」面板添加素材。

图片展示的是字节跳动智能视频制作平台中“画中画”功能的设置界面。界面左侧有多个功能选项,当前选中“画中画”。右侧有“插入模式”可选手动或智能,视频静音功能可开关,全局比例为9:16可调整,还有“连续文案范围”可逐句点选,但只能选中连续的句子,下方有“从素材库选择”按钮。该图片与文档中“如需插入商品图或案例图,进入‘画中画’面板添加素材”内容对应,直观呈现了画中画功能的设置操作界面。
图片展示的是字节跳动智能视频制作平台中“画中画”功能的设置界面。界面左侧有多个功能选项,当前选中“画中画”。右侧有“插入模式”可选手动或智能,视频静音功能可开关,全局比例为9:16可调整,还有“连续文案范围”可逐句点选,但只能选中连续的句子,下方有“从素材库选择”按钮。该图片与文档中“如需插入商品图或案例图,进入‘画中画’面板添加素材”内容对应,直观呈现了画中画功能的设置操作界面。

  1. 如需背景音乐,进入「音乐」面板选择 BGM。

这张图片展示的是口播视频制作工具的「音乐」面板界面,界面顶部设有“公共”“我的”“团队”三个选项,当前选中“公共”分类,还配有搜索框;左侧为功能导航栏,选中的是“音乐”功能,其他功能选项包括数字人、音色、字幕、标题、画中画等;面板主体区域展示了多个可供选择的音频文件,每个文件旁均配有“使用”按钮,对应前文提到的如需添加背景音乐可进入「音乐」面板选择BGM的操作步骤。
这张图片展示的是口播视频制作工具的「音乐」面板界面,界面顶部设有“公共”“我的”“团队”三个选项,当前选中“公共”分类,还配有搜索框;左侧为功能导航栏,选中的是“音乐”功能,其他功能选项包括数字人、音色、字幕、标题、画中画等;面板主体区域展示了多个可供选择的音频文件,每个文件旁均配有“使用”按钮,对应前文提到的如需添加背景音乐可进入「音乐」面板选择BGM的操作步骤。

  1. 在预览区检查人物、字幕、标题、画中画和音乐效果。

图片展示的是数字人测试画面,画面中一位女性身着灰色T恤和米色围裙,背景为室内环境,有绿植和花卉装饰。画面顶部黄色背景上显示“数字人测试”,底部白色字幕写着“大家好我是井云数字人”。右上角有“继续切换”按钮。该图片与文档中“文字驱动生成口播”部分内容相关,是生成的口播视频示例,用于展示数字人测试效果。
图片展示的是数字人测试画面,画面中一位女性身着灰色T恤和米色围裙,背景为室内环境,有绿植和花卉装饰。画面顶部黄色背景上显示“数字人测试”,底部白色字幕写着“大家好我是井云数字人”。右上角有“继续切换”按钮。该图片与文档中“文字驱动生成口播”部分内容相关,是生成的口播视频示例,用于展示数字人测试效果。

  1. 点击创建任务。

图片展示的是文字驱动生成口播视频时的创建任务界面。上方显示预计消耗52点,余额9710.00点,并有问号图标可查看详情。下方有一个蓝色的“创建任务”按钮。该图片与上文“在预览区检查人物、字幕、标题、画中画和音乐效果”后,点击创建任务的内容对应,是创建任务操作的展示界面。
图片展示的是文字驱动生成口播视频时的创建任务界面。上方显示预计消耗52点,余额9710.00点,并有问号图标可查看详情。下方有一个蓝色的“创建任务”按钮。该图片与上文“在预览区检查人物、字幕、标题、画中画和音乐效果”后,点击创建任务的内容对应,是创建任务操作的展示界面。

  1. 生成完成后,到「资产库 → 视频」查看成片。

方式二:音频驱动生成口播

音频驱动适合已有真人录音、播客切片、课程录音或客户提供录音的情况。系统会尝试识别音频内容作为字幕,并让数字人跟随音频生成。

操作步骤

  1. 进入口播工作台,选择数字人形象。
  2. 进入「字幕」面板,将驱动方式切换为音频驱动。

图片展示的是音频驱动生成口播的字幕面板界面。画面中“启用字幕”开关处于开启状态。下方有“上传音频”和“开始录音”按钮,以及“识别字幕”和“清空音频”选项。再往下是“识别字幕”区域,提示在音频驱动模式下字幕由音频识别结果生成,不可手动修改,需重新录制或上传新音频。该图片与上文介绍的音频驱动操作步骤相关,直观呈现了操作时的界面设置情况。
图片展示的是音频驱动生成口播的字幕面板界面。画面中“启用字幕”开关处于开启状态。下方有“上传音频”和“开始录音”按钮,以及“识别字幕”和“清空音频”选项。再往下是“识别字幕”区域,提示在音频驱动模式下字幕由音频识别结果生成,不可手动修改,需重新录制或上传新音频。该图片与上文介绍的音频驱动操作步骤相关,直观呈现了操作时的界面设置情况。

  1. 上传已有录音,或点击录音直接录制。
  2. 等待系统上传并识别音频内容。
  3. 检查识别出的字幕文本。
  4. 如有错字、漏字或断句不自然,手动修改字幕文本。
  5. 设置标题、字幕样式、画中画素材和背景音乐。
  6. 预览确认画面、字幕和素材位置。
  7. 点击创建任务。
  8. 生成完成后,到资产库查看视频。

文案怎么写更适合口播

写法示例
开头直接说明主题“今天用一分钟讲清楚这款产品适合哪些客户。”
一句话只讲一个重点“第一,它能减少人工整理资料的时间。”
多用自然口语“如果你每天都要重复回复客户问题,这个功能会很有用。”
结尾给行动指引“如果你想批量生成同类视频,可以继续使用批量口播。”

示例文案

大家好,今天用一分钟介绍我们的企业知识库功能。
它可以把产品手册、常见问题、培训资料统一沉淀起来,团队成员需要查询时,可以直接向智能体提问。
对于销售、客服和运营团队来说,这能减少重复沟通,也能让对外回复更加统一。
如果你已经准备好资料,可以先创建知识库,再把它绑定到企业智能体中使用。

关键配置说明

配置作用建议
数字人决定出镜形象选择与业务气质一致的形象
音色决定口播声音文字驱动必须选择;品牌内容优先用专属音色
字幕展示口播内容信息密度高的视频建议开启字幕
标题强化主题用短标题,不要写完整长句
画中画插入补充素材不要遮挡人物面部和字幕
音乐增强氛围音量不要压过人声

提交前检查

检查项判断标准
文案是否口语化、句子是否过长
音色是否符合品牌和视频场景
字幕是否清晰、是否遮挡人物或商品重点
标题是否过长,是否影响画面阅读
画中画是否和当前讲解内容对应
算力当前余额是否足够完成生成

常见问题

文字驱动和音频驱动怎么选?

已有脚本文案时用文字驱动;已有真人录音或想保留原始语气节奏时用音频驱动。

音频识别字幕不准确怎么办?

先手动修改识别出的字幕,再提交生成。字幕不准确会影响观看体验,也可能影响画中画分段。

生成的视频看起来节奏太慢怎么办?

优先优化文案。减少长句和重复表达,把内容拆成更短、更直接的口播句子。

画中画素材应该怎么加?

先让系统根据文案生成字幕片段,再选择连续字幕片段添加对应素材。素材最好和当前讲解内容同步出现。

生成失败怎么办?

检查数字人、音色、文案、音频、素材和算力余额是否完整。失败任务可在资产库任务记录中查看原因。

相关标签:
#AI Agent
#井云Studio
#井云-企业版产品使用手册(用户端)
开启企业级 AI 商业化

立即构建您的专属 AI 智能体与自动化矩阵

井云 Studio 为您提供多租户底座、工作流编排、资产分发与计费闭环,助您快速上线高质量 AI SaaS 产品。

延伸推荐阅读

GEO AI创作
井云-企业版产品使用手册(用户端)
2026-06-2818 分钟

GEO AI创作

AI创作用于精细生成单篇 GEO 内容。它适合先做样稿、重点文章、活动内容或需要人工把控质量的文章。

井云团队
井云团队
详情
GEO优化
井云-企业版产品使用手册(用户端)
2026-06-287 分钟

GEO优化

GEO优化用于把企业资料、关键词、用户问题、内容生成、发布和收录检测串成一条增长链路。它不是单纯写文章,而是围绕“用户会问什么、搜索会收录什么、AI 会引用什么”持续生产和优化内容。

井云团队
井云团队
详情