井云-企业版产品使用手册(用户端)
7 分钟声音克隆
声音克隆用于把一段清晰人声训练成企业专属音色。音色创建成功后,可以在口播视频、情景视频、批量口播和批量混剪中复用。

井云团队2026-06-27 (更新于 2026-06-28)
声音克隆用于把一段清晰人声训练成企业专属音色。音色创建成功后,可以在口播视频、情景视频、批量口播和批量混剪中复用。
什么时候使用声音克隆
| 场景 | 推荐做法 |
|---|---|
| 讲师课程、知识科普 | 克隆讲师声音,保持课程系列统一 |
| 主播带货、产品讲解 | 克隆主播音色,减少重复录音 |
| 创始人品牌表达 | 使用固定声音输出品牌观点和宣传内容 |
克隆前准备
音频样本要求
| 项目 | 要求 |
|---|---|
| 音频格式 | 支持 wav、mp3、m4a、webm |
| 音频时长 | 至少 10 秒 |
| 文件大小 | 不超过 10MB |
| 声音内容 | 只保留一个人的清晰人声 |
| 环境噪音 | 尽量无背景噪音、无音乐、无混响 |
| 表达方式 | 自然说话,语速稳定,避免机械朗读 |
录音建议
| 录音项 | 建议 |
|---|---|
| 环境 | 选择安静空间,关闭背景音乐、风扇、空调强风等噪音源 |
| 距离 | 麦克风距离保持稳定,不要忽近忽远 |
| 音量 | 正常说话,避免爆音或声音过小 |
| 内容 | 使用完整句子,减少长时间停顿 |
| 人声 | 全程只保留一个人的声音 |
操作步骤
- 进入左侧菜单「数字人」。
- 点击「声音克隆」。
- 填写音色名称,例如“品牌女声”“张老师讲解音色”。
- 填写音色描述,例如沉稳、亲和、年轻、专业、适合带货。
- 选择性别;不确定时可以保持未指定。
- 上传音频样本,或点击「录音」直接录制。
- 如果选择录音,浏览器会请求麦克风权限,允许后开始录制。
- 确认音频时长、文件大小和文件名是否正确。
- 可填写试听文本,用于克隆完成后快速验证音色效果。
- 可填写示例文本,用于后续识别该音色的展示内容。
- 查看本次克隆预计消耗的算力和当前余额。
- 点击提交,等待声音克隆完成。
- 克隆完成后,在视频制作时进入「音色」选择列表使用该音色。
字段怎么填写
| 字段 | 填写建议 |
|---|---|
| 音色名称 | 用业务可识别的名称,例如“企业宣传男声”“主播小云音色” |
| 音色描述 | 写清声音特点和适合场景,方便团队成员选择 |
| 性别 | 用于辅助分类,不确定可保持未指定 |
| 试听文本 | 建议填写一段 20-50 字短句,用于快速试听 |
| 示例文本 | 可填写品牌常用话术或标准口播句 |
克隆后怎么验收
| 检查项 | 判断标准 |
|---|---|
| 相似度 | 是否接近目标人物的声音质感 |
| 清晰度 | 是否有明显噪声、断裂、机械感 |
| 语速 | 是否适合企业内容的表达节奏 |
| 情绪 | 是否符合宣传、带货、课程或服务场景 |
| 稳定性 | 多句试听时声音是否前后一致 |
建议先用短句试听,再用一段真实业务文案生成口播样片。只听音色不一定能判断最终视频效果,最好结合数字人形象一起验收。
常见问题
上传音频后提示时长不足怎么办?
声音克隆样本至少需要 10 秒。建议准备 20-60 秒的清晰人声,减少系统识别误差。
声音不像本人怎么办?
通常是样本不够干净,或样本里有噪音、混响、多人声音、背景音乐。建议重新录制一段安静环境下的单人人声。
可以直接用手机录音吗?
可以,但要保证环境安静、音量稳定、没有明显回声。录完后建议先试听,确认没有爆音、断句和背景噪音。
克隆音色能不能用于所有视频类型?
可以。克隆成功后,该音色可用于口播视频、情景视频、批量口播和批量混剪。
为什么需要试听文本?
试听文本不是必填项,但它能帮助你在克隆完成后快速判断声音质量,尤其适合团队里有多个相似音色时做区分。
相关标签:
#AI Agent
#井云Studio
#井云-企业版产品使用手册(用户端)
开启企业级 AI 商业化
立即构建您的专属 AI 智能体与自动化矩阵
井云 Studio 为您提供多租户底座、工作流编排、资产分发与计费闭环,助您快速上线高质量 AI SaaS 产品。
