主题
音色库
音色库负责为 AIoT 设备与 AI 应用提供语音输出的音色资源——从平台内置的通用音色,到企业定制的复刻音色,均在此统一沉淀。
音色资源可以在 产品管理 的智能体 TTS 配置中被绑定使用。
1. 两类音色
平台音色分为两类,承担不同场景的诉求:
| 类型 | 来源 | 使用范围 | 定制成本 |
|---|---|---|---|
| 系统音色 | 平台预置 | 所有企业共用,即开即用 | 无 |
| 用户复刻音色 | 企业上传 3~15 秒干净人声,系统自动解析并完成复刻 | 仅本企业可见 / 使用 | 需上传素材、勾选合规承诺 |
2. 系统音色
系统音色是平台内置的通用音色库,覆盖:
- 男 / 女声,青年 / 中年,不同音色气质;
- 中文普通话为主,可支持部分方言 / 英文(以平台实际展示为准)。
使用方式:在 产品管理 的智能体中直接选择即可,无需任何前置配置。

适用场景:
- 快速上线、无强烈品牌音色诉求的应用;
- 内测 / Demo 阶段,先跑通链路再考虑复刻;
- 通用型 B 端应用,不需要独家音色。
3. 用户复刻音色
用户复刻音色让企业获得专属声纹:
- 品牌代言人音色;
- IP 角色音色(如动画角色、虚拟主播);
- 高管 / 客服代言人音色。

3.1 素材要求
| 项目 | 要求 |
|---|---|
| 格式 | 仅支持 wav 格式 |
| 时长 | 3~15 秒 |
| 连续性 | 需要整段连续音频,不能有较长停顿静音 |
| 音质 | 干净人声,无背景音乐 / 噪音 / 回声 |
| 说话方式 | 自然发音,语速平稳,情绪中性 |
| 录音环境 | 建议在安静室内,与麦克风保持 15~30cm |
3.2 复刻流程
1. 准备符合要求的 wav音频素材
2. 进入【资源管理 > 音色库 > 用户复刻音色 > 新建音色】
3. 上传音频文件、填写音色名称
4. 勾选并确认「素材来源合法 + 不用于违法违规场景」承诺
5. 点击提交,系统自动解析并完成声纹复刻
6. 复刻完成后可试听,并在线上环境使用3.3 提交承诺条款(平台强制勾选)
提交音色时,必须勾选以下承诺(原文):
本人同意将上传素材用于 AI 内容制作,承诺上传的音频来源合法,不侵犯任何第三方的合法权益。
本人承诺不将生成的克隆声音用于虚假宣传、欺诈、恶意丑化他人或任何违法违规场景。
如承诺不实,由本人承担由此产生的一切法律责任。
承诺不实的后果
承诺不实的法律责任由上传方承担;平台仅提供技术能力,不为素材来源与使用场景背书。请确保:
- 上传音频来源合法(如已获得音色本人书面/明示授权);
- 生成的克隆声音不用于虚假宣传 / 欺诈 / 恶意丑化他人 / 违法违规场景。
4. 如何在应用中使用
进入 产品管理 的智能体编辑页面 → TTS / 语音配置区域 → 选择目标音色(系统 / 复刻)→ 保存并发布。
贴士:
- 应用发布后,更换音色通常无需重新发布应用,但建议在测试环境先验证一次;
- 若企业有多个 IP 或多条业务线,可在音色库准备多份复刻音色,分别绑定到不同应用。
5. 常见问题
Q1:一个应用能同时用多个音色吗? A:一个智能体绑定一个主音色。若需按角色 / 场景切换音色,需通过智能体层的多角色配置(参见 产品管理)实现。
Q2:复刻音色的效果不理想怎么办? A:优先检查素材质量(是否干净、时长是否够、情绪是否中性)。素材是决定复刻效果的最大变量。必要时重新录制并再次上传。
Q3:能自己训练音色模型吗? A:目前平台仅支持通过「上传素材 + 平台复刻」的方式,不开放底层模型训练。