衔声衔声AI配音工作站
AI 语音合成 · 本地离线 · 隐私安全

私人AI配音工作站

基于 CosyVoice3、小米 MiMo 与阿里 Qwen3-TTS 三大引擎,集高保真声音克隆、Qwen3 声音设计、多角色配音管理与批量导出于一体。 本地离线运行,隐私数据不出本机,让配音效率提升 10 倍。

衔声 AI 配音工作站 — 主界面
衔声 AI 配音工作站 — 主界面

核心功能

从音色生成到成品导出,一套工作流覆盖配音全流程

声音克隆

高保真音色克隆

角色创建的两种方式之一:上传 15–30 秒参考音频,即可精准复刻人物音色。可同时多选引擎克隆(CosyVoice3 需提供精确样音文字,小米 MiMo 免文字直接克隆),支持预览试听与删除片段裁剪,本地离线运行、音色数据不出本机。

  • 上传 15–30 秒 MP3/WAV 参考音频
  • 可多选引擎同时克隆(CosyVoice3 / MiMo)
  • 预览试听 + 删除片段裁剪瑕疵
  • 本地离线,音色数据不出本机
声音克隆
声音克隆
Qwen3 声音设计

用一句话生成全新音色

角色创建的另一种方式:无需任何参考音频。用自然语言描述声线(如「带上海老弄堂口音的中年女性,说话慢悠悠」),并可加性别/年龄段硬约束与随机种子(同描述同种子可复现同一音色),本地生成试听样音,满意后一键克隆固化到云端或本地引擎。

  • 自然语言描述即可生成音色,零素材
  • 性别/年龄段硬约束,避免性别错乱
  • 随机种子固定,满意音色可复现
  • 本地免费、CPU 即可,确认后一键克隆
Qwen3 声音设计
Qwen3 声音设计
多角色配音

多角色配音管理

在剧本编辑器里按章节组织内容,支持对话内容智能识别与文本行智能拆分,自动把长文本按角色和语义拆成逐句对白。每行可直接绑定说话角色、标注行内情感,并配套完善的字音与配音能力,让长篇有声书也能高效产出。

  • 对话内容智能识别,自动提取角色与对白
  • 智能拆分文本行,按语义与角色自动断句
  • 文本行角色绑定,逐句指定谁在说
  • 行内情感标签 <欢快> <愤怒>,逐句控情绪
  • 多音字点击纠音 + 手动拼音,合成读音更准
  • 章节级 [BGM] 指令:淡入、音量、循环
  • 旁白可绑角色音;导入 Markdown 批量建剧
多角色配音
多角色配音
批量导出

批量导出,一键交付

把剧本一键合成为带包装的成品音频。先为各角色映射配音声音,再配置片头、背景音乐与片尾,即可导出完整的音频文件。

  • 片头/片尾三模式:仅音频/仅文本TTS/音频+文本混音
  • 背景音乐:衰减量、淡入淡出、自适应闪避、循环
  • 逐句断点续传,中断后从断点继续
  • 导出 WAV / MP3,附细粒度进度与历史记录
批量导出
批量导出
重点功能

专业混音台,让配音像做音乐一样精细

不再满足于干声直出。衔声混音台把每条角色语音、背景音乐、音效放到独立轨道,支持包络线、闪避、声像、静音/独奏与实时预览,让你在一个界面内完成从配音到成品的全部精修。

  • 多轨时间线:角色语音轨、BGM 轨、音效轨独立拖拽与对齐
  • 音量包络线:逐句/逐段绘制音量起伏,精细控制情绪强弱
  • 智能闪避:检测到人声自动压低背景音,无需手动画线
  • 淡入淡出:每个片段独立设置渐入渐出时长,过渡自然
  • 声像 Pan:左右声道平衡控制,营造空间感与对话方位
  • 静音 / 独奏:快速对比单轨效果,排查问题更高效
  • 实时预览:边调边听,参数改动即时生效
  • 非破坏性编辑:原始合成音频不被覆盖,随时回退重做
  • 章节级 BGM 指令:在剧本里写 [BGM] 即可自动控制音乐切入/淡出/循环
  • 一键导出成品:混音完成后直接输出 WAV / MP3,无需切换工具
专业混音台
专业混音台

角色创建的两种方式

无论你想复刻自身真实声音,还是凭空创造一条全新声线,衔声都给你最短路径。 两种方式共用同一套角色库,随时切换、自由组合。

方式一

声音克隆

已有目标声音?上传一段参考音频,精准复刻其音色。适合需要特定人物原声的场景。

  • 上传 15–30 秒 MP3 / WAV 参考音频
  • 可多选引擎同时克隆(CosyVoice3 / 小米 MiMo)
  • 预览试听 + 删除片段,裁剪瑕疵更干净
  • 本地离线运行,音色数据不出本机
最适用:复刻真人原声、固定主播音、已知参考素材
方式二

Qwen3 声音设计

没有参考音频?用一句话描述你想要的声线,凭空生成。适合需要虚构角色或批量试音的场景。

  • 自然语言描述即可生成音色,零素材门槛
  • 性别 / 年龄段硬约束,避免性别错乱
  • 随机种子固定,满意音色可精准复现
  • 本地免费、CPU 即可,确认后一键克隆固化
最适用:虚构角色、动漫配音、快速批量试音

两种方式生成的声音都会进入同一角色库,在剧本编辑器里按需分配给不同角色,自由混用。

三大引擎体系

离线克隆、在线扩展、文本设计,按需组合

CosyVoice3

阿里通义实验室开源

本地离线高保真音色克隆引擎,支持情感指令控制。数据不出本机,隐私安全,离线可用。

本地离线高保真克隆情感控制

小米 MiMo 在线

MiMo 开放平台

云端语音克隆引擎,配置个人 API Key 即可灵活使用,提供更多声音选择与在线算力。

云端克隆API Key 接入灵活扩展

Qwen3-TTS

阿里通义千问

同时承载声音设计与本地克隆:声音设计凭自然语言描述生成全新音色,本地克隆免费高保真,CPU 即可运行。

声音设计本地免费CPU 运行

五步完成专业配音

从文本到成品,工作流清晰顺畅

01

撰写文本

在客户端导入或编写剧本,按角色分段。

02

设计 / 克隆音色

用 Qwen3 声音设计凭描述生成,或上传参考音频克隆。

03

多角色合成

为角色分配音色,一键生成高质量语音。

04

混音台精修

在多轨混音台里调整音量、闪避、淡入淡出与声像。

05

批量导出

导出 WAV / MP3,交付你的作品。

常见问题

关于产品、隐私与平台支持的解答

我的音频数据安全吗?+

本地离线引擎(CosyVoice3、Qwen3-TTS)在你的设备上运行,音色与音频数据不出本机。仅在配置并使用小米 MiMo 在线引擎时,才会将必要数据发送至对应的开放平台。

支持哪些操作系统?+

目前客户端已支持 Windows 平台;macOS 版本正在筹备中,敬请期待。

声音克隆需要多长的参考音频?+

一般上传约 10 秒清晰、无明显噪声的参考音频即可获得高质量克隆效果,音频越干净、情绪越贴合,效果越好。

准备好让你的文字开口说话了吗?

下载衔声AI配音工作站,体验流畅、私密、高效的 AI 配音工作流

立即免费下载