语音、音频与声音

Qwen3-TTS:多语言语音合成、音色设计与声音复刻

QwenLM/Qwen3-TTS

Qwen 开源语音模型系列,提供预设音色、文字描述生成音色和参考音频复刻,适合配音与语音应用开发。

★ 13.4K星级
⑂ 1.7KFork 数
57未解决的问题
Python语言
Apache-2.0许可证
Q84编辑评分

概览

Qwen3-TTS 将文字转换为音频,围绕同一系列提供不同任务的检查点。1.7B VoiceDesign 根据自然语言描述塑造音色,CustomVoice 使用预设说话人,Base 用参考录音生成相近音色。先明确需要的是固定播音员、设计新声音还是复刻授权声音,再选择对应模型,能避免下载错误权重后才发现接口不匹配。它适合开发产品解说、课程朗读和交互式语音功能,也适合建立可重复的配音流程。

主要功能

  • 支持中、英、日、韩等十种语言。
  • 提供 0.6B 与 1.7B 规模选择。
  • CustomVoice 提供九种预设音色。
  • 1.7B VoiceDesign 支持文字描述音色。
  • Base 支持参考录音复刻及复用声音提示。
  • 提供 Python API、网页演示与流式生成能力。

要求、安装和快速入门

1. 建立独立 Python 环境,官方推荐 Python 3.12。
2. 执行 pip install -U qwen-tts。
3. 从官方 Qwen 模型集合选择对应检查点,预留模型下载空间。
4. 使用 Qwen3TTSModel 加载模型,根据硬件选择设备与精度。
5. CustomVoice 调用 generate_custom_voice;VoiceDesign 调用 generate_voice_design;Base 调用 generate_voice_clone。
6. 先生成一句短文本并保存音频,确认语言、说话人和采样率后再扩展到长文。

用法

产品配音可先统一一个预设音色,将脚本按自然停顿拆成段落,逐段试听专有名词,再把确认后的音频交给视频编辑。复刻模式则准备清晰、无背景音乐且获得使用许可的参考录音,并按接口要求提供参考文本;复用同一声音提示有利于连续段落保持一致。把文本、模型名称和生成参数一起记录,可在内容修改后重新生成指定片段。

实施要点
参考录音的噪声、口音和说话方式会影响复刻结果。长文本宜分段处理并检查连接处的停顿;实时系统还需单独测量本机首包延迟与并发能力,不能把上游展示的速度直接当成部署结果。

模型兼容性与使用场景

需要 Python、模型权重和相应计算资源;GPU 与注意力实现的兼容性取决于本机环境。0.6B CustomVoice 不具备与 1.7B CustomVoice 相同的指令控制能力,不能只替换模型名就假定全部功能一致。

许可证与风险说明

仓库采用 Apache-2.0;使用具体检查点时同时核对其模型卡,声音素材的使用权限需另行确认。

ChatTTS

2noise/ChatTTS

★ 39.8KPython