概览
Qwen3-TTS 将文字转换为音频,围绕同一系列提供不同任务的检查点。1.7B VoiceDesign 根据自然语言描述塑造音色,CustomVoice 使用预设说话人,Base 用参考录音生成相近音色。先明确需要的是固定播音员、设计新声音还是复刻授权声音,再选择对应模型,能避免下载错误权重后才发现接口不匹配。它适合开发产品解说、课程朗读和交互式语音功能,也适合建立可重复的配音流程。
主要功能
- 支持中、英、日、韩等十种语言。
- 提供 0.6B 与 1.7B 规模选择。
- CustomVoice 提供九种预设音色。
- 1.7B VoiceDesign 支持文字描述音色。
- Base 支持参考录音复刻及复用声音提示。
- 提供 Python API、网页演示与流式生成能力。
要求、安装和快速入门
1. 建立独立 Python 环境,官方推荐 Python 3.12。
2. 执行 pip install -U qwen-tts。
3. 从官方 Qwen 模型集合选择对应检查点,预留模型下载空间。
4. 使用 Qwen3TTSModel 加载模型,根据硬件选择设备与精度。
5. CustomVoice 调用 generate_custom_voice;VoiceDesign 调用 generate_voice_design;Base 调用 generate_voice_clone。
6. 先生成一句短文本并保存音频,确认语言、说话人和采样率后再扩展到长文。
2. 执行 pip install -U qwen-tts。
3. 从官方 Qwen 模型集合选择对应检查点,预留模型下载空间。
4. 使用 Qwen3TTSModel 加载模型,根据硬件选择设备与精度。
5. CustomVoice 调用 generate_custom_voice;VoiceDesign 调用 generate_voice_design;Base 调用 generate_voice_clone。
6. 先生成一句短文本并保存音频,确认语言、说话人和采样率后再扩展到长文。
用法
产品配音可先统一一个预设音色,将脚本按自然停顿拆成段落,逐段试听专有名词,再把确认后的音频交给视频编辑。复刻模式则准备清晰、无背景音乐且获得使用许可的参考录音,并按接口要求提供参考文本;复用同一声音提示有利于连续段落保持一致。把文本、模型名称和生成参数一起记录,可在内容修改后重新生成指定片段。
实施要点
参考录音的噪声、口音和说话方式会影响复刻结果。长文本宜分段处理并检查连接处的停顿;实时系统还需单独测量本机首包延迟与并发能力,不能把上游展示的速度直接当成部署结果。
实施要点
参考录音的噪声、口音和说话方式会影响复刻结果。长文本宜分段处理并检查连接处的停顿;实时系统还需单独测量本机首包延迟与并发能力,不能把上游展示的速度直接当成部署结果。
模型兼容性与使用场景
需要 Python、模型权重和相应计算资源;GPU 与注意力实现的兼容性取决于本机环境。0.6B CustomVoice 不具备与 1.7B CustomVoice 相同的指令控制能力,不能只替换模型名就假定全部功能一致。
许可证与风险说明
仓库采用 Apache-2.0;使用具体检查点时同时核对其模型卡,声音素材的使用权限需另行确认。