语音、音频与声音

ChatTTS

2noise/ChatTTS

面向中英文对话的语音生成项目,支持说话人和停顿、笑声等韵律控制;发布模型限非商业用途。

★ 39.8K星级
⑂ 4.2KFork 数
61未解决的问题
Python语言
AGPL-3.0许可证
Q90编辑评分

概览

ChatTTS 强调对话语气而非单纯逐字朗读,适合研究 AI 助手如何自然地表达短句、停顿和语气变化。它提供算法代码、权重和示例,开发者可在文本生成之后增加语音输出环节。项目仓库本身并非完整的电话客服或语音聊天产品。 评估时应同时听自然度、核对文字正确性并测量等待时间。自然的语调并不能弥补漏字、多字、数字读法或说话人不稳定的问题。尤其需要注意许可分层:代码采用 AGPLv3+,发布模型为 CC BY-NC 4.0,不能据代码可获得而推断模型可直接商用。

主要功能

  • 中英文对话语音
  • 说话人参数
  • 停顿和笑声控制
  • Python 推理示例
  • WebUI 演示

要求、安装和快速入门

按 README 克隆仓库并安装 requirements,准备模型文件;可运行 python examples/web/webui.py 体验 WebUI。不要把 README 中标为开发中或不推荐的可选加速组件当作默认安装步骤。

用法

先用短句、数字、英文缩写和中英混排各做一组样例,固定说话人参数比较多次生成。检查漏字和异常声音后再增加停顿或笑声控制。对长文本分段生成,检查拼接处音色和音量一致性。

工作原理
文本输入通过模型转换为语音,推理参数与控制标记影响说话人表示和韵律。示例展示文本细化以及口语化、笑声、停顿等控制方式。生成后的波形仍需按应用需求保存、播放或分段传输。

适用人群与环境
非商业语音合成研究者与原型开发者。 Python、模型权重、音频依赖及适配计算设备。

具体使用场景
• 非商业语音助手研究。
• 对话韵律和可控合成实验。
• 中英文短句语音演示与评测。

局限与选型边界
发布模型为非商业许可。输出可能存在不稳定、噪声或文字偏差,需要试听复核。项目主要提供底层和示例,实时对话还需识别、轮次控制、取消播放和延迟管理等组件。

关联项目与选型分析
gradio-app/gradio:互补思路:用交互界面比较文本、控制参数和音频输出。

ollama/ollama:流程搭配:本地文本模型生成回复,再交给语音层;两者仍需应用编排且不改变语音模型许可。

资料说明
基于上游资料的编辑分析,未进行安装实测或性能基准;建议场景和项目搭配属于选型分析。

模型兼容性与使用场景

使用项目发布的语音模型与说话人参数,文本大模型只可作为上游回复来源。

许可证与风险说明

代码为 AGPLv3+,发布模型为 CC BY-NC 4.0;README 明确模型用于教育和研究、不得用于商业用途。

Editorial source review 2026-09-09T05:00:00.950Z. README and live repository page verified; current stars/forks from GitHub HTML. Last-push metadata retained from 2026-09-05 discovery snapshot. No runtime benchmark. Integration proposals are editorial analysis.

发布与维护

资料核对:2026-09-09。统计取自本次仓库页面;功能依据 README 与官方资料整理。版本变化请查看来源区的 Releases。 基于上游资料的编辑分析,未进行安装实测或性能基准;建议场景和项目搭配属于选型分析。