语音、音频与声音
Qwen3-TTS:多语言语音合成、音色设计与声音复刻
QwenLM/Qwen3-TTS
Qwen 开源语音模型系列,提供预设音色、文字描述生成音色和参考音频复刻,适合配音与语音应用开发。
★ 13.4K⑂ 1.7KPython
ToolAI.io · GitHub 频道
一个基于事实的 LLM、智能体、MCP、RAG 和 AI 开发项目索引;每个条目均包含许可证、设置、下载、截图及相关资源。
公开仓库数据
QwenLM/Qwen3-TTS
Qwen 开源语音模型系列,提供预设音色、文字描述生成音色和参考音频复刻,适合配音与语音应用开发。
PaddlePaddle/PaddleSpeech
基于 PaddlePaddle 的语音工具集,覆盖语音识别、文字转语音、标点恢复及其他音频任务,提供命令行、Python 接口和服务示例。
facebookresearch/audiocraft
基于 PyTorch 的音频生成研究库,包含 MusicGen、AudioGen、EnCodec 等组件,支持文本条件生成、部分旋律条件任务及模型训练流程。
2noise/ChatTTS
面向中英文对话的语音生成项目,支持说话人和停顿、笑声等韵律控制;发布模型限非商业用途。
CorentinJ/Real-Time-Voice-Cloning
用于研究说话人表示和语音克隆的语音合成项目。
openai/openai-agents-js
A lightweight, powerful framework for multi-agent workflows and voice agents
juspay/neurolink
一个 TypeScript 集成平台,提供统一的 API 接入 30+ 家 AI 供应商和 100+ 种模型,支持供应商切换、多模态语音处理、RAG、记忆功能以及 MCP 原生工具集成。