Qwen3-TTS:多语言语音合成、音色设计与声音复刻
QwenLM/Qwen3-TTS
Qwen 开源语音模型系列,提供预设音色、文字描述生成音色和参考音频复刻,适合配音与语音应用开发。
ToolAI.io · GitHub 频道
一个基于事实的 LLM、智能体、MCP、RAG 和 AI 开发项目索引;每个条目均包含许可证、设置、下载、截图及相关资源。
公开仓库数据
QwenLM/Qwen3-TTS
Qwen 开源语音模型系列,提供预设音色、文字描述生成音色和参考音频复刻,适合配音与语音应用开发。
PaddlePaddle/PaddleSpeech
基于 PaddlePaddle 的语音工具集,覆盖语音识别、文字转语音、标点恢复及其他音频任务,提供命令行、Python 接口和服务示例。
google-deepmind/mujoco
Google DeepMind 维护的多关节接触动力学引擎,提供模型描述、物理步进、交互查看器和 Python 接口,适合机器人、控制与强化学习环境开发。
hydra-ecosystem/hydra
面向 Python 应用的配置框架,通过配置组合、命令行覆盖和多任务运行管理实验,适合把数据、模型与训练参数整理成可复用的配置结构。
facebookresearch/vggt
Visual Geometry Grounded Transformer 根据场景图片预测相机参数、深度图、点图和点轨迹,适合三维视觉研究与重建流程的前期几何估计。
facebookresearch/audiocraft
基于 PyTorch 的音频生成研究库,包含 MusicGen、AudioGen、EnCodec 等组件,支持文本条件生成、部分旋律条件任务及模型训练流程。
facebookresearch/segment-anything
Meta 的 SAM 图像分割项目,支持点、框等提示输入,也能自动生成整张图片的候选掩码,适合交互式标注和图像处理流程。
anthropics/claude-cookbooks
Anthropic 提供的 Claude 开发示例集,覆盖分类、摘要、检索增强、工具调用、图像理解与评估,适合按具体任务学习并改造代码。
microsoft/playwright
使用一套 API 驱动 Chromium、Firefox 和 WebKit,完成网页测试、表单操作、截图与故障回放,也可作为 AI 浏览器任务的执行基础。
Lightning-AI/pytorch-lightning
将 PyTorch 模型逻辑与训练工程分离,统一训练循环、日志、检查点和设备策略,便于把实验代码扩展到可重复训练。
hpcaitech/ColossalAI
面向大模型训练与推理的分布式工具集,提供多种并行策略与内存管理,适合解决单卡装不下或多卡利用不足的问题。
huggingface/diffusers
用于加载和组合扩散模型的 Python 库,提供生成管线、模型组件、调度器和训练示例,适合构建可编程的图像与多模态生成流程。
第 2 / 25 页 · 295 个项目