项目截图
概览
NVIDIA NeMo Speech 是一个基于 Python 的框架,专注于音频、语音和多模态大语言模型。它旨在帮助用户通过利用现有代码和预训练模型检查点,高效地创建、定制和部署新的语音 AI 模型。该仓库正在积极开发中,并已转向专门专注于音频、语音和多模态大语言模型,而之前更广泛的 NeMo 模态则保留在先前的发布标签中。
主要功能
- 用于语音 AI 的可扩展生成式 AI 框架
- 支持 ASR、TTS 和语音大语言模型
- 兼容用户自定义的 Python、PyTorch 和 CUDA 技术栈
- 可选加速后端(Transformer Engine、FlashAttention、Mamba、MoE、DeepEP)
- 针对 H100+ 和 A100 目标的交钥匙 Docker 容器构建
- 包含最近的模型发布,如 MagpieTTS、Nemotron-Speech-Streaming 和 Parakeet
要求、安装和快速入门
用法
模型兼容性与使用场景
最近的发布包括 MagpieTTS 多语言版(支持 12 种语言)、Nemotron-3.5-ASR-Streaming-0.6B(40 种语言)、Parakeet-unified-en-0.6b、Nemotron 3 VoiceChat、Nemotron-Speech-Streaming、Canary V2 和 Canary-Qwen-2.5B。
许可证与风险说明
在 Apache License 2.0 下授权。
Editorial verification 2026-08-09: repository URL, owner, description, license and repository statistics were reviewed. License metadata: Apache-2.0. README was fetched for the channel draft; re-check repository dependencies, releases and model terms before production use.
发布与维护
最近的更新包括 MagpieTTS v2607 (2026-07)、Nemotron-3.5-ASR-Streaming-0.6B (2026-06)、Parakeet-unified-en-0.6b (2026-04)、Nemotron 3 VoiceChat 早期访问版 (2026-03)、Nemotron-Speech-Streaming v2603 (2026-03)、MagpieTTS v2602 (2026-03) 和 Nemotron-Speech-Streaming 初始版本 (2026-01) 的发布。Parakeet V3 和 Canary V2 于 2025-08 发布,Canary-Qwen-2.5B 于 2025-06 发布。