LLM 与基础模型

NVIDIA NeMo Speech

nvidia-nemo/speech

一个可扩展的生成式 AI 框架,专为从事自动语音识别 (ASR)、文本转语音 (TTS) 和语音大语言模型的研究人员和 PyTorch 开发者构建。

★ 17.9K星级
⑂ 3.5KFork 数
237未解决的问题
Python语言
Apache-2.0许可证
Q@project.QualityScore编辑评分

项目截图

NVIDIA NeMo Speech 的截图 NVIDIA NeMo Speech 的截图 NVIDIA NeMo Speech 的截图 NVIDIA NeMo Speech 的截图 NVIDIA NeMo Speech 的截图 NVIDIA NeMo Speech 的截图

概览

NVIDIA NeMo Speech 是一个基于 Python 的框架,专注于音频、语音和多模态大语言模型。它旨在帮助用户通过利用现有代码和预训练模型检查点,高效地创建、定制和部署新的语音 AI 模型。该仓库正在积极开发中,并已转向专门专注于音频、语音和多模态大语言模型,而之前更广泛的 NeMo 模态则保留在先前的发布标签中。

主要功能

  • 用于语音 AI 的可扩展生成式 AI 框架
  • 支持 ASR、TTS 和语音大语言模型
  • 兼容用户自定义的 Python、PyTorch 和 CUDA 技术栈
  • 可选加速后端(Transformer Engine、FlashAttention、Mamba、MoE、DeepEP)
  • 针对 H100+ 和 A100 目标的交钥匙 Docker 容器构建
  • 包含最近的模型发布,如 MagpieTTS、Nemotron-Speech-Streaming 和 Parakeet

要求、安装和快速入门

推荐的安装方式是使用 uv 从源代码安装:`git clone https://github.com/NVIDIA-NeMo/NeMo.git`,`cd NeMo`,然后运行 `uv sync --extra all --extra cu13`(适用于 CUDA 13.x)或 `uv sync --extra all --extra cu12`(适用于 CUDA 12.x)。或者,从 Docker 构建:`docker buildx build -f docker/Dockerfile -t nemo-speech .`,并使用 `docker run --rm -it --gpus all -v "$PWD:/workspace" nemo-speech bash` 运行。对于自带环境使用 pip 的情况:`uv pip install 'nemo-toolkit[asr,tts]'` 或 `pip install 'nemo-toolkit[asr,tts]'`。

用法

安装后,用户可以使用通过 HuggingFace 集合提供的预训练检查点和演示。有关技术用法和框架指南,请参阅 NeMo Framework 用户指南文档。提供的仓库元数据中未详述用于模型训练或推理的具体命令行使用示例。

模型兼容性与使用场景

最近的发布包括 MagpieTTS 多语言版(支持 12 种语言)、Nemotron-3.5-ASR-Streaming-0.6B(40 种语言)、Parakeet-unified-en-0.6b、Nemotron 3 VoiceChat、Nemotron-Speech-Streaming、Canary V2 和 Canary-Qwen-2.5B。

许可证与风险说明

在 Apache License 2.0 下授权。

Editorial verification 2026-08-09: repository URL, owner, description, license and repository statistics were reviewed. License metadata: Apache-2.0. README was fetched for the channel draft; re-check repository dependencies, releases and model terms before production use.

发布与维护

最近的更新包括 MagpieTTS v2607 (2026-07)、Nemotron-3.5-ASR-Streaming-0.6B (2026-06)、Parakeet-unified-en-0.6b (2026-04)、Nemotron 3 VoiceChat 早期访问版 (2026-03)、Nemotron-Speech-Streaming v2603 (2026-03)、MagpieTTS v2602 (2026-03) 和 Nemotron-Speech-Streaming 初始版本 (2026-01) 的发布。Parakeet V3 和 Canary V2 于 2025-08 发布,Canary-Qwen-2.5B 于 2025-06 发布。

ClearML

clearml/clearml

★ 6.8KPython