概览
vLLM Ascend 通过硬件可插拔接口将 Ascend NPU 后端集成到 vLLM。该集成旨在与 vLLM 核心保持解耦,同时支持类 Transformer 模型、混合专家模型、嵌入模型和多模态 LLM。该仓库处于活跃状态且未归档,主要语言为 C++。
主要功能
- 用于在受支持 Ascend NPU 上运行 vLLM 的硬件插件
- 通过硬件可插拔集成使 Ascend 支持与 vLLM 核心解耦
- 支持类别包括类 Transformer、混合专家、嵌入和多模态模型
- 提供版本化文档、快速入门指南以及模型和功能支持矩阵
- 维护 main、release 和 RFC 协作分支
- 通过问题跟踪器、用户论坛、Slack 频道和每周会议提供社区支持
要求、安装和快速入门
用法
模型兼容性与使用场景
仓库表示支持流行的开源类 Transformer、混合专家、嵌入和多模态 LLM,但提供的摘录未给出完整模型列表。请查阅 https://docs.vllm.ai/projects/ascend/en/latest/user_guide/support_matrix/ 了解模型和功能兼容性。仓库元数据中未说明对智能体框架、MCP 或 RAG 的特定支持。嵌入模型支持可能与检索管线相关,但未描述完整的 RAG 系统。
许可证与风险说明
采用 Apache License 2.0。仓库元数据将 SPDX 许可证标识为 Apache-2.0,并提供 https://api.github.com/licenses/apache-2.0。
发布与维护
提供的 README 将 v0.23.0rc1 列为最新候选发布版本,发布日期为 2026 年 7 月;将 v0.18.0 列为最新稳定版本,发布日期为 2026 年 5 月。还列出了 v0.13.0、v0.11.0、v0.9.1 和 v0.7.3。仓库元数据报告创建于 2025-01-29,最后推送于 2026-08-03。这些值均按所提供信息报告,未经过独立验证。