推理、部署与运行时

vLLM Ascend

vllm-project/vllm-ascend

一个由社区维护的硬件插件,使 vLLM 能够在受支持的 Ascend NPU 上运行模型推理与服务工作负载。

★ 2.7K星级
⑂ 2.1KFork 数
2541未解决的问题
C++语言
Apache-2.0许可证
Q@project.QualityScore编辑评分

概览

vLLM Ascend 通过硬件可插拔接口将 Ascend NPU 后端集成到 vLLM。该集成旨在与 vLLM 核心保持解耦,同时支持类 Transformer 模型、混合专家模型、嵌入模型和多模态 LLM。该仓库处于活跃状态且未归档,主要语言为 C++。

主要功能

  • 用于在受支持 Ascend NPU 上运行 vLLM 的硬件插件
  • 通过硬件可插拔集成使 Ascend 支持与 vLLM 核心解耦
  • 支持类别包括类 Transformer、混合专家、嵌入和多模态模型
  • 提供版本化文档、快速入门指南以及模型和功能支持矩阵
  • 维护 main、release 和 RFC 协作分支
  • 通过问题跟踪器、用户论坛、Slack 频道和每周会议提供社区支持

要求、安装和快速入门

提供的仓库摘录中未包含安装命令。请使用特定版本的安装文档。对于 v0.23.0rc1:https://docs.vllm.ai/projects/ascend/en/v0.23.0rc1/installation.html。对于 v0.18.0:https://docs.vllm.ai/projects/ascend/en/v0.18.0/installation.html。安装前请确认所有所述硬件和软件前提条件。

用法

提供的摘录中没有可执行的使用命令。请参阅 v0.23.0rc1 快速入门:https://docs.vllm.ai/projects/ascend/en/v0.23.0rc1/quick_start.html,或 v0.18.0 快速入门:https://docs.vllm.ai/projects/ascend/en/v0.18.0/quick_start.html。可通过 https://hidevlab.huawei.com/online-develop-intro 申请 Ascend NPU 开发或测试资源。

模型兼容性与使用场景

仓库表示支持流行的开源类 Transformer、混合专家、嵌入和多模态 LLM,但提供的摘录未给出完整模型列表。请查阅 https://docs.vllm.ai/projects/ascend/en/latest/user_guide/support_matrix/ 了解模型和功能兼容性。仓库元数据中未说明对智能体框架、MCP 或 RAG 的特定支持。嵌入模型支持可能与检索管线相关,但未描述完整的 RAG 系统。

许可证与风险说明

采用 Apache License 2.0。仓库元数据将 SPDX 许可证标识为 Apache-2.0,并提供 https://api.github.com/licenses/apache-2.0。

发布与维护

提供的 README 将 v0.23.0rc1 列为最新候选发布版本,发布日期为 2026 年 7 月;将 v0.18.0 列为最新稳定版本,发布日期为 2026 年 5 月。还列出了 v0.13.0、v0.11.0、v0.9.1 和 v0.7.3。仓库元数据报告创建于 2025-01-29,最后推送于 2026-08-03。这些值均按所提供信息报告,未经过独立验证。

OpenVINO

openvinotoolkit/openvino

★ 10.6KC++

GPUStack

gpustack/gpustack

★ 5.4KPython