推理、部署与运行时

xLLM:面向多类 AI 加速器的高性能推理引擎

xllm-ai/xllm

xLLM 是一个 C++ 推理框架,支持 LLM、VLM、DiT 和 REC 模型。它面向多个 AI 加速器系列提供高吞吐、低延迟部署,并将服务层的调度与可用性职责同引擎层计算分离。

★ 1.5K星级
⑂ 279Fork 数
208未解决的问题
C++语言
Apache-2.0许可证
Q@project.QualityScore编辑评分

概览

该项目面向企业级推理,尤其强调对中国 AI 加速器的支持。仓库称 xLLM 已用于京东核心零售业务,并由开放原子开源基金会托管。其范围是模型推理,而非模型训练。所提供的数据未描述 Agent、MCP 或 RAG 功能。

主要功能

  • 涵盖 LLM、VLM、DiT 和 REC 模型类别的推理支持
  • 针对多个中国 AI 加速器系列的优化
  • 服务层与计算引擎分离
  • 在线服务和离线推理工作流
  • 支持卸载和预取的混合 KV 缓存管理
  • C++ 实现
  • 聚焦高吞吐和低延迟推理
  • README 中链接了 Docker 镜像

要求、安装和快速入门

所提供的摘录中未包含准确的源码构建或软件包安装命令。请参阅官方快速入门文档:https://docs.xllm-ai.com/en/getting_started/quick_start/。项目容器仓库位于:https://quay.io/repository/jd_xllm/xllm-ai?tab=tags。在部署前,请确认文档及硬件特定的驱动要求。

用法

文档化的起点包括启动指南:https://docs.xllm-ai.com/en/getting_started/launch_xllm/,在线服务:https://docs.xllm-ai.com/en/getting_started/online_service/,以及离线推理:https://docs.xllm-ai.com/en/getting_started/offline_service/。所提供的摘录中未包含具体命令、配置示例和 API 请求格式。

模型兼容性与使用场景

仓库描述了对 LLM、VLM、DiT 和 REC 模型的支持。已公布的模型支持包括 MiniMax-M3、DeepSeek-V4、GLM-5、GLM-4.7、GLM-4.6V、GLM-4.5/GLM-4.6 和 VLM-R1。权威兼容性列表链接为:https://docs.xllm-ai.com/en/supported_models/。量化格式、上下文长度和各硬件平台的模型覆盖范围等兼容性细节,未在所提供的数据中说明。

许可证与风险说明

Apache License 2.0,SPDX 标识为 Apache-2.0。许可证参考:https://api.github.com/licenses/apache-2.0。用户应在重新分发前审阅许可证文本及相关依赖项的许可证。

发布与维护

README 报告称,该项目于 2026-07-06 捐赠给开放原子开源基金会,于 2026-06-13 当日支持 MiniMax-M3,并于 2026-04-24 当日支持 DeepSeek-V4。更早的公告包括 GLM-5、GLM-4.7、GLM-4.6V、GLM-4.5/4.6、VLM-R1 和混合 KV 缓存管理。所提供记录中未说明正式标签发布的详细信息。

OpenVINO

openvinotoolkit/openvino

★ 10.6KC++

GPUStack

gpustack/gpustack

★ 5.4KPython