概览
该项目面向企业级推理,尤其强调对中国 AI 加速器的支持。仓库称 xLLM 已用于京东核心零售业务,并由开放原子开源基金会托管。其范围是模型推理,而非模型训练。所提供的数据未描述 Agent、MCP 或 RAG 功能。
主要功能
- 涵盖 LLM、VLM、DiT 和 REC 模型类别的推理支持
- 针对多个中国 AI 加速器系列的优化
- 服务层与计算引擎分离
- 在线服务和离线推理工作流
- 支持卸载和预取的混合 KV 缓存管理
- C++ 实现
- 聚焦高吞吐和低延迟推理
- README 中链接了 Docker 镜像
要求、安装和快速入门
用法
模型兼容性与使用场景
仓库描述了对 LLM、VLM、DiT 和 REC 模型的支持。已公布的模型支持包括 MiniMax-M3、DeepSeek-V4、GLM-5、GLM-4.7、GLM-4.6V、GLM-4.5/GLM-4.6 和 VLM-R1。权威兼容性列表链接为:https://docs.xllm-ai.com/en/supported_models/。量化格式、上下文长度和各硬件平台的模型覆盖范围等兼容性细节,未在所提供的数据中说明。
许可证与风险说明
Apache License 2.0,SPDX 标识为 Apache-2.0。许可证参考:https://api.github.com/licenses/apache-2.0。用户应在重新分发前审阅许可证文本及相关依赖项的许可证。
发布与维护
README 报告称,该项目于 2026-07-06 捐赠给开放原子开源基金会,于 2026-06-13 当日支持 MiniMax-M3,并于 2026-04-24 当日支持 DeepSeek-V4。更早的公告包括 GLM-5、GLM-4.7、GLM-4.6V、GLM-4.5/4.6、VLM-R1 和混合 KV 缓存管理。所提供记录中未说明正式标签发布的详细信息。