概览
该项目提供面向大语言模型推理的基准测试部署模式和运维组件。核心领域包括前缀缓存感知与负载感知路由、预测延迟调度、分层 KV 缓存卸载、预填充/解码解耦、广域专家并行、多租户流量控制、SLO 感知自动扩缩容及异步批量服务。llm-d 被描述为由 Red Hat、Google Cloud、IBM Research、CoreWeave 和 NVIDIA 创立的 CNCF Sandbox 项目。该仓库主要使用 Shell。
主要功能
- 前缀缓存感知和负载感知的智能路由
- 预测延迟调度
- 通过全局缓存状态索引将分层 KV 缓存卸载至 CPU 或磁盘
- 用于大型模型服务的预填充/解码解耦
- 跨高速加速器互连的广域专家并行
- 多租户流量控制和 SLO 感知自动扩缩容
- 支持异步处理的 OpenAI 兼容 Batch API
- 经过基准测试的部署指南和 Kubernetes 打包模式
- 集成包括 vLLM 和 SGLang 在内的模型服务器
要求、安装和快速入门
用法
模型兼容性与使用场景
该栈旨在运行于 vLLM 和 SGLang 等模型服务器之上,并面向主要开源 LLM。仓库中列出的示例包括 DeepSeek-R1、DeepSeek V3.1、GPT-OSS、GPT-OSS-120B、Llama 3.1 70B 和 Llama 3.3 70B。这并不构成完整兼容性列表。仓库元数据未说明 Agent 专用模型、嵌入模型、MCP 服务器和 RAG 专用组件。
许可证与风险说明
Apache License 2.0,SPDX 标识为 Apache-2.0。仓库引导读者查看其 LICENSE 文件以了解完整条款。所提供数据未说明其他许可证例外。
发布与维护
README 显示 Version 0.8 徽章,但所提供摘录未包含相应详情。其最新详细条目称,v0.7 增加了稳定的优化基线、kustomize-first 指南、扩展的 nightly CI、正式可用的预测延迟调度、实验性批处理网关和修订后的文档。更早的条目描述了 v0.5 功能,包括分层 KV 卸载、缓存感知 LoRA 路由、主动-主动高可用性、传输韧性和 scale-to-zero 自动扩缩容,以及 v0.4 的加速器和缓存卸载工作。当前发布说明位于 https://github.com/llm-d/llm-d/releases。