推理、部署与运行时

llm-d:在 Kubernetes 上进行分布式 LLM 推理

llm-d/llm-d

llm-d 是一个开源服务栈,围绕 vLLM 和 SGLang 等模型服务器提供分布式编排、路由、缓存管理、自动扩缩容和批处理能力。它面向 Kubernetes 和现代硬件加速器上的大规模生产推理。

★ 4K星级
⑂ 649Fork 数
233未解决的问题
Shell语言
Apache-2.0许可证
Q@project.QualityScore编辑评分

概览

该项目提供面向大语言模型推理的基准测试部署模式和运维组件。核心领域包括前缀缓存感知与负载感知路由、预测延迟调度、分层 KV 缓存卸载、预填充/解码解耦、广域专家并行、多租户流量控制、SLO 感知自动扩缩容及异步批量服务。llm-d 被描述为由 Red Hat、Google Cloud、IBM Research、CoreWeave 和 NVIDIA 创立的 CNCF Sandbox 项目。该仓库主要使用 Shell。

主要功能

  • 前缀缓存感知和负载感知的智能路由
  • 预测延迟调度
  • 通过全局缓存状态索引将分层 KV 缓存卸载至 CPU 或磁盘
  • 用于大型模型服务的预填充/解码解耦
  • 跨高速加速器互连的广域专家并行
  • 多租户流量控制和 SLO 感知自动扩缩容
  • 支持异步处理的 OpenAI 兼容 Batch API
  • 经过基准测试的部署指南和 Kubernetes 打包模式
  • 集成包括 vLLM 和 SGLang 在内的模型服务器

要求、安装和快速入门

所提供的仓库摘录中未包含完整安装命令。请遵循官方快速入门指南:https://llm-d.ai/docs/getting-started/quickstart。该项目还提供 Helm charts 和指南,而最新动态称较新的指南已转向 kustomize-first 方法。确切工具版本和命令应以当前文档为准,不应从该记录中推断。

用法

可从 Optimized Baseline 指南开始:https://llm-d.ai/docs/guides/optimized-baseline。文档化的快速入门流程是准备 Kubernetes 栈、部署优化的推理服务、配置智能路由,并使用面向生产的基准测试进行验证。其他架构模式列于 https://llm-d.ai/docs/guides,基准测试结果位于 https://prism.llm-d.ai。所提供摘录中未提供可直接复制的使用命令或 API 请求。

模型兼容性与使用场景

该栈旨在运行于 vLLM 和 SGLang 等模型服务器之上,并面向主要开源 LLM。仓库中列出的示例包括 DeepSeek-R1、DeepSeek V3.1、GPT-OSS、GPT-OSS-120B、Llama 3.1 70B 和 Llama 3.3 70B。这并不构成完整兼容性列表。仓库元数据未说明 Agent 专用模型、嵌入模型、MCP 服务器和 RAG 专用组件。

许可证与风险说明

Apache License 2.0,SPDX 标识为 Apache-2.0。仓库引导读者查看其 LICENSE 文件以了解完整条款。所提供数据未说明其他许可证例外。

发布与维护

README 显示 Version 0.8 徽章,但所提供摘录未包含相应详情。其最新详细条目称,v0.7 增加了稳定的优化基线、kustomize-first 指南、扩展的 nightly CI、正式可用的预测延迟调度、实验性批处理网关和修订后的文档。更早的条目描述了 v0.5 功能,包括分层 KV 卸载、缓存感知 LoRA 路由、主动-主动高可用性、传输韧性和 scale-to-zero 自动扩缩容,以及 v0.4 的加速器和缓存卸载工作。当前发布说明位于 https://github.com/llm-d/llm-d/releases。

OpenVINO

openvinotoolkit/openvino

★ 10.6KC++

GPUStack

gpustack/gpustack

★ 5.4KPython