项目截图
概览
Xinference 简化了最先进的内置或自定义 AI 模型的部署和服务,只需一条命令即可完成。它支持跨多个设备或机器的分布式推理,并与 vLLM 和 ggml 等各种推理引擎集成。该框架提供与 OpenAI 兼容的 RESTful API,为基于 OpenAI API 标准构建的应用程序实现无缝迁移和互操作。
主要功能
- 轻松的模型服务:通过一条命令部署模型
- 最先进的内置模型:轻松访问前沿的开源模型
- 异构硬件利用:通过 ggml 智能使用 GPU 和 CPU
- 灵活的 API 和接口:与 OpenAI 兼容的 RESTful API、RPC、CLI 和 WebUI
- 分布式部署:跨多个设备或机器分布推理
- 内置第三方库集成:LangChain、LlamaIndex、Dify、Chatbox、Xagent
- 自动批处理以提高吞吐量
- 通过 Xagent 集成实现原生 Agent 服务
要求、安装和快速入门
用法
模型兼容性与使用场景
支持广泛的内置模型,包括 Llama3、ChatGLM、GLM4、Flan-T5、Gemma、Mistral、Qwen、Whisper、WizardLM、MiniMax-M3、VibeThinker、Nex-N2、Unlimited-OCR、Ornith-1.0-35B、MiniCPM5-1B、jina-embeddings-v5 和 MiniCPM-V-4.6。也支持自定义模型。
许可证与风险说明
在 Apache-2.0 下授权。
Editorial verification 2026-08-09: repository URL, owner, description, license and repository statistics were reviewed. License metadata: Apache-2.0. README was fetched for the channel draft; re-check repository dependencies, releases and model terms before production use.
发布与维护
Xinference 3.0.0 已发布,包含迁移说明和重大更改。增强功能包括通过 Xagent 实现原生 Agent 服务、针对并发请求的自动批处理、用于连续批处理的 Xllamacpp、跨工作器的分布式推理,以及跨多个副本的 VLLM 共享 KV 缓存。