项目截图
概览
hal0是一个自托管的AI推理平台,可将Linux机器转变为完善的、兼容OpenAI的推理设备。它原生针对具有128GB统一内存的AMD Ryzen AI Max+ 395 (Strix Halo)进行了优化,但也支持在其他AMD、NVIDIA和纯CPU系统上的回退部署。该平台采用容器化架构,每个推理工作负载都在专用的systemd单元下作为隔离的Podman容器运行。单一控制平面(端口8080上的`hal0-api`)管理插槽状态机,将兼容OpenAI的`/v1/*`请求分派到相应的插槽端口,并提供Web仪表板。它具有声明式配置、原子自更新和内置硬件感知探测功能。
主要功能
- 兼容OpenAI的 /v1/* API网关
- 每个推理插槽使用隔离的Podman容器
- 原生支持AMD Strix Halo和XDNA NPU,带有FLM三元组打包
- 带有统一内存和VRAM适配警告的硬件感知探测
- 用于原子模型/插槽布局更改及回滚的声明式Stack
- 带有8个客户端工具调用工具(图像生成/编辑、TTS、转录、视觉、嵌入、重排、route_to_chat)的OmniRouter
- 经过Cosign验证的原子自更新,支持一键回滚
- 内置仪表板,采用React 18、实时遥测和journald日志流
- 伴随服务管理(Open WebUI、ComfyUI、Hermes、Hindsight、n8n)及mDNS发现
- 带有74工具管理目录和按角色工具策略的hal0-brain管家代理
要求、安装和快速入门
sh
curl -fsSL https://hal0.dev/install.sh | bash
对于Proxmox VE,专用脚本会创建一个非特权的Debian 13 LXC并运行标准引导:
sh
bash -c "$(curl -fsSL https://raw.githubusercontent.com/Hal0ai/hal0/main/scripts/proxmox-ve/hal0.sh)"
可以设置如`HAL0_SKIP_SETUP=1`、`HAL0_SKIP_BRAIN_MODEL=1`或`HAL0_NONINTERACTIVE=1`等环境变量来跳过特定的安装步骤。重新运行安装程序是安全的,因为所有配置步骤都是幂等的。
用法
sh
# 后端
python -m venv .venv && source .venv/bin/activate
pip install -e ".[dev]"
hal0 serve --reload
# 前端
cd ui
npm install
npm run dev
日常运维命令包括:
sh
systemctl status hal0-api
systemctl list-units 'hal0-slot@*'
journalctl -fu hal0-api
systemctl restart hal0-slot@agent
使用`hal0 doctor`检查预检要求,使用`hal0 uninstall [--keep-data]`卸载安装。
模型兼容性与使用场景
支持通过`hal0 model pull <ref>`从Hugging Face拉取的本地模型(存储在`registry.toml`中)以及外部上游模型(OpenRouter、Anthropic、OpenAI、Google AI Studio、Ollama、自定义)。本地推理后端包括ROCm(FP4分支)、Vulkan、实验性CUDA、CPU和AMD XDNA NPU(通过FastFlowLM)。具体的模型配置取决于插槽配置文件(例如,`rocm`、`rocm-dnse`、`vulkan`、`cuda`、`flm`、`comfyui`)。
许可证与风险说明
Apache-2.0
Editorial verification 2026-08-02: repository URL, owner, description, license and repository statistics were reviewed. License metadata: Apache-2.0. README was fetched for the channel draft; re-check repository dependencies, releases and model terms before production use.
发布与维护
v0.9.4 — 公开测试版。容器运行时时代,带有声明式配置。具有hal0-brain管家、上游模型控制、仪表板内基准测试、带有实时遥测的仪表板重新设计以及伴随服务管理功能。