概览
NVIDIA Container Toolkit 位于宿主机驱动与容器运行时之间,负责让容器使用所需 GPU 设备和驱动相关组件。它并不提供某个 AI 模型,而是模型镜像能否使用 GPU 的基础设施环节。对已经通过容器部署应用的团队,先打通宿主机、运行时和测试容器三层,再加入实际模型镜像,可以更快区分驱动问题、容器配置问题和应用依赖问题。
主要功能
- 为 GPU 容器提供运行时集成。
- 提供 nvidia-ctk 配置工具。
- 官方文档覆盖 Docker 配置。
- 提供 containerd 与 CRI-O 等运行时路径。
- 支持按部署方式配置设备访问。
- 与 CUDA 应用镜像结合部署模型工作负载。
要求、安装和快速入门
1. 在 Linux 宿主机安装兼容的 NVIDIA 驱动,先确认 nvidia-smi 能正常识别设备。
2. 根据发行版按官方安装指南配置 NVIDIA 软件仓库。
3. 安装指南列出的 Container Toolkit 软件包,按需要固定版本。
4. Docker 路径执行 sudo nvidia-ctk runtime configure --runtime=docker。
5. 在合适维护窗口执行 sudo systemctl restart docker,使配置生效。
6. 按官方运行示例启动带 --gpus all 的测试容器,确认容器内能看到 GPU 后,再启动模型镜像。
2. 根据发行版按官方安装指南配置 NVIDIA 软件仓库。
3. 安装指南列出的 Container Toolkit 软件包,按需要固定版本。
4. Docker 路径执行 sudo nvidia-ctk runtime configure --runtime=docker。
5. 在合适维护窗口执行 sudo systemctl restart docker,使配置生效。
6. 按官方运行示例启动带 --gpus all 的测试容器,确认容器内能看到 GPU 后,再启动模型镜像。
用法
部署一个推理服务时,先在宿主机确认 GPU 和驱动,再用最小容器验证 GPU 访问,最后挂载模型目录并启动应用。将驱动版本、镜像标签、Toolkit 版本和 GPU 分配方式记录在部署说明中。如果宿主机正常而容器看不到设备,应先检查运行时配置;容器已能访问设备但模型失败,则继续排查 CUDA 兼容性、显存和应用依赖。
实施要点
重启 Docker 会影响正在运行的工作负载,应先安排变更窗口。Rootless Docker、containerd 与 CRI-O 使用各自配置步骤,不能直接复制普通 Docker 的全部命令。
实施要点
重启 Docker 会影响正在运行的工作负载,应先安排变更窗口。Rootless Docker、containerd 与 CRI-O 使用各自配置步骤,不能直接复制普通 Docker 的全部命令。
模型兼容性与使用场景
需要支持的 Linux 环境、NVIDIA GPU 驱动和相应容器运行时。官方明确说明宿主机不必安装 CUDA Toolkit,但必须安装 NVIDIA 驱动;容器中的 CUDA 版本仍需与驱动兼容。
许可证与风险说明
仓库采用 Apache-2.0;GPU 驱动、CUDA 镜像及部署的模型可能适用不同条款。