跳转到文档内容

实践教程

通过动手实践学习 HAMi。每个实验都是带真实输出的分步练习:你将亲手搭建集群、安装 HAMi,并验证 GPU 切分行为。

概念

实验所依赖的背景知识。

实验

实验 1: 在线安装 HAMi入门

在云虚拟机上从零搭建 GPU Kubernetes 集群并安装 HAMi。

约 60 分钟
实验 2: 本地 Fake GPU 安装 HAMi入门

在笔记本上学习 HAMi 控制面,无需 GPU。

约 30 分钟
实验 3: 使用 HAMi 进行 GPU 分区进阶

多个 Pod 共享一张 GPU,显存和算力限制可验证。

约 30 分钟
实验 4: 使用动态资源分配进行 GPU 切片高级

通过 Kubernetes 原生 Dynamic Resource Allocation 实现同样效果(实验性)。

约 45 分钟
实验 5: 使用 nvml-mock 进行 Fake-GPU 调度进阶

用 nvml-mock 模拟 8 张 A100 GPU 验证 HAMi 调度能力,无需真实 GPU。

约 40 分钟
实验 6: 在 HAMi GPU 分片上运行 vLLM 推理进阶

在已有 GPU 集群上安装 HAMi,并用 GPU 切分能力调度 vLLM 推理服务。

约 45 分钟
实验 7: 在 k3s 上不使用 GPU Operator 实现 GPU 隔离进阶

在单节点 k3s 上让多个 Pod 共享一张非 MIG GPU,并证明 HAMi-core 强制执行显存上限。

约 45 分钟
实验 8:Volcano vGPU、Gang 调度与队列限制高级

使用 Volcano vGPU 共享单张 GPU,并验证 Gang 调度和队列级 vGPU 资源限制。

约 60 分钟
实验 9: 使用 Kueue 管理 HAMi vGPU 队列高级

在 Pod 进入调度器之前,按 vGPU 数量、显存和算力执行配额准入。

约 60 分钟
实验 10: 使用虚拟 GPU 进行拓扑感知调度进阶

模拟一套非对称的 PCIe 拓扑,验证 HAMi 拓扑感知调度器在多 GPU 请求时会避开连接较差的 GPU,而在单 GPU 请求时会选中它,全程无需真实 GPU。

约 45 分钟

每个实验都列出了各自的前提条件。实验 3 和 4 直接复用实验 1 搭建的集群,一次开机即可完成全部三个实验;实验 2 可在任意笔记本上运行,无需 GPU。实验 7 在租用的 GPU 虚拟机上自行搭建单节点 k3s 集群,不使用 GPU Operator。实验 8 需要已有的 Volcano GPU 集群,用于验证 Volcano vGPU、Gang 调度和队列级资源限制。实验 9 使用 Kueue 准入控制限制 HAMi vGPU 数量、显存和算力配额。

CNCFHAMi 是 CNCF 孵化项目