实验 8:Volcano vGPU、Gang 调度与队列限制
本实验组合了 AI 基础设施中经常同时出现的两类能力:
- Volcano vGPU 与 HAMi-core 负责共享一张物理 NVIDIA GPU,并向容器提供显存和算力限制。
- Volcano Scheduler 提供批任务调度语义,包括 Gang 调度和队列级资源上限。
你将先验证一个 vGPU Pod,然后运行一个双 worker VolcanoJob;接着故意制造 Gang 资源不足场景;最后证明即使节点本身还有足够资源,Queue 也能通过 capability 限制 vGPU 用量。
本文输出采集自一套单节点集群:一张 NVIDIA GeForce RTX 3070 Ti(8 GiB)、NVIDIA 驱动 580.159.03、Volcano Scheduler,以及以 HAMi-core 模式运行的 Volcano vGPU device plugin。其他 GPU 上的资源数值会有所不同。
important
本实验使用的是 Volcano vGPU 路线,不是标准 HAMi Helm 安装路线。不要在同一个 GPU 节点上同时安装标准 HAMi device plugin。一个 GPU 节点在同一时间应只由一种 device-plugin 路线管理。