HAMi v2.8.0 发布:全面支持 DRA 与高可用调度,迈向标准化 GPU 资源管理
HAMi 社区正式发布 HAMi v2.8.0。这是一个在 架构完整性、调度可靠性以及生态对齐 层面具有里程碑意义的版本。
v2.8.0 不仅引入了多项关键特性更新,也在 Kubernetes 原生标准对齐、异构设备支持、生产可用性与可观测性 等方面进行了系统性增强,使 HAMi 更加适合在长期运行、对稳定性和演进路径敏感的 AI 生产集群中使用。
本文将对 v2.8.0 的主要更新进行详细说明。
核心特性与能力更新
本节介绍 HAMi v2.8.0 的核心特性与能力更新,涵盖标准接口支持、高可用机制、设备兼容性等方面。
正式支持 Kubernetes Device Resource Assignment(DRA)
HAMi v2.8.0 新增对 Kubernetes Device Resource Assignment(DRA) 的支持,并提供了独立实现项目:
DRA 是 Kubernetes 社区正在推进的下一代设备资源声明与分配机制,旨在为 GPU/AI 加速器等设备提供 更标准化、可组合、可扩展 的资源管理模型。
HAMi 对 DRA 的支持,标志着项目在设备资源管理方向上,开始从"自定义设备调度逻辑"逐步走向 Kubernetes 原生标准接口。这不仅为未来更复杂的 GPU / AI 加速器使用模式奠定基础,也为 HAMi 在上游生态中的长期演进打开了空间。
关于 DRA 的设计理念、使用方式及与现有模式的对比,将在后续单独的技术解读文章中展开。
多 Scheduler 实例的 Leader 选举机制
在大规模集群或高可用部署场景下,HAMi v2.8.0 引入了 多 Scheduler 实例的 Leader 选举机制,以增强调度层的稳定性和可运维性。该机制具备以下优势:
- 避免多实例并发调度带来的资源冲突
- 提升 Scheduler 组件的高可用能力
- 为长期运行的生产集群提供更稳健的 运行模型
该机制使 HAMi 更适合部署在对稳定性和容错能力要求较高的生产环境中。
NVIDIA 设备支持 Container Device Interface(CDI)模式
HAMi v2.8.0 新增对 NVIDIA CDI(Container Device Interface) 模式的支持,进一步降低设备管理与容器运行时之间的耦合度。主要特性包括:
- 使用更标准的设备注入方式
- 提供更清晰的设备声明与生命周期管理
- 为未来多运行时、多设备模型打下基础
用户可以通过 values.yaml 中的 deviceListStrategy 配置项,选择使用传统的环境变量模式(envvar)或 CDI 模式(cdi-annotations)。
这一能力推动 HAMi 持续向 更云原生、可组合的设备管理方式 演进。
对齐 NVIDIA k8s-device-plugin v0.18.0
在 v2.8.0 中,HAMi 同步升级并对齐 NVIDIA 官方 k8s-device-plugin v0.18.0,以实现以下目标:
- 保持对 NVIDIA 最新设备管理模型的兼容
- 降低用户在混合部署场景中的适配成本
- 确保 HAMi 作为设备管理与调度的"