NVIDIA k8s-device-plugin 3836 Go https://avatars.githubusercontent.com/u/1728152?v=4 67 NVIDIA官方Kubernetes设备插件,实现GPU在容器化环境中的自动发现与调度。 NVIDIA device plugin for Kubernetes
创建于 8 年前
最后更新 3 周前
+1 stars today
AI 综合评分
67 B 级
代码质量 62
文档质量 70
社区健康 64
项目活跃 72
创新性 59
项目简介
NVIDIA官方Kubernetes设备插件,实现GPU在容器化环境中的自动发现与调度。
项目摘要
1. 【主题】
打破GPU与容器之间的壁垒,让Kubernetes集群像调度CPU一样轻松调度NVIDIA GPU。
2. 【核心分点总结】
资源暴露:将GPU以
nvidia.com/gpu的形式注册到K8s,让调度器看得见、分得清。健康检查:实时监控GPU健康状态,自动隔离故障卡,保障训练任务不中断。
MIG支持:完美适配A100/H100的Multi-Instance GPU特性,将一张物理卡切分为多个独立实例,提升利用率。
拓扑感知:感知GPU与NVLink的拓扑结构,让调度器做出最优分配,榨干算力。
3. 【行动指南】
- 场景:在K8s上跑深度学习训练或推理服务时,只需通过Helm一键安装,即可让Pod申请GPU资源。
- 场景:使用A100/H100等高端卡时,开启MIG模式,通过配置策略将GPU切分,供多个轻量级任务共享。
- 上手:部署后,只需在Pod的
resources.limits中声明nvidia.com/gpu,即可体验GPU加速。
4. 【金句总述】
让每一张NVIDIA GPU在Kubernetes集群中都能被精准调度,释放算力的最后一公里。
5. 【故事性收尾】
曾经,你需要在服务器间奔波,手动分配GPU,生怕资源争抢导致任务崩溃;如今,你只需在YAML里写下几行声明,看着Pod如候鸟般精准降落在空闲的GPU上,而你,终于可以端起咖啡,从容地注视着训练曲线稳步下降。