NVIDIA avatar

NVIDIA/k8s-device-plugin

3.8k 850 63
Go Apache-2.0
创建于 8 年前 最后更新 3 周前 +1 stars today

AI 综合评分

67 B 级
代码质量
62
文档质量
70
社区健康
64
项目活跃
72
创新性
59

项目简介

NVIDIA官方Kubernetes设备插件,实现GPU在容器化环境中的自动发现与调度。

项目摘要

1. 【主题】

打破GPU与容器之间的壁垒,让Kubernetes集群像调度CPU一样轻松调度NVIDIA GPU。

2. 【核心分点总结】

  1. 资源暴露:将GPU以nvidia.com/gpu的形式注册到K8s,让调度器看得见、分得清。

  2. 健康检查:实时监控GPU健康状态,自动隔离故障卡,保障训练任务不中断。

  3. MIG支持:完美适配A100/H100的Multi-Instance GPU特性,将一张物理卡切分为多个独立实例,提升利用率。

  4. 拓扑感知:感知GPU与NVLink的拓扑结构,让调度器做出最优分配,榨干算力。

3. 【行动指南】

  1. 场景:在K8s上跑深度学习训练或推理服务时,只需通过Helm一键安装,即可让Pod申请GPU资源。
  2. 场景:使用A100/H100等高端卡时,开启MIG模式,通过配置策略将GPU切分,供多个轻量级任务共享。
  3. 上手:部署后,只需在Pod的resources.limits中声明nvidia.com/gpu,即可体验GPU加速。

4. 【金句总述】

让每一张NVIDIA GPU在Kubernetes集群中都能被精准调度,释放算力的最后一公里。

5. 【故事性收尾】

曾经,你需要在服务器间奔波,手动分配GPU,生怕资源争抢导致任务崩溃;如今,你只需在YAML里写下几行声明,看着Pod如候鸟般精准降落在空闲的GPU上,而你,终于可以端起咖啡,从容地注视着训练曲线稳步下降。

相关项目推荐