英文原标题:Impactful scheduling for GPU clusters

本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗

  • Ai2的AI基础设施团队负责为约150名内部研究人员提供GPU算力,管理数千块NVIDIA H100、B200和B300 GPU,集群规模从88到1024块不等,用于LLM/VLM训练、机器人强化学习模拟和科学智能体后训练等。
  • 团队用四层指标金字塔衡量调度:可用性、占用率、影响力和利用率,本文聚焦提升调度决策的“影响力”。
  • 原有基于优先级的调度器导致GPU“蹲守”(用户挂起无操作负载)、优先级膨胀(100%工作负载使用HIGH优先级)以及值班工程师大量时间用于协商关闭不可抢占负载等问题。
  • 团队将调度问题视为“公地悲剧”,并引用2011年Dominant Resource Fairness论文中搜索公司发现用户用无限循环虚增利用率的轶事。
  • 新系统用GPU时间预算、分层公平份额分配和时间切片合约替代优先级调度器,将资源分配从个案操作转变为透明的行政预算过程,要求每个GPU时间请求必须有预算支持,否则不受抢占保护。

关键数据

  • 管理数千块NVIDIA H100、B200和B300 GPU,集群规模88至1024块GPU
  • 约150名内部研究人员
  • 未满足的GPU请求是可用量的2-3倍
  • 旧系统中最终100%的已调度工作负载使用HIGH优先级
  • 示例中项目A1拥有总容量35%的保证份额

引语

  • 用户会在代码中撒入无限循环以人为抬高利用率水平。

为什么值得看:本文展示了如何用预算和分层公平份额机制解决GPU集群调度中的公地悲剧,在保持满占用率的同时优先高影响力研究,对管理稀缺算力资源有参考价值。

站内导航