英文原标题:Impactful scheduling for GPU clusters
本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗
- Ai2的AI基础设施团队负责为约150名内部研究人员提供GPU算力,管理数千块NVIDIA H100、B200和B300 GPU,集群规模从88到1024块不等,用于LLM/VLM训练、机器人强化学习模拟和科学智能体后训练等。
- 团队用四层指标金字塔衡量调度:可用性、占用率、影响力和利用率,本文聚焦提升调度决策的“影响力”。
- 原有基于优先级的调度器导致GPU“蹲守”(用户挂起无操作负载)、优先级膨胀(100%工作负载使用HIGH优先级)以及值班工程师大量时间用于协商关闭不可抢占负载等问题。
- 团队将调度问题视为“公地悲剧”,并引用2011年Dominant Resource Fairness论文中搜索公司发现用户用无限循环虚增利用率的轶事。
- 新系统用GPU时间预算、分层公平份额分配和时间切片合约替代优先级调度器,将资源分配从个案操作转变为透明的行政预算过程,要求每个GPU时间请求必须有预算支持,否则不受抢占保护。
关键数据
- 管理数千块NVIDIA H100、B200和B300 GPU,集群规模88至1024块GPU
- 约150名内部研究人员
- 未满足的GPU请求是可用量的2-3倍
- 旧系统中最终100%的已调度工作负载使用HIGH优先级
- 示例中项目A1拥有总容量35%的保证份额
引语
为什么值得看:本文展示了如何用预算和分层公平份额机制解决GPU集群调度中的公地悲剧,在保持满占用率的同时优先高影响力研究,对管理稀缺算力资源有参考价值。