英文原标题:Share GPU clusters across teams with isolation and fairness using Amazon SageMaker HyperPod

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 文章介绍在 Amazon SageMaker HyperPod 上构建多租户(多团队)环境的参考架构,让多个团队共享同一 GPU 集群,同时保持隔离、公平与运营独立性。
  • 架构采用 AWS IAM Identity Center 做集中身份认证,并与外部身份提供商(如 Microsoft Entra ID)联合;用户可通过 CLI(aws sso login + kubectl)或 Identity Center 门户登录团队专属 SageMaker AI domain。
  • 隔离通过 Kubernetes namespace 实现:EKS access entries 将 IAM 角色映射到各团队命名空间内的 RBAC 权限,无论从 Studio 还是 CLI 访问,用户只能操作自己命名空间内的资源。
  • 公平分配与成本可见性依赖 HyperPod Task Governance(计算配额与调度优先级)以及命名空间级别的成本分摊,实现按团队的费用归属与计费。
  • 集群还包含 HyperPod Observability 监控层,以及分层存储:POSIX 文件系统(FSx for Lustre 或 OpenZFS)提供团队共享目录与用户主目录,另有按团队或共享的 S3 存储桶。

关键数据

  • 示例中两个团队(Team A 和 Team B)共享一个 HyperPod EKS 集群,各自运行在独立命名空间内。
  • 存储路径示例:团队共享目录 /fsx/TeamA、/fsx/TeamB,用户主目录 /home/User1、/home/User2。
  • 每个团队对应一个 permission set,Identity Center 自动为其创建 IAM 角色(如 TeamA-permissionset-role)。

引语

  • AWS IAM Identity Center(AWS Single Sign-On 的后继者)
  • HyperPod Task Governance(用于计算配额管理和调度优先级)

为什么值得看:它为需要在多个团队间共享昂贵 GPU 集群、同时要求隔离、公平调度和成本归属的组织,提供了一套基于 SageMaker HyperPod 与 EKS 的可落地参考架构。

站内导航