英文原标题:Introducing Amazon SageMaker HyperPod Inference Gateway

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • Amazon SageMaker HyperPod Inference Gateway 是一个 Kubernetes 原生的 GPU 感知路由系统,以单个 EKS 托管插件形式部署在现有 HyperPod 基础设施上,无需修改模型服务器或客户端应用。
  • 它采用两层架构:第一层是每集群网关(EKS 托管插件),包含 Envoy Gateway、Body-Based Router 和 Endpoint Picker,基于开源 Gateway API Inference Extension 构建;第二层是即将推出的 Global Inference Router,提供跨集群和区域的协调、故障转移、全局限流和成本感知流量整形。
  • Endpoint Picker 使用加权评分算法,基于实时 Prometheus 指标(KV 缓存利用率、队列深度、LoRA 适配器驻留、前缀缓存命中率、运行中请求数)选择最佳后端,权重可配置以适配不同工作负载。
  • 该网关支持多模型路由(通过请求体中的 model 字段路由到不同模型池)和 LoRA 适配器路由(将请求路由到已加载适配器的 Pod),并具备优雅降级和自愈能力,例如 Pod 故障时自动排除、池耗尽时返回 HTTP 429、集群故障时 35 秒内重定向。
  • 入门只需安装插件、给模型 Pod 打标签、应用 InferenceGatewayConfig 自定义资源,然后通过 OpenAI 兼容端点发送请求,无需 SDK 更改或 SigV4 签名。

关键数据

  • 首令牌延迟降低高达 82%
  • 聊天机器人用户等待首令牌从 4.4 秒降至 800 毫秒以下
  • 基准测试覆盖 8B 到 235B 参数的四个模型,部署在 p5.48xlarge (H100) 和 g5 (A10G) 实例上
  • 集群故障时 GIR 在 35 秒内检测到心跳过期并重定向流量

为什么值得看:它通过 GPU 感知路由解决默认 Kubernetes 负载均衡导致的 GPU 浪费和高延迟问题,且部署简单、无需应用更改,能显著提升 LLM 推理效率。

站内导航