新闻 · AWS Machine Learning Blog
推出Amazon SageMaker HyperPod Inference Gateway
Amazon SageMaker HyperPod Inference Gateway是面向Amazon EKS的Kubernetes原生、GPU感知路由附加组件。它利用实时GPU信号将每个推理请求发送到最合适的Pod,在无需更改模型服务器或客户端应用程序的情况下,将首Token延迟降低多达82%。
en
新闻 · AWS Machine Learning Blog
Amazon SageMaker HyperPod Inference Gateway是面向Amazon EKS的Kubernetes原生、GPU感知路由附加组件。它利用实时GPU信号将每个推理请求发送到最合适的Pod,在无需更改模型服务器或客户端应用程序的情况下,将首Token延迟降低多达82%。
英文原标题:Introducing Amazon SageMaker HyperPod Inference Gateway
本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗
为什么值得看:它通过 GPU 感知路由解决默认 Kubernetes 负载均衡导致的 GPU 浪费和高延迟问题,且部署简单、无需应用更改,能显著提升 LLM 推理效率。