英文原标题:Amazon SageMaker Inference: 2026 year-to-date launches in review

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • Amazon SageMaker AI 在 2026 年至今通过两条路径(托管端点与 HyperPod Inference)发布了 13 项新推理能力,分别面向希望 AWS 托管基础设施的团队和需要 Kubernetes 原生控制的团队。
  • 托管端点路径的七项发布覆盖部署、容量、集成、扩展、可观测性和异步简化,包括推理推荐、容量感知实例池、OpenAI 兼容 API 和容器缓存等。
  • 推理推荐(2026 年 4 月)自动完成实例类型、容器和优化设置的选择,将原本需 2-3 周、针对 1000+ 组合的手动基准测试自动化,且生成推荐不额外收费。
  • 容量感知实例池(2026 年 5 月)允许定义最多五种实例类型的优先级列表,在创建、扩容和缩容时自动回退,避免单一实例类型容量短缺导致端点失败。
  • OpenAI 兼容 API(2026 年 5 月)在端点上暴露 /openai/v1 路径,支持流式 Chat Completions,迁移只需更改端点 URL,认证使用最长 12 小时有效的 bearer token。

关键数据

  • 2026 年至今发布 13 项新能力
  • 推理推荐原本需 2-3 周手动基准测试,针对 1000+ 组合
  • 容量感知实例池支持最多五种实例类型
  • OpenAI 兼容 API 的 bearer token 有效期最长 12 小时,已在 14 个 AWS 区域可用
  • 容器缓存演示:Qwen3-8B 在 ml.g6.2xlarge 上使用 LMI 容器(17.7 GB 压缩),启动延迟从 525 秒降至 258 秒,减少 51%;模型下载从 168 秒降至 77 秒
  • 早期访问客户观察到 38% 至 65% 的改进
  • GPT-OSS-20B 吞吐优化演示:相同请求延迟下每秒 token 数提升 2 倍

引语

  • 吞吐优化在 GPT-OSS-20B 上实现相同请求延迟下每秒 token 数提升 2 倍
  • 端到端启动延迟从 525 秒降至 258 秒,减少 51%

为什么值得看:这些发布针对生成式 AI 推理在延迟、冷启动、GPU 容量和监控方面的独特挑战,为企业、初创公司和公共部门提供了更自动化和灵活的部署选择。

站内导航