英文原标题:Right-size generative AI endpoints with concurrency sweeps on Amazon SageMaker AI

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 并发扫描(concurrency sweep)是一种系统性基准测试方法,向 Amazon SageMaker AI 端点发送逐步递增的并发流量,测量吞吐量与延迟,从而找到在满足延迟要求下性价比最优的实例类型与配置。
  • 该功能内置于 Amazon SageMaker AI Inference Recommendations,无需自建或维护负载测试基础设施;工作流包括部署模型、配置工作负载画像、运行扫描、分析结果四步。
  • 示例中部署 NVIDIA Nemotron-3 Nano 30B(MoE 模型,仅 3B 活跃参数)到 ml.g7e.2xlarge(NVIDIA Blackwell GPU),使用原生 vLLM 容器,并通过 SM_VLLM_* 环境变量配置,其中 SM_VLLM_ENFORCE_EAGER 因 Mamba-Transformer 混合架构而必需。
  • 工作负载画像设定平均输入 1,024 token、输出 256 token,代表 RAG 或摘要场景,并开启流式以捕获 TTFT 指标;扫描并发级别为 64、256、1,024,每级 1,024 个请求,由 AIPerf 引擎顺序执行以保证测量隔离与稳定。
  • 分析结果关注四项指标:输出吞吐量、p99 端到端延迟、p50 到 p99 延迟差距、TTFT;吞吐量-延迟曲线出现“拐点”即为饱和点,示例中为 256 并发请求,低于该点为安全运行区。

关键数据

  • 示例并发级别:64、256、1,024(4 的幂),每级请求数 1,024
  • 工作负载画像:平均输入 1,024 token,平均输出 256 token
  • 示例饱和拐点出现在 256 并发请求
  • 使用实例:ml.g7e.2xlarge,NVIDIA Blackwell GPU
  • 模型:NVIDIA Nemotron-3 Nano 30B,MoE 架构,3B 活跃参数
  • vLLM 镜像版本:0.19.1-gpu-py312-cu129-ubuntu22.04-sagemaker
  • GPU 内存利用率设为 0.85,最大模型长度 10,240

引语

  • Latency: how long each request takes.

为什么值得看:它提供了一套可自动化的方法,帮助团队在控制延迟的前提下为生成式 AI 端点找到性价比最优的实例与并发配置,避免 GPU 资源浪费或服务降级。

站内导航