英文原标题:Generate images and video with vLLM-Omni on SageMaker AI – Part 2

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 该文章介绍如何在 Amazon SageMaker AI 上使用 AWS vLLM-Omni Deep Learning Container (DLC) 部署两个端点:一个实时端点运行 FLUX.2-klein-4B 生成图像,一个异步端点运行 Wan2.1-VACE-1.3B 生成视频。
  • 工作流程为:先向图像端点发送文本提示生成静态图像,再将图像和运动提示传给视频端点,最终从 Amazon S3 获取生成的 MP4 文件,并提供可选的 Streamlit 界面。
  • 两个端点使用相同的固定 DLC 镜像,通过设置 SM_VLLM_MODEL 环境变量加载不同模型;图像端点路由到 /v1/images/generations,视频端点路由到 /v1/videos/sync。
  • 选择实时推理用于图像生成是因为应用需要直接响应来构造下一步请求;视频生成耗时较长且携带图像条件多部分负载,因此使用 SageMaker 异步推理,通过 Amazon S3 存储输入输出,客户端轮询结果位置。
  • 示例使用固定的 ml.g6.xlarge 和 ml.g6e.xlarge 实例类型,视频端点启用 VAE tiling 以降低视频解码时的峰值内存;对于较小的请求,InvokeEndpointAsync 也支持通过 Body 内联请求数据,上限为 128,000 字节。

关键数据

  • FLUX.2-klein-4B 图像生成模型
  • Wan2.1-VACE-1.3B 视频生成模型
  • DLC 版本 omni-sagemaker-cuda-v1.6
  • 视频请求参数:num_frames=17, num_inference_steps=30
  • 参考图像尺寸:480x320
  • InvokeEndpointAsync 内联 Body 上限 128,000 字节
  • 实例类型:ml.g6.xlarge 和 ml.g6e.xlarge
  • Python 3.11 或更高版本

引语

  • SM_VLLM_MODEL
  • /v1/images/generations
  • /v1/videos/sync

为什么值得看:本文展示了如何利用同一 vLLM-Omni DLC 在 SageMaker AI 上分别以实时和异步方式部署图像与视频生成模型,为多模态生成工作负载提供了可复用的部署模式。

站内导航