英文原标题:Build real-time voice applications with vLLM-Omni on SageMaker AI – Part 1

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 教程介绍如何在 Amazon SageMaker AI 上部署 Qwen3-TTS 文本转语音模型,实现边生成边播放的流式语音输出,适用于语音代理、互动学习、无障碍工具和客服助手等场景。
  • 使用 AWS vLLM-Omni Deep Learning Container(DLC),通过一条持久双向连接同时流式输入文本、输出音频,并借助 Gradio 应用体验完整流程。
  • vLLM-Omni 将 vLLM 从文本生成扩展到多模态,支持统一 omni 模型、ASR、TTS、音频生成、图像生成和视频生成,并提供流式输出与 OpenAI 兼容 API。
  • SageMaker 双向流基于 HTTP/2 上的全双工 WebSocket,客户端连接 8443 端口,由推理 sidecar 转发到容器内的 vLLM-Omni 原生 WebSocket 路由。
  • 端点配置使用 SageMaker 实例池,按优先级依次尝试 ml.g6.xlarge、ml.g6e.xlarge、ml.g5.xlarge、ml.g4dn.xlarge,但只实际配置一个实例。

关键数据

  • 客户端连接 SageMaker Runtime 端点的 8443 端口
  • 音频以 24 kHz PCM 分块返回
  • 使用 vLLM-Omni v1.5 DLC
  • 示例使用 v1/audio/speech/stream 原生 WebSocket 路由
  • 需要 Python 3.12 或更新版本
  • 需要 Boto3 1.40.0 或更新版本
  • 需要 SageMaker Runtime HTTP/2 Python 客户端 0.4.0
  • 示例默认区域为 us-east-1
  • Gradio 应用默认地址为 http://127.0.0.1:6006

引语

  • 在生成完整响应之前就开始播放语音
  • vLLM-Omni 项目将 vLLM 扩展到文本生成之外

为什么值得看:它给出了在 SageMaker AI 上用 vLLM-Omni DLC 部署 Qwen3-TTS、通过双向流实现低延迟流式语音输出的可复现步骤,补全了语音管道的输出侧。

站内导航