英文原标题:Speaker-labeled transcription with WhisperX on SageMaker AI
本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗
- 通用语音转文本在说话人标注和精确时间戳上存在不足,影响合规审查、字幕和红action等场景。
- WhisperX 在 OpenAI Whisper 基础上增加了批量推理、wav2vec2 强制对齐(实现逐词时间戳)和说话人分离(标注谁说了什么)。
- AWS WhisperX Deep Learning Container (DLC) 是 GPU 就绪镜像,无需构建自定义镜像即可部署到 Amazon SageMaker AI 实时或异步端点。
- 实时端点适合短交互片段(需在 60 秒内完成),异步端点适合长音频和高吞吐批处理,支持自动缩放至零以节省成本。
- 部署时需固定 GPU AMI 版本(InferenceAmiVersion 设为 al2-ami-sagemaker-inference-gpu-3-1),否则端点会因 CannotStartContainerError 启动失败。
关键数据
- 容器在端口 8080 上服务,提供 POST /invocations 用于推理和 GET /ping 用于健康检查。
- 请求格式为 multipart/form-data,音频作为文件部分,可选字段包括 language、diarize 和 response_format。
- 输出格式支持 json、verbose_json、srt 和 vtt。
- 实时端点响应上限为 60 秒。
- 示例实例类型:ml.g4dn.xlarge(成本优先)和 ml.g5.2xlarge(性能优先)。
- WhisperX DLC 镜像 URI 示例:763104351884.dkr.ecr.<region>.amazonaws.com/whisperx:3.8.6-cu128-amzn2023-sagemaker。
- 异步推理需要 S3 桶名称包含“sagemaker”。
引语
- WhisperX closes both gaps.
- who said what
为什么值得看:WhisperX 解决了语音转文本中说话人标注和精确时间戳的痛点,结合 SageMaker AI 的托管部署,能高效支持合规、媒体和实时分析等生产工作负载。