英文原标题:AI music maker Suno now generates spoken words

本文为英文原文的机器翻译摘要,原文见:The Verge AI ↗

Suno 推出新功能 Speech,可基于脚本或提示生成语音,并同时生成背景音乐,目前已在网页和移动端公开测试。

Suno 推出语音生成功能

Suno 从 AI 音乐领域拓展,推出新功能 Speech,可根据脚本或提示描述生成语音。该功能现已在 Suno 的网页和移动平台公开测试,允许同时生成配音和背景音乐。

  • Speech 功能支持同时生成语音和背景音乐,作为单一连贯音轨。
  • Suno 首席产品官 Jack Brody 表示,音乐始终是核心,但愿景已扩展至其他人类表达形式。

市场背景与竞争

AI 生成语音并非新事物,DeepMind 已研究深度学习语音合成十年,Adobe 有文本转语音工具,ElevenLabs 自 2023 年推出后成为知名平台。Suno 此举可能是为了多元化平台,因其音乐生成器已吸引许多诉讼。

  • Suno 进入文本转语音领域,面临已有竞争。
  • 音乐生成器引发的诉讼可能促使 Suno 寻求多元化。

功能特点与使用方式

该功能将 AI 音乐与生成语音配对,是 Suno 对文本转语音工具的独特诠释。背景音乐可选,通过开关关闭即可获得纯语音。该功能旨在补充生成式口语的某些用例,例如为诗歌配 calming 配乐,或为戏剧性配音和鼓励性演讲配 energetic 音乐。

  • 背景音乐可关闭,仅生成纯语音。
  • 适用于诗歌、戏剧配音、演讲等场景。

操作模式与限制

使用该功能需选择“Create”标签,导航至 Speech 选项。有两种模式:Simple 模式允许通过提示框描述想要创建的内容(如“一位海盗船长召集船员”);Advanced 模式允许添加自定义脚本。高级设置还可调整 AI 语音的性别、语音风格以及每次生成语音的多样性。Speech 最长时长约为八分钟。

  • Simple 模式:通过提示描述生成内容。
  • Advanced 模式:支持自定义脚本,可调整性别、风格和多样性。
  • 最大时长约八分钟。

当前局限与未来改进

Suno 承认该功能远非完美,但表示将根据用户反馈持续改进 Speech。Brody 表示,测试版就是测试版,偶尔英国口音会漂移到澳大利亚再回来,戏剧性停顿可能非常戏剧化,用户几乎肯定会发现我们从未想到的用途。

  • 功能尚不完美,将根据反馈改进。
  • 口音和停顿可能不稳定。
  • 用户可能发现意外用途。

站内导航