英文原标题:How Condé Nast built multimodal video discovery with Amazon Bedrock

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • Condé Nast 的编辑团队此前缺乏多模态视频发现手段,每次内容发现任务平均耗时 250 分钟,需人工浏览超过 14 万条视频库,仅靠标题和描述查找相关片段。
  • Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建 AI 驱动的多模态视频发现方案,实现基于意图的语义搜索,覆盖视频转录、视觉元素和音频。
  • 团队选择 TwelveLabs Marengo 嵌入模型,因其能原生联合编码视觉、音频和转录信号,该模型支撑方案的全部五项能力,将发现时间从 250 分钟降至 2 分钟以内。
  • 方案采用解耦架构:异步摄取管道负责生成嵌入并使视频可搜索,同步服务层处理用户查询,两者可独立扩展、故障和演进,在初始 14 万视频回填期间至关重要。
  • 方案提供基于意图的搜索、多模态理解、基于图像的查询、错别字容忍与意图解析、时间戳精确等能力,并通过多可用区部署实现高可用性。

关键数据

  • 每次内容发现任务平均耗时 250 分钟
  • 视频库超过 140,000 条视频
  • 发现时间从 250 分钟降至 2 分钟以内
  • Amazon OpenSearch Service 跨三个可用区同步复制(两个活跃,一个待机)
  • Amazon DocumentDB 跨两个可用区部署主节点和待机副本

引语

  • “beginner yoga content with calming backgrounds”
  • “behind-the-scenes fashion week moments”

为什么值得看:该案例展示了如何利用 Amazon Bedrock 和专用嵌入模型解决大规模多模态视频检索难题,将内容发现效率提升两个数量级,为媒体行业提供了可复用的架构参考。

站内导航