英文原标题:Building an AI-powered contract intelligence platform with Amazon Quick and Amazon Bedrock AgentCore

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 文章指出,传统RAG(检索增强生成)在单份合同问答上表现良好,但面对数百份合同的聚合问题(如总价值、即将到期合同)时,只能检索top-k片段,无法跨全量数据求和、计数或比较,导致答案错误。
  • 核心思路是结构化提取而非改进检索:用AI代理将合同关键字段抽取到数据库,再用分析工具进行聚合查询,同时保留知识库处理单文档问答。
  • 平台架构基于AWS:合同PDF存入Amazon S3触发流水线,提取代理(Claude Sonnet系列)读取PDF并抽取8个关键字段及置信度,验证代理(Claude Haiku)独立复核,签名检测分歧时由Amazon Textract作为确定性仲裁。
  • 验证结果存入Amazon Aurora PostgreSQL,用户通过WebSocket查看实时状态,并通过嵌入式仪表盘和自然语言聊天代理查询数据;典型情况下合同处理仅需数秒,无服务器架构支持并行扩展。
  • 代理使用Strands Agent SDK构建并部署在Amazon Bedrock AgentCore运行时,AgentCore提供无服务器托管、自动扩展和会话隔离;Policy功能可定义安全边界,保护定价条款等敏感数据。

关键数据

  • 示例场景:250份供应商合同,每份10–20页,总计最多5,000页非结构化数据。
  • 提取代理抽取8个关键字段,每个字段附带置信度分数。
  • 提取使用Claude Sonnet 4.6,验证使用Claude Haiku 4.5。
  • 典型条件下整个流水线可在数秒内处理一份合同。

引语

  • 答案来得又快又自信,却是错的。
  • 答案在于结构化提取,而非更好的检索。

为什么值得看:它揭示了RAG在跨文档聚合问题上的根本局限,并给出用AI代理提取加数据库聚合的可行架构,对构建合同智能平台有直接参考价值。

站内导航