英文原标题:Build a serverless PII redaction pipeline with Amazon Bedrock Data Automation

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 文章介绍如何用 Amazon Bedrock Data Automation(BDA)、AWS Step Functions 和 AWS Lambda 构建无服务器批量 PII 脱敏流水线,处理扫描文档和图像。
  • 传统 OCR 加模式匹配或自定义 ML 模型在文本退化、字段级业务逻辑表达和格式变化时存在局限,而生成式 AI 能整体理解页面布局、字段标签和上下文。
  • BDA 自定义蓝图允许用自然语言指令声明要提取的命名字段,返回字段内容、置信度和边界框坐标,用于后续黑框脱敏。
  • 设计蓝图需回答四个范围问题:什么是敏感信息、什么不是、在页面何处、如何移除;文中以 Attending Physician Statements 为例,需脱敏患者姓名、出生日期、住址和联系方式,但不脱敏医生信息、检查日期等。
  • 蓝图示例定义了 9 个字段组共 37 个字段,每个字段使用 inferenceType: "explicit" 和自然语言指令来限定检测范围;部署时以蓝图 ARN 作为输入参数,同一流水线可服务多个脱敏用例。

关键数据

  • 蓝图示例定义了 9 个字段组共 37 个字段
  • 每个字段使用 inferenceType: "explicit"
  • 流水线每次 API 调用发送一页文档给 BDA

为什么值得看:它展示了如何利用生成式 AI 文档理解能力,以无服务器架构和可定制蓝图实现大规模、高精度的 PII 脱敏,解决传统 OCR 方案在退化文本和字段级逻辑上的不足。

站内导航