新闻 · AWS Machine Learning Blog
uniopen 如何为生产部署定制 Amazon Nova 以适配其零售内容审核政策
了解台湾统一企业集团旗下零售平台 uniopen 如何通过 Amazon SageMaker AI 中的监督微调与提示优化,让 Amazon Nova 2 Lite 适配其内容审核政策。与业务相关的评估和发布门禁确保了质量。
新闻 · AWS Machine Learning Blog
了解台湾统一企业集团旗下零售平台 uniopen 如何通过 Amazon SageMaker AI 中的监督微调与提示优化,让 Amazon Nova 2 Lite 适配其内容审核政策。与业务相关的评估和发布门禁确保了质量。
英文原标题:How uniopen customized Amazon Nova to their retail moderation policies for production deployment
本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗
本文介绍了台湾统一企业集团旗下数字通信与会员平台 uniopen 如何通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并结合提示词层面的输出优化,使其满足零售内容审核策略的生产部署要求。
uniopen 是统一企业集团推出的数字通信与会员平台,覆盖网页、平板和移动端,连接电商、会员权益等零售体验。平台对每次交互按两个维度进行审核分类:行为类别(共九类)和主体类型(品牌、其他、禁止)。两个维度都必须正确,审核决策才有用,且这些分类是 uniopen 业务特有的,通用模型无法直接掌握。
架构将生产审核路径与纠错、训练、评估和部署分离。Amazon Nova 2 Lite 处理主要审核请求,Amazon Nova 2 Pro 支持候选纠错生成,但每条纠错必须经人工审核后才能进入训练集。Amazon S3 存储已验证的纠错集和训练数据,DynamoDB 跟踪活跃与候选模型配置,Argo Workflows on Amazon EKS 编排提示优化、评估和部署,Argo CD 将批准的配置应用到生产,SNS 和 CloudWatch 在硬门禁失败或候选需要关注时通知运维人员。
负责任 AI 控制与模型定制互补:模糊案例和复用为训练数据的纠错必须人工审核;固定测试集和回归检查防止质量下降时自动晋升;可使用 Amazon Bedrock Guardrails 对输入输出做内容过滤,按行为和主体类别监控错误,最小化保留客户数据,并随审核策略变化重新验证阈值。晋升由硬门禁和软门禁控制:硬门禁是必须通过的回归测试,失败则停止流程并告警;通过硬门禁后检查软门禁警告(如低置信度或特定类别性能下降),无警告可自动晋升,有警告则需管理员审核批准。
对话窗口是被视为一个训练或评估样本的客户对话片段。三种配置均在同一个包含 737 个对话窗口的留出测试集上评估,微调数据集包含 3,391 个训练窗口。评估指标包括 Per Behavior Macro F1(衡量九类行为分类的一致性,每类等权)和 Subject Type Macro F1(衡量主体类型识别的一致性,每类等权),两者共同反映策略检测和主体理解能力。
基线 Amazon Nova 2 Lite 的 Per Behavior Macro F1 为 0.5852,Subject Type Macro F1 为 0.4162,尚未学好 uniopen 的审核分类。团队随后在 Amazon SageMaker AI 中使用 LoRA 进行监督微调,Per Behavior Macro F1 提升至 0.8364,Subject Type Macro F1 提升至 0.8302,主体类型指标超过生产目标,行为分类接近目标。之后团队将输出从 JSON 改为基于行的格式并澄清多行为返回方式,无需额外训练,Per Behavior Macro F1 升至 0.8550,Subject Type Macro F1 升至 0.8491,两项均超过生产目标(0.8500 和 0.8200)。