英文原标题:Optimizing agent system prompts with Amazon Bedrock AgentCore

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • Amazon Bedrock AgentCore 优化功能利用生产环境中的 agent traces 提出配置修改建议,并通过离线批量评估和在线 A/B 测试验证,最终推广优胜配置。
  • 系统提示优化器由 agentic reflector 驱动,它审查评估后的 agent 行为,识别成功与失败的模式,并输出改进后的系统提示及解释。
  • 由于 traces 通常很长,优化器通过文件系统让 reflector 访问完整 trace 语料,reflector 可使用 shell 工具(如 grep、cat、diff)按需检查。
  • Single Agent Reflector 在单次遍历中处理全部 traces,适合快速迭代;Sub-Agent Reflector 使用多个子 agent 独立分析单条 trace,质量上限更高但效率较低。
  • 优化过程设有基于规则的护栏:长度上限(增长超过 20% 则拒绝)、安全检查、禁止直接引用 traces 中的原文短语,以防止过拟合。

关键数据

  • Single Agent Reflector 在 AppWorld 上达到 81.55%,耗时 6 分钟、20 轮,比 GEPA 快 18 倍,比 MIPROv2 快 36 倍。
  • Single Agent Reflector 在 WebShop 上达到 78.31%,耗时 5 轮、1 分钟。
  • Sub-Agent Reflector 在 AppWorld 上达到 95.83%,比基线提升 23 个百分点。
  • 长度护栏:候选配置比前一版本增长超过 20% 即被拒绝。

为什么值得看:该文章详细介绍了 AgentCore 系统提示优化器的设计、护栏机制及在公开基准上的评估结果,为提升 agent 质量提供了可量化的自动化方案。

站内导航