英文原标题:Evaluate skill-equipped agents with Strands Evals and Amazon Bedrock AgentCore

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 通用智能体虽能处理广泛任务,但需遵循合规检查、文档处理、升级策略等业务程序,将这些编码进单一系统提示或应用逻辑难以维护。
  • 技能(Skill)是模块化替代方案,通常存储在 SKILL.md 文件中,遵循开放 Agent Skills 标准,可跨兼容框架移植,运行时仅加载所需技能。
  • 技能打包指令、工具绑定、知识、工作流和护栏,帮助团队快速专业化智能体、复用流程、保持行为一致,且无需微调模型或重写核心逻辑。
  • 技能组合引入两种通用指标易忽略的失败模式:调用不合适的技能,或调用正确技能但跳过/部分遵循指令,两者都可能产生流畅但未使用预定领域知识的响应。
  • Strands Evals SDK 和 Amazon Bedrock AgentCore Evaluations 新增技能评估器:Skill Selection Accuracy(二元结果)、Skill Instruction Following(五级评分)和 Strands Evals 特有的确定性 Skill Invoked 检查。

关键数据

  • Skill Selection Accuracy 对每个调用的技能返回二元结果。
  • Skill Instruction Following 对每个规定步骤返回基于证据的五级评分。
  • Skill Invoked 是确定性检查,不调用模型,仅适用于 Strands Evals。
  • 技能提取支持 Strands AgentSkills 插件、Claude Code、Claude Agent SDK、OpenAI Agents SDK、Codex、Gemini CLI、OpenHands、Google ADK 及通用 SKILL.md 文件读取。
  • 需要 Python 3.10 或更高版本。

为什么值得看:技能组合的两种失败模式无法仅通过最终响应检测,新评估器使技能选择和指令遵循可度量,帮助团队针对性修复路由或执行问题。

站内导航