英文原标题:Improving HCLS AI reasoning with open-source agent skills

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • 基于基础模型的AI代理在医疗与生命科学(HCLS)决策中常误用框架,例如在TP53错义变异分类时引用ACMG/AMP标准却错误应用证据类别、跳过人群频率阈值或编造计算预测分数,导致变异解读、理赔裁定、临床试验设计和影像分析出现隐性失败。
  • 为弥补方法论差距,作者开源了38个代理技能,覆盖11个HCLS领域,以结构化markdown文档(SKILL.md)编码领域决策流程,遵循Agent Skills开放标准,采用YAML frontmatter声明触发条件、依赖和元数据,全部以MIT-0许可证发布。
  • 技能分为推理技能和流水线技能:推理技能编码方法论和决策框架(如ACMG/AMP分类框架),流水线技能编码工具命令、验证参数和代码模板(如GATK4 HaplotypeCaller命令)。
  • 与RAG和微调不同,技能是结构化提示,根据查询触发模式上下文激活,具有可审计、可移植、易维护的特点,可在20多种服务上运行,无需为每个服务定制。
  • 评估显示,配备技能的代理在头对头比较中胜率为70–86%,批判性思维方面效果最强(胜率78–85%,d=0.65–1.03)。

关键数据

  • 38个开源代理技能,覆盖11个HCLS领域
  • 头对头比较胜率70–86%
  • 批判性思维胜率78–85%,效应量d=0.65–1.03
  • 单代理加载全部技能约消耗80K tokens,每个专家约15K tokens
  • 支持20多种服务,包括Amazon Bedrock AgentCore、AWS Strands Agents SDK、Kiro、Amazon Quick Desktop、Claude Code、OpenAI Codex等
  • MIT-0许可证

为什么值得看:该开源技能集为HCLS领域的AI代理提供了可审计、可移植的决策流程编码,显著提升了代理在关键任务中的推理准确性和批判性思维,有助于减少因误用框架而导致的监管和患者安全风险。

站内导航