英文原标题:Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents

本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗

  • 文章指出,使用MCP的工具型LLM智能体可调用搜索、数据库等多种工具,将不同来源的证据混合成答案,导致传统事实性检查(如RAGAS、MiniCheck等)只关注证据池是否支持声明,而忽略声明是否归属于正确的来源。
  • 作者提出ProvenanceGuard,一种生成后验证层,可读取MCP轨迹并保留来源ID,依次进行声明分解、来源路由、支持性检查、归属比对,最终输出每个声明的来源判定和答案级允许/阻止决定。
  • 在医学智能体场景的281条真实轨迹上,人工专家标记了361条声明中的139条应被阻止,ProvenanceGuard成功拦截138条,仅漏放1条;同时将67条专家认为有支持的声明送审或修复,体现保守策略。
  • 与MiniCheck、RAGAS Faithfulness、AlignScore、SummaC-ZS等基线相比,ProvenanceGuard在阻止/拦截F1上得分最高(0.802),且是唯一能输出声明到来源ID映射的系统。
  • 在相似来源的困难测试中,ProvenanceGuard的阻止F1为0.846,但精确识别正确来源的比例仅50.3%;在50例来源替换测试中,它全部检出。被阻止的答案可通过RARR式修复循环处理,但多数以回退文本结束。

关键数据

  • 281条真实轨迹
  • 361条声明,139条应被阻止,ProvenanceGuard拦截138条
  • 67条专家认为有支持的声明被送审或修复
  • 可识别来源的声明中,约86%选对来源
  • 阻止/拦截F1:ProvenanceGuard 0.802,MiniCheck 0.783,RAGAS 0.758,AlignScore 0.662,SummaC-ZS 0.436
  • 相似来源测试:阻止F1 0.846,精确来源识别率50.3%
  • 50例来源替换全部检出
  • 全轨迹运行解决173条被阻止答案,其中144条为回退文本;重构多源测试中解决59条,仅2条回退

为什么值得看:该工作揭示了MCP智能体跨源混淆的风险,并提出可保留来源归属的验证方法,在数据敏感场景中,来源错误可能与事实错误同样有害。

站内导航