英文原标题:Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

本文介绍了如何使用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调搜索智能体,以在检索质量与可靠性上取得提升,并详细说明了环境搭建、数据集、奖励函数与训练配置。

搜索智能体与微调动机

基于 LLM 的搜索智能体可自主决定搜索内容、检索策略与停止时机,并在多轮交互中根据已获取信息调整方法。但让这种多步行为稳定工作并不容易:基础模型不了解你的工具与环境,小模型提示后多轮行为不可靠,前沿模型虽好但延迟与成本高。微调提供了第三条路径,让小模型直接学习你的工具与环境,兼顾速度、成本与可靠性。

  • 传统 SFT 依赖昂贵且通常不存在的专家多轮轨迹演示。
  • 单轮 RL(如 RLVR)逐次评分,忽略多轮决策间的依赖关系。
  • 多轮强化学习(MTRL)在完整轨迹上优化智能体,奖励只需反映最终结果好坏。

Amazon SageMaker AI MTRL 是什么

Amazon SageMaker AI MTRL 支持在多轮交互场景下用强化学习微调 LLM。它将智能体任务视为一系列决策,通过多轮 rollout 生成训练数据,并用策略梯度算法优化模型。

  • 模块化智能体-环境接口:低代码定义自定义奖励、工具循环与多轮对话形态。
  • 无服务器执行:按 token 计费,无需管理 GPU 集群。
  • 异步 rollout 与轨迹收集:生成与梯度更新并行,带边界离策略陈旧度。
  • 原生算法库:支持 PPO、CISPO、IS 损失,以及 GRPO、GRPO pass@k、RLOO 等组优势估计器。
  • 可恢复训练:长训练可拆分到多个作业。
  • 轨迹与奖励可观测性:通过 MLflow 逐轮检查智能体行为。
  • 评估作业:部署前报告奖励、pass@k 与轨迹指标。

环境与前置条件

该方案需要 AWS 账户并在美国西部(俄勒冈)区域使用 Amazon SageMaker AI,训练与验证数据集需按 MTRL 文档格式上传至 Amazon S3,并部署一个暴露 BM25 与向量搜索工具的智能体端点供 rollout 调用,同时需要熟悉 SageMaker AI 与 Python。

  • 区域:us-west-2。
  • 数据集:上传至 Amazon S3 并符合 MTRL 格式。
  • 端点:提供 BM25 与向量搜索工具。

方案概览

本文使用 SageMaker AI MTRL 微调 Qwen3.6-27B 模型作为搜索智能体,面向企业搜索场景。智能体可使用两种工具:BM25 词法搜索适合精确关键词或标识符查询,向量搜索适合语义或概念查询。同时限制最大轮数,防止生成过长响应并鼓励高效搜索行为。

  • 模型:Qwen3.6-27B(us-west-2 支持)。
  • 工具:BM25 词法搜索与向量搜索。
  • 限制轮数以控制响应长度与搜索效率。

训练配置:数据集与奖励函数

训练与测试数据集包括 FRAMES、BRIGHT、Enterprise RAG、ESCI、Musique、MLQA 用于训练,FreshStack、WixQA、BrowseComp-Plus、Wands 用于测试,均需按 MTRL 文档预处理,并预留每个数据集 5% 训练实例作为验证。主指标为 nDCG@10,直接作为轨迹级奖励函数,衡量最终检索文档与理想排名的匹配程度。当智能体达到最大轮数或单轮最大采样 token 时,奖励设为 -1,以显式教导模型避免这些失败模式。

  • 训练集:FRAMES、BRIGHT、Enterprise RAG、ESCI、Musique、MLQA。
  • 测试集:FreshStack、WixQA、BrowseComp-Plus、Wands。
  • 奖励:nDCG@10 轨迹级奖励;超轮数或超 token 惩罚 -1。
  • 验证:每个数据集预留 5% 训练实例。

站内导航