新闻 · AWS Machine Learning Blog
在 Amazon SageMaker AI 上通过多轮强化学习微调搜索智能体
微调可让小规模搜索智能体学会使用你的工具与环境,以更低的延迟和成本获得前沿模型般的可靠性。本文在 Amazon SageMaker AI 上通过多轮强化学习(MTRL)微调一个由 LLM 驱动的搜索智能体,并分享我们在检索质量和可靠性方面测得的提升。
新闻 · AWS Machine Learning Blog
微调可让小规模搜索智能体学会使用你的工具与环境,以更低的延迟和成本获得前沿模型般的可靠性。本文在 Amazon SageMaker AI 上通过多轮强化学习(MTRL)微调一个由 LLM 驱动的搜索智能体,并分享我们在检索质量和可靠性方面测得的提升。
英文原标题:Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI
本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗
本文介绍了如何使用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调搜索智能体,以在检索质量与可靠性上取得提升,并详细说明了环境搭建、数据集、奖励函数与训练配置。
基于 LLM 的搜索智能体可自主决定搜索内容、检索策略与停止时机,并在多轮交互中根据已获取信息调整方法。但让这种多步行为稳定工作并不容易:基础模型不了解你的工具与环境,小模型提示后多轮行为不可靠,前沿模型虽好但延迟与成本高。微调提供了第三条路径,让小模型直接学习你的工具与环境,兼顾速度、成本与可靠性。
Amazon SageMaker AI MTRL 支持在多轮交互场景下用强化学习微调 LLM。它将智能体任务视为一系列决策,通过多轮 rollout 生成训练数据,并用策略梯度算法优化模型。
该方案需要 AWS 账户并在美国西部(俄勒冈)区域使用 Amazon SageMaker AI,训练与验证数据集需按 MTRL 文档格式上传至 Amazon S3,并部署一个暴露 BM25 与向量搜索工具的智能体端点供 rollout 调用,同时需要熟悉 SageMaker AI 与 Python。
本文使用 SageMaker AI MTRL 微调 Qwen3.6-27B 模型作为搜索智能体,面向企业搜索场景。智能体可使用两种工具:BM25 词法搜索适合精确关键词或标识符查询,向量搜索适合语义或概念查询。同时限制最大轮数,防止生成过长响应并鼓励高效搜索行为。
训练与测试数据集包括 FRAMES、BRIGHT、Enterprise RAG、ESCI、Musique、MLQA 用于训练,FreshStack、WixQA、BrowseComp-Plus、Wands 用于测试,均需按 MTRL 文档预处理,并预留每个数据集 5% 训练实例作为验证。主指标为 nDCG@10,直接作为轨迹级奖励函数,衡量最终检索文档与理想排名的匹配程度。当智能体达到最大轮数或单轮最大采样 token 时,奖励设为 -1,以显式教导模型避免这些失败模式。