AWS 机器学习· Huibin Shen·· 5 小时前AI 评分51
在 Amazon SageMaker AI 上利用多轮强化学习微调搜索智能体实践
Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI
AI 导读
AWS 团队介绍了利用 Amazon SageMaker AI 多轮强化学习(MTRL)微调搜索智能体的方法,并以 Qwen3.6-27B 进行了实测验证。该方案采用 nDCG@10 设定轨迹级奖励并将超限失败惩罚设为 -1,在仅调整 3 个超参数的默认配置下完成训练。
来源:AWS 机器学习 · aws.amazon.com