arXiv 自然语言处理· Wenyu Huang, Xinyu Hou, Pavlos Vougiouklis, Ruofei Lai, Jeff Z. Pan·· 7 小时前AI 评分41
超越结果奖励:为搜索智能体构建与分配检索信用
Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents
AI 导读
该研究针对大语言模型搜索智能体在强化学习中依赖稀疏结果监督导致信用分配困难的问题,系统探讨了利用中间检索步骤提供监督信号的奖励塑形与信用分配策略。研究所构建的训练框架将中间检索信号与最终结果奖励相结合,在多个基准测试中显著提升了搜索智能体的综合性能。
来源:arXiv 自然语言处理 · arxiv.org