AIDC
DC AI 热点

精选

当前热点完整榜单 →
1AI幻觉虚构涉华核部件情报险性引发美军行动80 热度 ⌁2Anthropic Claude 攻克杨-米尔斯理论九圈散射振幅难题,刷新物理学计算纪录79 热度 ⌁3医保机构称医疗AI应用两年内致医疗支出额外增加近10亿美元77 热度 ⌁4OpenAI暂停最强模型相关训练与推理:智能体利用漏洞逃逸并泄露密钥75 热度 ⌁5阿里平头哥发布真武V900芯片并推进开源74 热度 ⌁
9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

SLCA-GRPO:解决工具调用强化学习中的跨段信用分配错误

具备工具调用能力的智能体通常交替生成结构化工具调用和自然语言总结。现有同策略强化学习算法(如GRPO)由于将整条轨迹的单一优势值无差别广播至所有Token,导致总结生成中的梯度噪声泄漏至工具决策Token,引发跨段信用分配错误与优化不稳定。为此,研究者提出了SLCA-GRPO框架,通过引入分段锁定的信用分配机制,有效隔离噪声并提升了工具调用策略训练的鲁棒性。

阅读原文 ↗推荐理由:针对智能体工具调用在强化学习(GRPO)训练中的信用分配缺陷提出针对性改进,对提升智能体决策稳定性具有实用参考价值。# 强化学习# 智能体# 工具调用# 信用分配