跳到正文
原文
arXiv 机器学习· Jiacheng Qiu, Christopher E. Mower, Jan Peters, Haitham Bou-Ammar, Matthieu Zimmer·· 7 小时前AI 评分37

该动作仍能解释任务吗?扩散大语言模型智能体的反向评分机制

Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model Agents

AI 导读

针对扩散大语言模型(dLLM)智能体易反复执行失败动作的问题,研究团队提出免训练的反向评分方法 Reflect Reverse。该方法将重试循环建模为任务无关的概率失真,利用掩码 dLLM 原生评估逆向条件似然来消除偏差,每个候选动作仅需少量并行推理。在 4 个多轮具身基准测试中,该方法相比前向评分基线显著提升了任务成功率与推进率。

来源:arXiv 机器学习 · arxiv.org