跳到正文
原文
arXiv 机器学习· Bohan Lin, Liyi Chen, Zhuoning Guo, Muyang Li, Qimeng Wang, Yan Gao, Yao Hu, Yudong Zhang·· 6 小时前AI 评分36

GraphOPD:面向 LLM 智能体的图增强同策略蒸馏

GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents

AI 导读

针对 LLM 智能体在多轮同策略蒸馏中的漂移与分歧偏差问题,研究者提出首个图结构增强方法 GraphOPD。该方法基于环境状态变化构建依赖图,通过随机游走平稳分布计算结构信用分,并与分歧信号融合以精准分配监督。在 ALFWorld、WebShop 和 SearchQA 基准测试中,GraphOPD 相比最强基线性能最高提升 +5.8 pp。

来源:arXiv 机器学习 · arxiv.org