arXiv 机器学习· Bohan Lin, Liyi Chen, Zhuoning Guo, Muyang Li, Qimeng Wang, Yan Gao, Yao Hu, Yudong Zhang·· 6 小时前AI 评分36
GraphOPD:面向 LLM 智能体的图增强同策略蒸馏
GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents
AI 导读
针对 LLM 智能体在多轮同策略蒸馏中的漂移与分歧偏差问题,研究者提出首个图结构增强方法 GraphOPD。该方法基于环境状态变化构建依赖图,通过随机游走平稳分布计算结构信用分,并与分歧信号融合以精准分配监督。在 ALFWorld、WebShop 和 SearchQA 基准测试中,GraphOPD 相比最强基线性能最高提升 +5.8 pp。
来源:arXiv 机器学习 · arxiv.org