跳到正文
原文
arXiv 自然语言处理· Junnan Liu, Linhao Luo, Zhijun Chen, Qianren Mao, Thuy-Trang Vu, Gholamreza Haffari·· 7 小时前AI 评分33

面向智能体策略内知识蒸馏的随机教师干预

Stochastic Teacher Intervention for Agentic On-Policy Distillation

AI 导读

研究人员提出 STI-OPD 框架,通过策略差异引导的随机教师干预,解决多轮智能体在策略内知识蒸馏(OPD)中早期错误累积的问题。该方法利用 KL 散度自适应平衡教师控制与学生探索,并引入重要性加权反向 KL 目标校正采样失配。在工具集成推理和长流程交互任务中,STI-OPD 在所有评测基准和模型规模上均优于最强的 OPD 基线。

来源:arXiv 自然语言处理 · arxiv.org