arXiv 自然语言处理· Junnan Liu, Linhao Luo, Zhijun Chen, Qianren Mao, Thuy-Trang Vu, Gholamreza Haffari·· 7 小时前AI 评分33
面向智能体策略内知识蒸馏的随机教师干预
Stochastic Teacher Intervention for Agentic On-Policy Distillation
AI 导读
研究人员提出 STI-OPD 框架,通过策略差异引导的随机教师干预,解决多轮智能体在策略内知识蒸馏(OPD)中早期错误累积的问题。该方法利用 KL 散度自适应平衡教师控制与学生探索,并引入重要性加权反向 KL 目标校正采样失配。在工具集成推理和长流程交互任务中,STI-OPD 在所有评测基准和模型规模上均优于最强的 OPD 基线。
来源:arXiv 自然语言处理 · arxiv.org