热点事件持续更新
研究人员提出多轮智能体在线蒸馏框架STI-OPD
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月9日,研究人员提出名为STI-OPD(面向智能体策略内知识蒸馏的随机教师干预)的新框架,以解决多轮智能体在策略内知识蒸馏(OPD)中早期错误累积的问题。该方法通过策略差异引导的随机教师干预,利用KL散度自适应平衡教师控制与学生探索,并引入重要性加权反向KL目标以校正采样失配。实验表明,在工具集成推理和长流程交互任务中,STI-OPD在所有评测基准和模型规模上均优于最强的OPD基线。
AI 根据报道生成 · 3 小时前更新
最新进展10月9日 12:00
研究人员提出STI-OPD框架,通过随机教师干预解决多轮智能体策略内蒸馏中的早期错误累积。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv 自然语言处理面向智能体策略内知识蒸馏的随机教师干预
研究人员提出 STI-OPD 框架,通过策略差异引导的随机教师干预,解决多轮智能体在策略内知识蒸馏(OPD)中早期错误累积的问题。该方法利用 KL 散度自适应平衡教师控制与学生探索,并引入重要性加权反向 KL 目标校正采样失配。在工具集成推理和长流程交互任务中,STI-OPD 在所有评测基准和模型规模上均优于最强的 OPD 基线。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。