跳到正文
热点事件持续更新

研究人员提出多轮智能体在线蒸馏框架STI-OPD

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月9日,研究人员提出名为STI-OPD(面向智能体策略内知识蒸馏的随机教师干预)的新框架,以解决多轮智能体在策略内知识蒸馏(OPD)中早期错误累积的问题。该方法通过策略差异引导的随机教师干预,利用KL散度自适应平衡教师控制与学生探索,并引入重要性加权反向KL目标以校正采样失配。实验表明,在工具集成推理和长流程交互任务中,STI-OPD在所有评测基准和模型规模上均优于最强的OPD基线。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv 自然语言处理
    面向智能体策略内知识蒸馏的随机教师干预

    研究人员提出 STI-OPD 框架,通过策略差异引导的随机教师干预,解决多轮智能体在策略内知识蒸馏(OPD)中早期错误累积的问题。该方法利用 KL 散度自适应平衡教师控制与学生探索,并引入重要性加权反向 KL 目标校正采样失配。在工具集成推理和长流程交互任务中,STI-OPD 在所有评测基准和模型规模上均优于最强的 OPD 基线。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。