跳到正文
热点事件观察中

研究提出基于位置选择性自蒸馏的LLM裁判训练方法

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月,相关研究提出一种基于位置选择性自蒸馏的方法,旨在利用自然语言反馈训练LLM裁判,以解决主观任务中的评估标准权重问题。该方法通过对比教师模型与学生模型间的位置熵偏移,屏蔽高熵偏移位置,以此提升模型的分布外泛化能力。实验结果表明,通过该方法训练的自蒸馏裁判在主观子类别评测中相较结果监督强化学习(RL)表现高出2至9个百分点,同时在客观任务评估中也保持了竞争力。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv 自然语言处理
    通过位置选择性自蒸馏从语言反馈中训练 LLM 裁判

    研究提出一种基于位置选择性自蒸馏的方法,利用自然语言反馈训练 LLM 裁判,以解决主观任务的评估标准权重问题。该方法根据教师与学生模型间的位置熵偏移屏蔽高熵偏移位置,从而提升分布外泛化能力。实验表明,所训练的自蒸馏裁判在主观子类别评测中相比结果监督 RL 高出 2-9 个百分点,且在客观任务上保持竞争力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。