跳到正文
热点事件持续更新

学者提出大语言模型离线评估框架OTROPE

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

2026年9月30日,研究人员在 arXiv 发布论文,提出基于最优传输的大语言模型鲁棒离线策略评估方法 OTROPE。该方法能够在无需响应概率的前提下,利用有限的人工标注数据对黑盒目标大语言模型进行评估。具体而言,OTROPE 在语义空间通过最优传输对齐带标注的行为样本与未标注的目标样本,并结合校正残差与代理预测器实现双重鲁棒评估。实验结果表明,OTROPE 效果持续优于基线方法,并能使较弱评估器的集成效果逼近甚至超越更强评估器。

AI 根据报道生成 · 8 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv 人工智能
    OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

    研究人员提出基于最优传输的鲁棒离线策略评估方法 OTROPE,可在无需响应概率的情况下利用有限人工标注数据评估黑盒目标大语言模型。该方法在语义空间通过最优传输对齐带标注的行为样本与未标注的目标样本,并结合校正残差与代理预测器实现双重鲁棒评估。实验表明 OTROPE 持续优于基线,能使较弱评估器的集成效果逼近甚至超越更强评估器。

本事件热度走势

当前热度 8·可比范围峰值 9(9月30日 14:00)·近 24 小时可比范围变化 –

02.557.5109月30日14:009月30日16:009月30日19:009月30日21:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。