AIDC
← 返回全部动态
arXiv 人工智能AI 评分 62/10009月28日 12:00

BAER:面向鲁棒成对大模型裁判的骨干自适应证据路由方法

成对大模型评估(LLM-as-a-Judge)可通过直接对比、推理或基于参考的验证来收集证据,但单一协议难以兼顾不同基准和骨干模型。该研究提出骨干自适应证据路由机制 BAER。BAER 在保留候选对称性的前提下自适应调整证据生成机制,将专家的带符号偏好与候选不变的可靠性分离,并构建了证据堆叠、基于可靠性的专家路由及候选盲参考等对称头,从而提升评测的一致性与鲁棒性。

推荐理由针对大模型成对评估中位置偏置与协议泛化性差的问题提出自适应路由方案,具有一定实用价值的评测方法学论文。

原标题:Backbone-Adaptive Evidence Routing for Robust Pairwise LLM Judging

阅读 arXiv 人工智能 原文 ↗

同一事件的其他来源

arXiv 机器学习09月28日 12:00

基于因果激活导向的大语言模型自适应多价值观控制框架 AIMES

在复杂应用场景中,大语言模型需同时兼顾多种可能相互冲突的社会规范与人类价值观。针对现有激活导向技术多针对单值且多方向直接组合采用固定干预强度、无法适应模型内部动态状态的局限,研究团队提出了 AIMES 框架。该方法通过因果激活导向技术,在推理阶段实现对多重价值观的轻量级自适应控制。注:输入论文摘要存在截断,具体实验增益与实现细节未完全展示。