arXiv 机器学习· Gowthamkumar Nandakishore·· 4 小时前AI 评分35
CLM-as-a-Judge:开源对比决策模型在公开裁判基准上的评测
CLM-as-a-Judge: Evaluating an Open Contrastive Decision Model on Public Judge Benchmarks
AI 导读
开源对比决策模型 Contrastive-LM/CLM-v0.1-8B 在公开裁判基准上表现接近随机猜测,在 RM-Bench 和 JudgeBench 上等同抛硬币,显著落后于同参数量奖励模型。该模型虽具备仅 0.0002 的决策顺序翻转率与更低的长度偏好,但在置信度门控级联中仍有 0.923 至 1.000 的样本需升级转交至强裁判。
来源:arXiv 机器学习 · arxiv.org