LLM 裁判偏差研究:后训练使模型写作更可预测,但作为裁判的品味保持稳定
该研究探讨了“大模型作为裁判”(LLM-as-a-judge)在自动化评估中的偏见问题。研究人员追踪了 OLMo-2 和 Zephyr(均为 7B 参数)在公开后训练各阶段的表现,分别评估其作为故事创作者与裁判的行为。结果发现,尽管后训练确实使模型自身生成的文本更具可预测性,但当其扮演裁判时,其审美偏好并未相应倒向可预测的写作,表明自动化评估仍能有效识别创造力进展。
推荐理由深入探讨了大模型作为裁判的后训练偏差机制,为 LLM 自动化评测的可靠性提供了实证支持。
原标题:The Judge Is Not Its Twin: Post-training makes a model's writing more predictable but barely moves its taste, as a judge, toward predictable writing
阅读 arXiv 自然语言处理 原文 ↗