arXiv 自然语言处理· Arman Nik Khah, Arvin Bahreini·· 2 天前AI 评分43
大语言模型后训练提升写作可预测性,但未改变其作为裁判的评判偏好
The Judge Is Not Its Twin: Post-training makes a model's writing more predictable but barely moves its taste, as a judge, toward predictable writing
AI 导读
研究发现大语言模型在后训练后写作更具可预测性,但作为裁判评估文本时对可预测内容的偏好几乎没有改变。对 OLMo-2 与 Zephyr(各 7B)在 SFT 和 DPO 阶段的测试显示,生成文本的惊奇度显著下降,但裁判偏向可预测文本的概率增幅不足 1 个百分点。此外,后训练加剧了模型对长文本和特定选项位置的偏好,并削弱了其评判创意的可靠性。
来源:arXiv 自然语言处理 · arxiv.org