arXiv 人工智能· Wenhui Chen·· 7 小时前AI 评分33
冲突监督改变模型倾向而非能力:12.29σ 数据编排效应在惯例无关评分下为零
Conflicting Supervision Moves Commitment, Not Capability: A 12.29{\sigma} arrangement effect that is exactly zero under a convention-agnostic score
AI 导读
最新研究表明,在冲突监督下训练模型时,数据排列顺序仅改变模型对特定惯例的倾向而非底层能力,且该效应由学习率调度与数据编排共同决定。实验显示 12 个分支的总准确率波动在 9.7% 以内,惯例分配比例在 0.04 到 0.87 间变化,测得的 12.29σ 排列效应在惯例无关指标下为零。在 prompt 中直接标注惯例可消除这种切换,并达到 87.5% 的联合能力上限。
来源:arXiv 人工智能 · arxiv.org