arXiv 人工智能· Tal Zeevi, Trey W. Jensen, Maxwell Strome·· 7 小时前AI 评分37
当科学矛盾在表述转换中丢失:大语言模型的科学冲突判定研究
When Scientific Contradictions Are Lost in Translation
AI 导读
一项研究评估了大语言模型在处理科学报告矛盾时的决策表现,发现直接提供形式约束时 GPT-5.6 Sol 与 Claude Opus 5 识别最佳支持解的准确率分别达 90% 和 96%。但在科学文本中 Claude Opus 5 更偏好生物学预期,消除该偏好后最优解找回率由 27% 提升至 79%,配合形式化请求更可达 92%(p<.001),而 GPT-5.6 Sol 对此类提示不敏感。
来源:arXiv 人工智能 · arxiv.org