arXiv 自然语言处理· Ang Li, Yue Lin, Feifei Kou, Zhan Su, Prayag Tiwari, Wenhao Li, Shuhui Zhu, Hongyuan Zha, Baoxiang Wang·· 5 小时前AI 评分45
提问、放宽还是行动?评估 LLM 偏好推理中的可操作不确定性
Ask, Relax, or Act? Evaluating Actionable Indeterminacy in LLM Preference Reasoning
AI 导读
研究人员形式化了偏好推理中的可操作不确定性,并构建基准评估 LLM 在物品分配、会议安排等场景中何时该执行动作、提问澄清或放宽约束。评测发现,LLM 普遍难以判断何时无需干预,常在已有合理解法时多余介入,且做出正确决策并不保证能生成可用的动作或修复方案。此外,显式明确回复要求可大幅提升模型输出的完全正确率。
来源:arXiv 自然语言处理 · arxiv.org