arXiv 自然语言处理· Baowen Zhang, Wei Fan, Ruman Wang, Hangting Ye·· 5 小时前AI 评分36
理解大语言模型在不完美表格问答中的错误处理机制
Understanding Errors in LLM-Based Question Answering over Imperfect Tables
AI 导读
一项针对 3 个大语言模型在 RADAR-T 上的受控研究显示,表格行顺序会改变模型的错误发现效果,且仅提供错误位置并不足以实现准确问答。研究表明,直接提供人工修复后的表格相比仅标记错误,使代码辅助问答准确率提升 39.0-59.1 个百分点。据此提出的 GBDI 工作流结合打乱视图发现与显式处理指导,在 5 个系统上将问答准确率提升 3.8-18.5 个百分点。
来源:arXiv 自然语言处理 · arxiv.org