AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 68/10009月28日 12:00

生产环境Text-to-SQL流水线中LLM作为评判者的失效审计与修复

该研究针对生产级Text-to-SQL流水线中普遍采用但未经严格验证的“LLM-as-a-judge”(大模型充当裁判)机制展开审计。实验发现,部署的gpt-4o-mini评判器与人工标注一致性极低(Cohen's kappa仅0.04至0.42),误将77.1%忠实于意图的SQL过度判定为错误,主要归因于“评分幻觉”(GRADE-HALLUCINATION)。研究通过部署自建的Qwen模型替代,将一致性提升至0.72,媲美Claude顶配模型水平。

推荐理由直击当前应用工程中盲目迷信LLM裁判的痛点,揭示了严重的过度拦截问题并给出低成本替代方案,极具工程实操参考价值。

原标题:Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline

阅读 arXiv 自然语言处理 原文 ↗