跳到正文
原文
arXiv 自然语言处理· Chen Shen·· 10 小时前AI 评分41

BudgetSchemaBench:针对 Text-to-SQL 模式上下文预算的评测基准

BudgetSchemaBench: A Budget-Swept Diagnostic for Schema Context in Text-to-SQL

AI 导读

研究团队推出基准 BudgetSchemaBench,用于评估 Text-to-SQL 智能体在不同模式上下文预算下的执行表现。基于 80 个数据库测试,预算从 2.5% 提至 50% 时,词法检索在 1,279 道题上的执行准确率提升 18 个百分点,密集检索仅提升 3 个百分点。测试显示准确率对模式预算比对序列化格式更敏感,该基准与代码已公开。

来源:arXiv 自然语言处理 · arxiv.org