跳到正文
原文
arXiv 自然语言处理· Sachin Gupta·· 11 小时前AI 评分37

VERITYGATE:用于结构化证据大语言模型叙述的四门模式级忠实度框架与评测基准

VERITYGATE: A Four-Gate Schema-Level Faithfulness Framework and Paired Benchmark for Grounded LLM Narrations over Structured Evidence

AI 导读

研究者提出模式级忠实度框架 VERITYGATE,通过四门检查机制检验大语言模型在结构化证据下的叙述生成。在 GPT-4o-mini、Llama-3.3-70B 和 Claude Sonnet 4.6 的测试中,修复前 mini 与 Sonnet 断言的验证器拒绝率分别为 80.3% 和 47.9%,单轮修复后存活率分别提升至 28.0% 与 54.3%。目前相关代码和数据均已公开发布。

来源:arXiv 自然语言处理 · arxiv.org