跳到正文
原文
arXiv 自然语言处理· Linqi Zhang, Chong Qi, Yan Cheng, Wanqing Cao, Yu Liu, Chenwei Lin, Xian Xu·· 7 小时前AI 评分35

InsClaimBench:全决策链保险理赔裁决评测基准

InsClaimBench: Benchmarking Insurance Claim Adjudication Across the Decision Chain

AI 导读

研究团队推出 InsClaimBench 基准,用于端到端评测大语言模型在保险理赔全决策链上的裁决能力。该基准基于真实理赔材料与结构化规则,涵盖车险、财产险与健康险的 3,780 个案例及 86,656 个原子规则判断。评测 6 款大语言模型发现,赔付决策准确率为 74.23%–80.19%,但联合决策与金额准确率骤降至 47.54%–73.15%,可靠性沿决策链明显递减。

来源:arXiv 自然语言处理 · arxiv.org