跳到正文
原文
arXiv 机器学习· Sagar Deb, Devam Shah, Ashwanth Krishnan·· 1 天前AI 评分37

ACDB 主动因果发现基准:评估预算干预下的 LLM 智能体

Active Causal Discovery Benchmark: Evaluating LLM Agents Under Budgeted Interventions

AI 导读

研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。

来源:arXiv 机器学习 · arxiv.org