跳到正文
热点事件观察中

研究团队推出主动因果发现基准ACDB评估LLM表现

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

2026年9月29日,研究团队推出了基准ACDB,旨在评估大语言模型(LLM)智能体在预算约束干预下恢复因果图结构的能力。在包含六个级别的测试中,传统PC算法以42.7%的有向F1得分和4.79的SHD指标位列第一,表现优于主流大模型;其中Claude Sonnet 4.6得分分别为31.7%和7.25,GPT-5.4得分分别为22.9%和9.27。分析结果显示,LLM在测试中普遍存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现问题。

AI 根据报道生成 · 12 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月29日
  1. arXiv 机器学习
    ACDB 主动因果发现基准:评估预算干预下的 LLM 智能体

    研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。

本事件热度走势

当前热度 4·可比范围峰值 5(9月30日 12:00)·近 24 小时可比范围变化 –

02469月30日12:009月30日16:009月30日19:009月30日23:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。