热点事件观察中
研究团队推出主动因果发现基准ACDB评估LLM表现
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
2026年9月29日,研究团队推出了基准ACDB,旨在评估大语言模型(LLM)智能体在预算约束干预下恢复因果图结构的能力。在包含六个级别的测试中,传统PC算法以42.7%的有向F1得分和4.79的SHD指标位列第一,表现优于主流大模型;其中Claude Sonnet 4.6得分分别为31.7%和7.25,GPT-5.4得分分别为22.9%和9.27。分析结果显示,LLM在测试中普遍存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现问题。
AI 根据报道生成 · 12 小时前更新
最新进展9月29日 12:00
研究团队推出ACDB基准,测试显示PC算法表现优于Claude与GPT等大模型。报道时间线
沿着报道,了解事件的不同侧面。
9月29日
- arXiv 机器学习ACDB 主动因果发现基准:评估预算干预下的 LLM 智能体
研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。
本事件热度走势
当前热度 4·可比范围峰值 5(9月30日 12:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。