热点事件持续更新
研究人员提出基于本体与推理器验证的科学AI评测基准
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月2日,研究人员在arXiv发布研究,提出一种基于OWL 2本体的多选题评测基准自动生成流水线。该基准的正确答案直接源自本体,干扰项则通过OWL推理器的形式化蕴含检查进行验证,并覆盖4个语义类别。研究团队在Pizza、PMDco和DOID三个本体上分别生成了112道、2,491道及15,216道多选题。对6款大语言模型进行的零样本评测显示,各模型准确率在41.1%至76.8%之间,体现了该基准的挑战性与区分度。
AI 根据报道生成 · 3 小时前更新
最新进展10月2日 12:00
研究团队提出基于OWL 2本体与推理器验证的评测流水线,6款模型零样本准确率介于41.1%至76.8%。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv 人工智能基于本体与推理器验证的科学 AI 大语言模型推理评测基准
研究人员提出一种基于 OWL 2 本体的多选题评测基准自动生成流水线,其正确答案源自本体,干扰项则通过 OWL 推理器形式化蕴含检查进行验证。该方法在 Pizza、PMDco 和 DOID 三个本体上分别生成了 112、2,491 及 15,216 道多选题,干扰项覆盖 4 个语义类别。6 款 LLM 在零样本评测中取得 41.1% 至 76.8% 的准确率,展现出评测基准的挑战性与区分度。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。