跳到正文
原文
arXiv 人工智能· Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer, Thomas A. Runkler·· 7 小时前AI 评分35

基于本体与推理器验证的科学 AI 大语言模型推理评测基准

Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

AI 导读

研究人员提出一种基于 OWL 2 本体的多选题评测基准自动生成流水线,其正确答案源自本体,干扰项则通过 OWL 推理器形式化蕴含检查进行验证。该方法在 Pizza、PMDco 和 DOID 三个本体上分别生成了 112、2,491 及 15,216 道多选题,干扰项覆盖 4 个语义类别。6 款 LLM 在零样本评测中取得 41.1% 至 76.8% 的准确率,展现出评测基准的挑战性与区分度。

来源:arXiv 人工智能 · arxiv.org