跳到正文
原文
arXiv 自然语言处理· Hadeel Al-Negheimish, Jasna Ilieva, Yoon Kim·· 4 小时前AI 评分42

用 Prolog 探究大语言模型的长程演绎推理能力

Probing for Long-Horizon Deductive Reasoning Capabilities in Language Models with Prolog

AI 导读

一项新研究构建了合成基准 ProloNg,利用 Prolog 系统性探究前沿大语言模型的长程演绎推理能力。评测涵盖 5 个前沿 LLM 家族的 8 个推理模型,最难用例包含 22 层推理深度与 62k context length。实验表明模型性能随推理深度增加显著衰退,多数模型在推理深度超过 10 时表现已接近随机水平。

来源:arXiv 自然语言处理 · arxiv.org