跳到正文
原文
arXiv 人工智能· Jiajun Wu, Jian Yang, Zixiang Ni, Zhenzhu Li, Bin Chong·· 7 小时前AI 评分38

CARAT:材料大语言模型是在推理还是在背诵?

CARAT: Do Materials LLMs Reason or Recite?

AI 导读

CARAT 框架通过 8 个匹配视图与 GraphSpace 结构表征,检验材料大语言模型是在推理还是单纯背诵输入。在基准最难族系中具身视图比化学式输入提升 17.3 分,GraphSpace 比普通周期图高出 19.3 分。测试发现冻结模型在 95.6% 的配对案例中仅复述关系而未实际利用,经匹配监督后准确率可达 99.8%。

来源:arXiv 人工智能 · arxiv.org