arXiv 人工智能· Jiajun Wu, Jian Yang, Zixiang Ni, Zhenzhu Li, Bin Chong·· 7 小时前AI 评分38
CARAT:材料大语言模型是在推理还是在背诵?
CARAT: Do Materials LLMs Reason or Recite?
AI 导读
CARAT 框架通过 8 个匹配视图与 GraphSpace 结构表征,检验材料大语言模型是在推理还是单纯背诵输入。在基准最难族系中具身视图比化学式输入提升 17.3 分,GraphSpace 比普通周期图高出 19.3 分。测试发现冻结模型在 95.6% 的配对案例中仅复述关系而未实际利用,经匹配监督后准确率可达 99.8%。
来源:arXiv 人工智能 · arxiv.org