arXiv 人工智能· Noah L. Schroeder, Yessy Eka Ambarwati, Yuji Zhang, ChengXiang Zhai·· 2 天前AI 评分33
针对大语言模型初高中科学理解能力的评测基准
A Benchmark for LLM's Understanding of Middle School and High School Science Topics
AI 导读
研究人员构建了符合 NGSS 标准的大语言模型评测基准,并系统测试了 9 款开源权重模型在初高中科学领域的表现。评估结果显示,数款可本地部署的小型模型在各学科题型中均取得了高准确率,且模型规模与其性能表现并不完全一致。人工复核同时指出合成题目未完全贴合课程标准,凸显了教育场景下引入人机协同的必要性。
来源:arXiv 人工智能 · arxiv.org