跳到正文
原文
arXiv 自然语言处理· Yue Zhao, Xiyang Hu, Zuobin Xiong, Zhangyu Wang, Ruolin Li·· 5 小时前AI 评分40

AI4Fire:评估大语言模型在野火任务中的表现

AI4Fire: Evaluating Large Language Models on Wildfire Tasks

AI 导读

AI4Fire 基准在 5 项野火任务上对 6 款核心大语言模型及扩展的 29 款模型进行了零样本评测,对比了裸模型与附加辅助依据(grounded)的性能表现。结果显示只读 SQL 工具将核心模型的数据库准确率从最高 16% 提升至至少 88%,但在人员配置预测等任务中模型均未能击败简单基线规则。相关提示词、模型响应、评分及代码已开源。

来源:arXiv 自然语言处理 · arxiv.org