arXiv 自然语言处理· Jin Huang, Diego Ferreras Garrucho, Yutong Xie, Walter M. Yuan, Qiaozhu Mei, Chen Lian, Jonathon Hazell·· 4 小时前AI 评分39
HouseholdBench:评估大语言模型预测家庭经济行为的能力
HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior
AI 导读
HouseholdBench 评测基准整合 6 项美国家庭调查与 32 项预测任务,用于评测 13 款 LLM 预测家庭经济行为与政策调整的能力。多数 LLM 表现优于无变化基准,最佳模型将数值结果误差降低 12.2%,领先的闭源模型表现接近梯度提升树。研究还发现经微调并聚合 16 次预测后,4B 参数开源模型可匹敌闭源模型,相关数据集与代码均已公开。
来源:arXiv 自然语言处理 · arxiv.org