arXiv 自然语言处理· Feiyu Duan, Jiayu Lin, Jia Wang, Jun Xiang, Jialiang Wu, Xinnong Zhang, Hanqi Yan, Siyuan Wang, Zhongyu Wei·· 5 小时前AI 评分44
通用决策模型:基准评测及超越 Jev 的洞察
General Decision Models: Benchmarking and Insights Beyond Jev
AI 导读
研究人员针对 Jev 等通用决策模型推出包含 11,257 个实例的 JEVal 双语基准,系统评估了 25 种模型配置的可靠性与局限。评测发现通用决策模型在长程交互中易累积误差降低成功率,社会模拟中虽显著降低推理成本但存在聚合偏差。研究团队还提出了 InnerJev-4B 与 InnerJev-27B,其中 InnerJev-27B 评测表现媲美 Jev 且典型查询仅需约 0.1 s。
来源:arXiv 自然语言处理 · arxiv.org