arXiv 机器学习· Dong Shu, Yanguang Liu, Huopu Zhang, Saisai Hu, Haiyan Zhao, Hekun Huang, Mengnan Du·· 6 小时前AI 评分34
MM-FinEval:面向真实金融预测的多任务多模态评测基准
MM-FinEval: A Multi-Task Multimodal Benchmark for Real-World Financial Forecasting
AI 导读
研究团队推出多模态金融预测基准 MM-FinEval,用于评估多模态 LLM 在真实金融分析中的能力。数据集涵盖 2019 至 2022 年 2,045 场 S&P 500 财报电话会议,提供文本转录、演示幻灯片和完整音频三模态输入与 12 项任务输出。对 19 个基线模型的评测表明,处理三模态的小型 Any-to-Any 模型性能甚至超越仅支持双模态的大型闭源模型。
来源:arXiv 机器学习 · arxiv.org