arXiv 机器学习· Huyu Wu, Weining Weng, Yuchen Liu, Yiqiang Chen, Yang Gu·· 2 天前AI 评分35
EEGAgentBench:短程与长程脑电分析的 LLM 智能体评测基准
EEGAgentBench: Benchmarking LLM Agents on Short- and Long-Horizon EEG Analysis
AI 导读
EEGAgentBench 是系统评测 LLM 智能体短程与长程脑电(EEG)分析能力的统一基准。该基准涵盖从知识问答到睡眠分期的 6 项代表性应用,跨越 2 秒至近 23 小时信号时长,并提供 10 种确定性分析工具供模型自主调用。对 15 个模型族的 29 款前沿 LLM 评测显示,现有智能体在长程 EEG 分析的持续证据积累与多步推理上仍存在显著局限。
来源:arXiv 机器学习 · arxiv.org