跳到正文
原文
arXiv 机器学习· Huyu Wu, Weining Weng, Yuchen Liu, Yiqiang Chen, Yang Gu·· 2 天前AI 评分35

EEGAgentBench:短程与长程脑电分析的 LLM 智能体评测基准

EEGAgentBench: Benchmarking LLM Agents on Short- and Long-Horizon EEG Analysis

AI 导读

EEGAgentBench 是系统评测 LLM 智能体短程与长程脑电(EEG)分析能力的统一基准。该基准涵盖从知识问答到睡眠分期的 6 项代表性应用,跨越 2 秒至近 23 小时信号时长,并提供 10 种确定性分析工具供模型自主调用。对 15 个模型族的 29 款前沿 LLM 评测显示,现有智能体在长程 EEG 分析的持续证据积累与多步推理上仍存在显著局限。

来源:arXiv 机器学习 · arxiv.org