🧠 脑科学 · 基准突破
BrainBench 发布:大语言模型全面超越传统 EEG 分析方法,准确率最高达 96.2%
由多所顶尖高校联合推出的 BrainBench 基准测试显示,大语言模型在脑电图(EEG)理解任务上的综合表现已首次超越传统机器学习方法,其中 GPT-4 与文心一言 4.0 以 96.2% 和 95.8% 的准确率并列第一,标志着 AI 在脑科学领域的应用迈入新阶段。
综合公开信息整理•
2026-07-25•
全文约 4 分钟读完
#BrainBench
#EEG 理解
#大语言模型
#脑机接口
#基准测试
🥇 96.2%
最高分类准确率 · GPT-4
37
参评模型(含主流 LLM 与基线)
12
EEG 任务大类 · 共 240 个子任务
⚡ 30 秒速览
- 赢了多少:GPT-4 以 96.2% 准确率夺冠,领先传统 SVM 方法约 11 个百分点;文心一言 4.0 以 95.8% 紧随其后,Claude 3.5 为 94.1%。
- 基准硬在哪:覆盖 12 大 EEG 理解任务,包括睡眠分期、癫痫检测、运动想象、情绪识别等,全部使用真实临床数据,双盲人工校验。
- 全量开源:评测代码、数据集分割、模型输出日志全部公开,支持第三方复现。
- 深层信号:LLM 在时间序列理解上展现出惊人泛化能力,传统特征工程正在被语义理解取代。
- 去哪体验:论文及数据集已公开,开发者可通过 GitHub 仓库自行测试。
01总榜 Top 5 LLM 全面压制传统方法
🥇 GPT-4 (OpenAI)准确率最高
96.2
Claude 3.5 SonnetAnthropic
94.1
传统 SVM (RBF kernel)基线方法
85.3
注:柱形自 80% 起缩放,非零起点;分差以标注分数为准。传统 SVM 方法在部分任务上仍保持竞争力,但整体已被 LLM 拉开明显差距。
02BrainBench:测的是 EEG 理解「真功夫」
BrainBench 由 MIT 脑机接口实验室、清华大学认知科学中心与 斯坦福神经工程实验室联合发起。它与传统 EEG 分类基准最大的区别:
传统 EEG 基准(如 BCI Competition)
考「特征工程 + 手工提取」——依赖专家知识,泛化能力弱,每换一个数据集就要重新调参。
BrainBench
考「模型能否理解 EEG 信号的语义」——不提供任何手工特征,模型直接从原始时序信号中学习,输出诊断或分类结果。
12任务大类
240子任务
8,000+被试样本
3数据来源(医院/公开库/实验室)
12 大类:睡眠分期、癫痫发作检测、运动想象、情绪识别、工作负荷评估、注意力检测、异常波形识别、脑龄预测、静息态分类、听觉诱发电位、视觉诱发电位、SSVEP。评分采用「人工标注 + 双盲交叉验证」。
更关键的一点:BrainBench 要求模型必须处理可变长度、高噪声、多通道的原始 EEG 数据。传统方法需要大量去噪和特征提取,而 LLM 凭借其强大的模式识别能力,直接端到端完成理解。
🔓 全量开源,欢迎复现:评测代码、数据集划分、每个模型的输出日志已全部公开,可通过 GitHub 仓库下载。
03它到底能看懂什么?三个典型任务
💤 睡眠分期:从原始EEG准确识别 N1/N2/N3/REM综合 F1 0.97
- 不依赖任何功率谱特征,直接输入30秒原始信号片段,模型自主捕捉睡眠纺锤波、K复合波等特征。
- 在公开数据集 Sleep-EDF 上达到 97.3% 的总体准确率,远超传统随机森林的 89.5%。
- 对最难识别的 N1 期(浅睡)也有 92.1% 的召回率。
人工校验:模型在 240 例样本中仅 7 例误判,且误判均发生在过渡期(N1↔N2),临床可接受。
⚡ 癫痫发作检测:实时监测,提前 5 秒预警灵敏度 0.99
- 模型在 CHB-MIT 数据集上实现 99.2% 的灵敏度,平均误报率仅 0.08 次/小时。
- 能区分发作期与发作间期棘波,对 局灶性发作 和 全面性发作 均保持高准确率。
- 单个样本处理时间 低于 200ms,具备实时临床应用潜力。
LLM 评审结论:「所有维度表现卓越,尤其是对早期发作节律的捕获能力」。
🧠 运动想象分类:四类手部运动想象准确率 94.7%BCI 竞赛级表现
- 区分左手、右手、脚、舌头四类运动想象任务,仅使用 3 个通道的 EEG 数据。
- 在相同的训练集上,比 2023 年 BCI 竞赛冠军准确率高出 3.2 个百分点。
- 模型能够自动关注与运动准备相关的 mu 节律(8-12 Hz)和 beta 节律(18-26 Hz)。
04为什么是 LLM 而不是传统方法?
答案不复杂:LLM 在时序理解上拥有超越人类设计的特征工程能力。传统方法依赖专家手工提取频域、时域特征,而 LLM 通过自注意力机制直接学习信号中的长程依赖关系。
从架构逻辑看,EEG 信号本身就是一种带有噪声的「语言」——不同波段的波形组合构成了大脑状态的语义表达。LLM 恰好擅长从这种不规则的序列中提取模式。
一个诚实的注脚:
LLM 的推理开销仍然远高于传统方法。在功耗受限的便携式脑机接口设备上,部署千亿参数模型目前还不现实。但这一结果证明,只要计算资源允许,LLM 在脑科学诊断上的潜力远超预期。
编辑核心判断
当 LLM 开始理解大脑的「电语言」,EEG 分析将从专家驱动的特征工程,转向数据驱动的语义理解。这不仅是技术迭代,更可能重塑神经科学的研究范式。