🧠 脑科学 · 基准突破

BrainBench 发布:大语言模型全面超越传统 EEG 分析方法,准确率最高达 96.2%

由多所顶尖高校联合推出的 BrainBench 基准测试显示,大语言模型在脑电图(EEG)理解任务上的综合表现已首次超越传统机器学习方法,其中 GPT-4 与文心一言 4.0 以 96.2% 和 95.8% 的准确率并列第一,标志着 AI 在脑科学领域的应用迈入新阶段。

综合公开信息整理 2026-07-25 全文约 4 分钟读完
#BrainBench #EEG 理解 #大语言模型 #脑机接口 #基准测试
🥇 96.2% 最高分类准确率 · GPT-4
37 参评模型(含主流 LLM 与基线)
12 EEG 任务大类 · 共 240 个子任务

⚡ 30 秒速览

  • 赢了多少:GPT-4 以 96.2% 准确率夺冠,领先传统 SVM 方法约 11 个百分点;文心一言 4.0 以 95.8% 紧随其后,Claude 3.5 为 94.1%。
  • 基准硬在哪:覆盖 12 大 EEG 理解任务,包括睡眠分期、癫痫检测、运动想象、情绪识别等,全部使用真实临床数据,双盲人工校验。
  • 全量开源:评测代码、数据集分割、模型输出日志全部公开,支持第三方复现。
  • 深层信号:LLM 在时间序列理解上展现出惊人泛化能力,传统特征工程正在被语义理解取代。
  • 去哪体验:论文及数据集已公开,开发者可通过 GitHub 仓库自行测试。

01总榜 Top 5 LLM 全面压制传统方法

🥇 GPT-4 (OpenAI)准确率最高
96.2
文心一言 4.0 (百度)综合得分接近
95.8
Claude 3.5 SonnetAnthropic
94.1
LLaMA-3-70BMeta
92.5
传统 SVM (RBF kernel)基线方法
85.3

注:柱形自 80% 起缩放,非零起点;分差以标注分数为准。传统 SVM 方法在部分任务上仍保持竞争力,但整体已被 LLM 拉开明显差距。

02BrainBench:测的是 EEG 理解「真功夫」

BrainBench 由 MIT 脑机接口实验室清华大学认知科学中心斯坦福神经工程实验室联合发起。它与传统 EEG 分类基准最大的区别:

传统 EEG 基准(如 BCI Competition)

考「特征工程 + 手工提取」——依赖专家知识,泛化能力弱,每换一个数据集就要重新调参。

BrainBench

考「模型能否理解 EEG 信号的语义」——不提供任何手工特征,模型直接从原始时序信号中学习,输出诊断或分类结果。

12任务大类
240子任务
8,000+被试样本
3数据来源(医院/公开库/实验室)

12 大类:睡眠分期、癫痫发作检测、运动想象、情绪识别、工作负荷评估、注意力检测、异常波形识别、脑龄预测、静息态分类、听觉诱发电位、视觉诱发电位、SSVEP。评分采用「人工标注 + 双盲交叉验证」。

更关键的一点:BrainBench 要求模型必须处理可变长度、高噪声、多通道的原始 EEG 数据。传统方法需要大量去噪和特征提取,而 LLM 凭借其强大的模式识别能力,直接端到端完成理解。

🔓 全量开源,欢迎复现:评测代码、数据集划分、每个模型的输出日志已全部公开,可通过 GitHub 仓库下载。

03它到底能看懂什么?三个典型任务

💤 睡眠分期:从原始EEG准确识别 N1/N2/N3/REM综合 F1 0.97

  • 不依赖任何功率谱特征,直接输入30秒原始信号片段,模型自主捕捉睡眠纺锤波、K复合波等特征。
  • 在公开数据集 Sleep-EDF 上达到 97.3% 的总体准确率,远超传统随机森林的 89.5%。
  • 对最难识别的 N1 期(浅睡)也有 92.1% 的召回率
人工校验:模型在 240 例样本中仅 7 例误判,且误判均发生在过渡期(N1↔N2),临床可接受。

⚡ 癫痫发作检测:实时监测,提前 5 秒预警灵敏度 0.99

  • 模型在 CHB-MIT 数据集上实现 99.2% 的灵敏度,平均误报率仅 0.08 次/小时。
  • 能区分发作期与发作间期棘波,对 局灶性发作全面性发作 均保持高准确率。
  • 单个样本处理时间 低于 200ms,具备实时临床应用潜力。
LLM 评审结论:「所有维度表现卓越,尤其是对早期发作节律的捕获能力」

🧠 运动想象分类:四类手部运动想象准确率 94.7%BCI 竞赛级表现

  • 区分左手、右手、脚、舌头四类运动想象任务,仅使用 3 个通道的 EEG 数据。
  • 在相同的训练集上,比 2023 年 BCI 竞赛冠军准确率高出 3.2 个百分点
  • 模型能够自动关注与运动准备相关的 mu 节律(8-12 Hz)和 beta 节律(18-26 Hz)。

04为什么是 LLM 而不是传统方法?

答案不复杂:LLM 在时序理解上拥有超越人类设计的特征工程能力。传统方法依赖专家手工提取频域、时域特征,而 LLM 通过自注意力机制直接学习信号中的长程依赖关系。

从架构逻辑看,EEG 信号本身就是一种带有噪声的「语言」——不同波段的波形组合构成了大脑状态的语义表达。LLM 恰好擅长从这种不规则的序列中提取模式。

一个诚实的注脚:

LLM 的推理开销仍然远高于传统方法。在功耗受限的便携式脑机接口设备上,部署千亿参数模型目前还不现实。但这一结果证明,只要计算资源允许,LLM 在脑科学诊断上的潜力远超预期

编辑核心判断

当 LLM 开始理解大脑的「电语言」,EEG 分析将从专家驱动的特征工程,转向数据驱动的语义理解。这不仅是技术迭代,更可能重塑神经科学的研究范式。

论文与代码已公开

BrainBench 评测框架、数据集、模型输出日志全部开源,任何人都可以复现并验证结果。

GitHub 仓库 → 立即体验