论文基本信息

Paper: CBraMod: A Criss-Cross Brain Foundation Model for EEG Decoding
Institution: Zhejiang University
Publication: International Conference on Learning Representations
Year: 2025
Code: Open Source Code

在这里插入图片描述

1 摘要

论文针对现有EEG基础模型普遍采用全局统一建模而忽略脑电时空异质性、跨数据集泛化能力受限的核心问题,提出CBraMod——一种基于十字交叉建模策略的新型EEG基础模型。其核心思想是针对EEG信号的独特结构,分别并行建模空间与时间维度的依赖关系。模型首先通过固定时间窗口将EEG切分为patch,采用时频双分支网络提取局部特征;随后设计非对称条件位置编码(ACPE)动态生成位置信息,适配不同通道配置与时长的EEG数据;最终以十字交叉Transformer为骨干,通过并行的空间注意力与时间注意力分别捕获通道间关联与时序依赖,基于掩码重建任务完成自监督预训练。CBraMod在目前最大的公开EEG语料库TUEG上完成预训练,在10类下游BCI任务、12个公开数据集上全面达到SOTA性能,验证了定制化架构的EEG基础模型具备极强的通用解码能力与泛化性。

2 背景

脑电(EEG)作为非侵入式脑信号采集技术,凭借高时间分辨率、低成本、可便携的优势,是脑机接口(BCI)与临床神经疾病诊疗的核心工具,广泛应用于情绪识别、运动想象分类、睡眠分期、癫痫检测、精神障碍诊断等场景。

传统EEG解码方法多为任务专属的监督学习模型,高度依赖人工设计特征,且受限于标注数据稀缺、跨被试/跨设备差异大的瓶颈,泛化能力普遍较弱。随着自监督学习与基础模型在CV、NLP领域的成功,EEG基础模型逐渐成为研究热点,通过大规模无标注数据预训练学习通用表征,再微调适配下游任务。但现有方案(如BIOT、LaBraM)仍存在两大核心缺陷:

  1. 全局建模忽略时空异质性:直接套用ViT的全注意力范式,将所有EEG patch拉平后统一建模依赖关系,如图1(b)所示,忽略了EEG信号中空间(通道间)与时间(序列间)依赖的异构特性,建模效率低且表征能力受限。
  2. 绝对位置编码泛化受限:基于电极编号的绝对位置编码默认通道与电极位置固定绑定,无法适配不同数据集的通道数量、电极布局与参考电极方案差异,限制了模型的跨数据集迁移能力。

在这里插入图片描述

图1 不同脑电建模EEG patch的策略

3 贡献

提出了一种十字交叉的EEG建模策略,以充分利用EEG信号的结构特征,基于该策略,提出了一个EEG基础模型,该模型可以并行地建模空间和时间依赖关系,如图1©所示。同时,提出了非对称条件位置编码(ACPE)作为一种更灵活的位置编码方法,ACPE使用卷积网络来动态学习块之间的空间关系,使模型能够从各种通道格式中捕获相对位置信息。具体贡献如下:

  1. 十字交叉EEG建模策略与骨干网络
    提出十字交叉EEG建模范式,设计并行的空间注意力与时间注意力机制,分别捕获同时间步的通道间空间依赖与同通道的时序依赖,精准适配EEG信号的时空异质结构,相比全局全注意力建模效率更高、表征能力更强。
  2. 非对称条件位置编码(ACPE)
    提出基于非对称卷积的动态位置编码方案,长卷积核编码长程空间依赖,短卷积核编码短程时间依赖,可自适应不同通道数、不同时长的EEG输入,显著提升模型跨配置的泛化能力。
  3. 大规模预训练与全场景验证
    基于TUEG大规模EEG语料完成自监督预训练,首次在10类差异显著的下游BCI任务上完成全面验证,所有任务均达到SOTA性能,为EEG基础模型的架构设计与性能评估建立了新基准。

4 方法

4.1 数据集

4.1.1 预训练数据集

采用目前规模最大的公开临床EEG语料库Temple University Hospital EEG Corpus(TUEG)作为预训练数据,经清洗过滤后用于模型自监督预训练,详细信息如下:

表1 预训练数据集详细信息
数据集 通道数量 采样率(Hz) 总时长(h) 数据集描述
TUEG 19(清洗后统一) 200(重采样后) >9000 天普大学医院临床脑电数据库,包含
69652份临床记录、14987名受试者,
原始总时长27062小时,经去噪、
去坏样后保留1109545个30秒样本

4.1.2 下游数据集

选取10类典型BCI任务、共12个公开数据集验证模型的通用解码能力,覆盖多分类、二分类、回归多种任务范式,具体信息如下:

表2 下游数据集详细信息
任务类型 数据集 采样率 (Hz) 通道数 持续时间 样本数 类别数
I. 情绪识别 FACED 250Hz 32 10s 10332 9类
I. 情绪识别 SEED-V 1000Hz 62 1s 117744 5类
II. 运动想象分类 PhysioNet-MI 160Hz 64 4s 9837 4类
II. 运动想象分类 SHU-MI 250Hz 32 4s 11988 2类
III. 睡眠分期 ISRUC 200Hz 6 30s 89240 5类
IV. 癫痫检测 CHB-MIT 256Hz 16 10s 326993 2类
V. 想象语音分类 BCIC2020-3 256Hz 64 3s 6000 5类
VI. 精神障碍诊断 Mumtaz2016 256Hz 19 5s 7143 2类
VII. 警觉度估计 SEED-VIG 200Hz 17 8s 20355 回归任务
VIII. 精神压力检测 MentalArithmetic 500Hz 20 5s 1707 2类
IX. 事件类型分类 TUEV 250Hz 16 5s 112491 6类
X. 异常检测 TUAB 250Hz 16 10s 409455 2类

4.2 预处理

为统一数据格式、去除噪声伪迹,对预训练数据执行标准化预处理流程:

  1. 时长筛选:剔除总时长小于5分钟的记录,丢弃每条记录首尾各1分钟的不稳定数据;
  2. 通道统一:选取19个符合10-20国际电极系统的通用通道,对齐空间配置;
  3. 滤波去噪:0.3Hz-75Hz带通滤波保留有效频段,60Hz陷波去除工频干扰;
  4. 重采样:所有信号统一重采样至200Hz,降低计算开销;
  5. 样本切分:切分为30秒非重叠样本,与下游任务常用窗口兼容;
  6. 坏样剔除:移除任意采样点幅值超过100μV的坏样本;
  7. 幅值归一化:以100μV为单位归一化,将信号幅值约束在[-1,1]区间。

4.3 模型架构

CBraMod整体采用掩码自编码器(MAE)的自监督预训练框架,核心由分块掩码模块、时频双分支Patch编码器、非对称条件位置编码、多层十字交叉Transformer、重建头五部分组成,整体架构如图2所示。

在这里插入图片描述

图2 CBraMod预训练整体架构概览

首先,使用固定的时间窗口将EEG样本分割成patch,并使用掩码token随机掩码部分patch。接下来,将每个EEG patch输入到一个编码网络中,以获得相应的块嵌入。通过非对称条件位置编码(ACPE)获得时空位置嵌入,并将其添加到块嵌入中。然后,将块嵌入输入到具有十字交叉注意力机制的十字交叉Transformer中,学习EEG表征。最后,通过一个重建头从学习到的表征中重建被掩码的EEG patch。

4.3.1 EEG分块与掩码策略

设输入EEG样本为 S ∈ R C × T S \in \mathbb{R}^{C×T} SRC×T,其中 C C C为通道数, T T T为时间点数。以固定时间窗口 t t t(默认1秒,对应200个采样点)沿时间维度切分,得到patch张量 X ∈ R C × n × t X \in \mathbb{R}^{C ×n ×t} XRC×n×t,其中 n = ⌊ T t ⌋ n=\lfloor\frac{T}{t}\rfloor n=tT为每个通道的patch数量。

按50%比例随机生成掩码矩阵,将被掩码的patch替换为全零掩码token:

x ~ i , j = { x i , j , m i , j = 0 x M , m i , j = 1 \tilde {x}_{i,j}= \begin{cases} x_{i,j},& m_{i,j}=0\\ x_{M},& m_{i,j}=1 \end{cases} x~i,j={xi,j,xM,mi,j=0mi,j=1

X ‾ = { x ~ i , j ∣ i ∈ [ 1 , 2 , . . . , C ] , j ∈ [ 1 , 2 , . . . , n ] } \overline{X}=\left\{\tilde{x}_{i, j} \mid i\in[1,2,...,C], j\in[1,2,...,n]\right\} X={x~i,ji[1,2,...,C],j[1,2,...,n]}

4.3.2 时频双分支Patch编码

每个patch分别通过时域、频域两个独立分支提取特征,再逐元素相加融合,兼顾波形时序特征与节律频域特征:

  1. 时域分支:3层1D卷积+组归一化+GELU激活,提取时域局部波形特征 e i , j t e_{i, j}^{t} ei,jt
  2. 频域分支:通过快速傅里叶变换(FFT)提取各频段能量,经全连接层映射到同维度,从而得到频域特征 e i , j f e_{i, j}^{f} ei,jf

最终的patch嵌入为两个分支输出之和:

e i , j = e i , j t + e i , j f e_{i, j}=e_{i, j}^{t}+e_{i, j}^{f} ei,j=ei,jt+ei,jf

E = { e i , j ∣ i ∈ [ 1 , 2 , . . . , C ] , j ∈ [ 1 , 2 , . . . , n ] } E=\{ e_{i,j}\mid i\in [1,2,...,C],j\in [1,2,...,n]\} E={ei,ji[1,2,...,C],j[1,2,...,n]}

4.3.3 非对称条件位置编码(ACPE)

针对EEG信号「空间维度依赖范围广、时间维度依赖范围短」的特性,设计非对称深度可分离卷积作为位置编码器,空间维度采用大卷积核捕获长程关联,时间维度采用小卷积核捕获短程依赖,根据每个patch的时空邻域动态生成位置编码 e i , j p e_{i,j}^{p} ei,jp

将位置编码 E p E^{p} Ep与patch嵌入 E E E逐元素相加,得到注入位置信息的最终嵌入 E o E^{o} Eo

E o = E + E p = { e i , j + e i , j p ∣ i ∈ [ 1 , 2 , . . . , C ] , j ∈ [ 1 , 2 , . . . , n ] } E^{o}=E+E^{p}=\{ e_{i,j}+e_{i,j}^{p}\mid i\in [1,2,...,C],j\in [1,2,...,n]\} Eo=E+Ep={ei,j+ei,jpi[1,2,...,C],j[1,2,...,n]}

相比传统方案:

  1. 对比绝对位置编码(APE):ACPE不依赖固定电极编号,可自适应不同通道数与时长,泛化性更强;
  2. 对比对称条件位置编码(CPE):非对称设计更贴合EEG的时空依赖差异特性。

4.3.4 十字交叉Transformer骨干

Transformer块采用Pre-Norm结构,核心为并行的空间注意力(S-Attention)与时间注意力(T-Attention),整体结构如图3所示。

在这里插入图片描述

图3 十字交叉Transformer块与注意力机制结构

将多头注意力的8个头均分为两部分:前4个头执行空间注意力,后4个头执行时间注意力。

  1. 空间注意力:在同一时间步内,计算所有通道patch间的注意力,捕获通道间空间关联;
  2. 时间注意力:在同一通道内,计算所有时间步patch间的注意力,捕捉时序依赖。

第k个头的空间注意力计算如下(时间注意力形式一致):

F k j = Attention ( E ~ j W k Q , E ~ j W k K , E ~ j W k V ) F_{k}^{j}=\text{Attention}\left(\tilde{E}^{j} W_{k}^{Q}, \tilde{E}^{j} W_{k}^{K}, \tilde{E}^{j} W_{k}^{V}\right) Fkj=Attention(E~jWkQ,E~jWkK,E~jWkV)

S-Attention k ( E ~ ) = [ F k 1 , F k 2 , . . . , F k n ] \text{S-Attention}_{k}(\tilde{E})=\left[F_{k}^{1}, F_{k}^{2}, ..., F_{k}^{n}\right] S-Attentionk(E~)=[Fk1,Fk2,...,Fkn]

最终将所有头的输出拼接得到十字交叉注意力结果:

Criss-Cross-Attention ( E ~ ) = Concat ( head 1 , head 2 , . . . , head K ) \text{Criss-Cross-Attention}(\tilde{E})=\text{Concat}(\text{head}_1, \text{head}_2, ..., \text{head}_\text{K}) Criss-Cross-Attention(E~)=Concat(head1,head2,...,headK)

head k = { S-Attention k ( E ~ ) , k ∈ [ 1 , 2 , . . . , K / 2 ] T-Attention k ( E ~ ) , k ∈ [ K / 2 + 1 , K / 2 + 2 , . . . , K ] \text{head}_{\text{k}}= \begin{cases} \text{S-Attention}_{k}(\tilde{E}), & k \in[1,2, ..., K / 2] \\ \text{T-Attention}_{k}(\tilde{E}), & k \in[K / 2+1, K / 2+2, ..., K] \end{cases} headk={S-Attentionk(E~),T-Attentionk(E~),k[1,2,...,K/2]k[K/2+1,K/2+2,...,K]

4.3.5 掩码重建预训练目标

采用掩码EEG重建作为自监督预训练任务,仅计算被掩码位置的均方误差损失,降低计算开销并强制模型学习通用表征:

L = ∥ X ^ M − X M ∥ 2 \mathcal{L}=\left\| \hat{X}^{M}-X^{M}\right\| ^{2} L= X^MXM 2

其中 X ^ M \hat{X}^{M} X^M为重建头预测的掩码patch, X M X^{M} XM为原始真实掩码patch。

4.4 训练与评估

  1. 硬件环境:4 张NVIDIA RTX A5000 GPU,基于Python 3.11.7+PyTorch 2.1.2+CUDA 12.1实现;
  2. 模型配置:12层十字交叉Transformer,隐藏维度200,前馈网络维度800,8头注意力(4空间+4时间);
  3. 预训练设置:掩码率50%,batch size 128,训练40轮,AdamW优化器,初始学习率5e-4,权重衰减5e-2,余弦退火学习率调度;
  4. 下游微调设置:替换重建头为任务专属MLP头,训练50轮,batch size 64,学习率1e-4,多分类任务采用0.1标签平滑;
  5. 评估指标:二分类采用平衡准确率、AUC-PR、AUROC;多分类采用平衡准确率、Cohen’s Kappa、加权F1;回归采用皮尔逊相关系数、R2分数、RMSE;报告5次随机种子实验的均值与标准差。

5 结果

5.1 下游任务整体性能

CBraMod在所有10类下游任务上均达到SOTA性能,代表性任务的核心结果如下。

5.1.1 情绪识别任务

在FACED(9分类)和SEED-V(5分类)两个情绪数据集上全面超越所有基线,相比次优模型LaBraM-Base提升显著。

表3 情绪识别任务性能对比

在这里插入图片描述

5.1.2 运动想象分类任务

在PhysioNet-MI(4分类)和SHU-MI(2分类)数据集上均为最优,其中PhysioNet-MI的Cohen’s Kappa相比LaBraM-Base提升6.3%。

表4 运动想象分类任务性能对比

在这里插入图片描述

5.1.3 其他核心任务

  1. 睡眠分期:ISRUC数据集Cohen’s Kappa达0.7442,参数量仅4.0M,优于5.8M的LaBraM-Base;
  2. 癫痫检测:CHB-MIT数据集AUROC达0.8892,显著超越所有基线;
  3. 精神障碍诊断:Mumtaz2016数据集 AUROC达0.9921,接近完美分类效果。

整体来看,CBraMod以4.0M的参数量,在绝大多数任务上超越了参数量更大的LaBraM-Base与BIOT,实现了性能与效率的双重优势。

5.2 注意力机制消融实验

为验证十字交叉注意力的有效性,对比全注意力、轴向注意力、CCNet十字交叉注意力、本文方法四种方案,结果如图4所示。

在这里插入图片描述

图4 不同注意力机制的性能对比
  1. 全注意力效果最差,因序列过长且忽略时空异质性,建模效率低下;
  2. 轴向注意力(串行时空建模)优于全注意力,但弱于并行的十字交叉注意力;
  3. 专为图像设计的CCNet十字交叉注意力仅略优于全注意力,远低于本文方法,验证了针对EEG定制注意力机制的必要性。

5.3 位置编码消融实验

对比无位置编码、绝对位置编码(APE)、对称条件位置编码(CPE)、非对称条件位置编码(ACPE)四种方案,结果如图5所示。

在这里插入图片描述

图5 不同位置编码方案的性能对比
  1. 无位置编码性能最差,验证位置信息对EEG时空建模的必要性;
  2. APE性能优于无位置编码,但弱于动态编码方案,验证固定位置编码泛化能力受限;
  3. ACPE优于对称CPE,验证非对称设计更贴合EEG的时空依赖差异特性。

5.4 预训练有效性消融

对比无预训练、脏数据预训练、干净数据预训练三种设置,结果如下:

表5 预训练有效性消融结果

在这里插入图片描述

  1. 干净数据预训练效果最优,相比无预训练有显著性能提升,且结果方差更小、更稳定;
  2. 脏数据预训练仅略优于无预训练,验证了低质量数据会削弱预训练的增益,数据清洗对大规模EEG预训练至关重要。

5.5 其他关键消融结论

  1. 缩放定律:预训练数据量与模型参量增大均带来性能提升,数据量超过1000小时后增速放缓;
  2. 时频融合:时频双分支优于单一时域/频域,其中时域信息贡献更大,频域对事件分类、情绪识别、睡眠分期任务增益更显著;
  3. 头部分配比:空间头与时间头1:1分配时效果最优,偏向任一维度都会导致性能下降;
  4. 掩码率分析:0.5为最优掩码比例,兼顾预训练难度与表征学习质量;
  5. 低资源场景:仅用30%标注数据微调,CBraMod仍显著优于同设置下的BIOT与LaBraM,低资源下优势更明显。

6 讨论

6.1 局限性

  1. 预训练数据仍有局限:TUEG原始数据脏数据占比高,清洗后数据量大幅缩减,缺乏更多元化的跨场景、跨人群 EEG 数据;
  2. 仍需下游微调:目前模型无法作为固定特征提取器直接零样本迁移,全量微调仍有一定计算开销;
  3. 缩放探索不充分:受计算资源限制,仅探索了百万级参量与九千小时数据的缩放规律,未验证十亿级参量与更大规模数据的上限。

6.2 未来工作

  1. 构建更高质量大规模EEG语料:收集更多元场景的EEG数据,探索更智能的自动化数据清洗方法,进一步扩大预训练数据规模;
  2. 轻量化落地优化:通过知识蒸馏、模型剪枝等技术压缩模型体积,探索端侧设备部署的可行性;
  3. 深化缩放定律研究:扩大模型与数据规模,系统探索EEG基础模型的缩放规律与性能上限;
  4. 跨模态融合探索:引入文本、语音等多模态信息,探索跨模态对齐的通用脑信号大模型。

7 总结

CBraMod是EEG基础模型领域针对信号结构定制架构的代表性工作,其核心突破在于跳出了直接套用ViT范式的思路,从EEG信号时空异质的本质特性出发,设计了十字交叉注意力机制与非对称条件位置编码,通过大规模自监督预训练实现了全场景EEG解码性能的全面提升。

该工作验证了「面向信号特性定制化架构」是EEG基础模型性能突破的关键路径,为后续脑电基础模型的架构设计、预训练范式与评估体系建立了重要参考,也为通用脑机接口系统的落地提供了更强的技术支撑。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐