大型脑电基础模型学到的神经表示好不好,取决于原始脑信号怎样被切成token。研究者称,现有方法的时间边界是随意划定的,与神经状态的转换对不上,还忽略了通道之间的空间信息,固定的切分标准也难以在不同脑电范式之间通用。团队提出的SEDAT把4个部件整合进一条计算高效的流程,分别是基于挤压激励的空间聚合、数据自适应高斯平均滤波的信号分解、瞬时频率引导的自适应切分,以及傅里叶域重采样。
评估覆盖运动想象、心理意象、P300、慢皮层电位、睡眠分期和癫痫范式的10个异构脑电数据集,使用LaBraM、EEGFormer、EEGPT和NeuroGPT这4个大模型,并与固定长度窗口、CTXSEG、LiPCoT、TFM-Tokenizer和SiS这5种方法比较。研究显示,SEDAT相比固定长度窗口的分类准确率最多提高15.3%,比其他方法中最好的一个高1.2%至4.6%,所有比较在校正后都达到统计显著。token质量分析显示特征可分性明显改善,轮廓系数为0.81至0.85,而刚性基线方法为0.33至0.48。作者称,SEDAT为大规模脑电基础模型提供了一种有生理依据、计算上可行的切分方案。