研究指出,现有视觉解码流程大多直接将EEG特征与预训练视觉模型的语义特征对齐,但EEG信号携带多层次信息,这种做法忽视了不同视觉成分在神经信号中可见性的差异,导致跨模态不匹配。该框架通过逐层对比学习选出最大化检索性能的CLIP中间层作为NVOL,并在此基础上构建了检索与生成耦合的分层框架,其中检索分支融合多个NVOL特征,经对比学习与图像嵌入对齐,测试时应用CSLS缓解hubness问题;生成分支则利用条件扩散先验从EEG重建受试者特异的NVOL特征,再经轻量适配器映射至CLIP空间,驱动预训练的Stable Diffusion XL模型生成图像。实验显示,两阶段NVOL到语义的重建在语义与结构指标上均优于单阶段最终层扩散方法。
该研究由Minyi Wang、Zhenqin Wu、Rihui Li完成。