从脑活动重建视觉体验有望增强脑机接口,也有助于理解感知的基本机制。但研究者称,现有基于fMRI的深度学习图像合成方法大多是个人专属的,适配新个体需要大量数据,限制了可扩展性和转化潜力。MindShow的核心是一个分层条件混合专家编码器,把人群共享的潜在表示与个体特有的神经特征分离开,从而在有限校准数据下高效适配目标受试者。
这些表示随后经过门控Perceiver瓶颈处理,把fMRI特征自适应地映射成固定尺寸的图像和文本潜在token,以解决多尺度表示错位的问题。团队还引入多粒度最优传输损失,在样本和token两个层面把脑信号特征与预训练视觉语言模型的潜在空间对齐,再由一个冻结的扩散模型在这些对齐嵌入的引导下生成图像,力求保留所见内容的语义和大致布局。研究显示,MindShow提高了高层重建指标,同时保持了有竞争力的结构保真度,作者称这是迈向可扩展的多人共享神经解码的方法学一步。实现代码已在GitHub公开。