/ EN

语音解码

23 条

语音解码旨在将大脑的语言信号直接转化为文字或合成语音,为失去说话能力的患者恢复沟通。本专题追踪皮层电极和非侵入方式在词汇解码、连续语句生成方面的最新突破。

2026 年 9 月

脑电转文字被曝高估:随机噪声也能骗过部分解码器

把脑电直接翻译成自由文本,一直被视为非侵入式脑机接口最有想象力的方向。但一项针对多个已发表解码器的测试发现,把真实脑电换成随机噪声后,部分模型仍能输出流畅句子,成绩与用真实脑电时相当,说明语言模型可能承担了大部分工作。该领域随后把噪声基线测试和无教师强制解码列为新的验证惯例,同时用脑磁图作对照,量化了脑电与更清晰信号之间的差距。

Paradromics脑机接口首例参与者实时说出自选语句

密歇根一名因运动神经元病几乎失去说话能力的女性,通过植入大脑表面的Connexus设备,用脑信号实时生成自己想说的话,并与家人通话。设备边缘的421根铂铱微丝记录单个神经元信号,软件把信号解码成文字和合成语音。这是FDA批准的Connect-One早期可行性研究的一部分,设备仍属研究性器械,公司计划随访6年观察安全性与耐久性。

大语言模型补全意图,P300拼写击键次数减少超过62%

这篇综述梳理了P300脑机接口从经典拼写器到AI代理的演进路径。P300是大脑看到罕见刺激后约300毫秒出现的正向电位,系统靠它判断用户想选哪个字符。综述指出,ChatBCI、MindChat等近期系统把P300拼写器与大语言模型结合,击键次数减少超过62%,通信速度提高到近三倍。作者还提出一套端到端架构:脑电头戴设备加实时CNN检测器,再加一层由大语言模型规划器和物联网控制接口组成的AI代理层。

阶梯医疗无线植入式汉语语音神经假体试验计划招募4人

上海阶梯医疗科技有限公司的无线植入式脑机接口系统进入人体评估阶段,面向言语障碍患者,试验编号NCT07647315,2026年9月1日实际开始,目前正在招募,计划入组4人。试验为前瞻性单臂设计,受试者接受手术植入并接受脑控训练,随访期预计12个月,期间记录不良事件、严重不良事件和器械缺陷,并收集脑控交互与沟通的有效性数据。主要终点预计2028年8月30日完成,整体预计2028年12月30日结束。登记记录没有公布植入部位、解码方式和纳入排除标准的细节,也没有阶段性结果,安全性与有效性结论要等随访数据。

P300拼写器并非组件越多越好,四组件全因子试验揭示反协同效应

P300脑机接口拼写器常被设计成把多个各自有效的组件全部打开,默认组件越多性能越好。一项预印本研究用四组件全因子试验检验了这个假设:组件的价值是有条件的,而不是可叠加的。受试者校准是最强的单一贡献者;欧几里得对齐能在零校准设置下弥补校准的缺失;把各自有用的组件叠加起来反而可能拉低性能,作者称之为组件反协同。语言模型的支持也并非普遍有益,其效果强烈依赖底层脑电流水线的强度。

不用开颅也能读语音:OPM-MEG解码准确率高出脑电3.6个百分点

10名母语为汉语的受试者朗读6个单元音韵母,同一套任务下同时记录光泵磁强计脑磁图与脑电。在刺激后150至500毫秒窗口内,OPM-MEG在全部5种分类器上的解码准确率都显著高于脑电。表现最好的组合是共空间模式(CSP)特征加线性支持向量机,OPM-MEG平均准确率60.3%,脑电56.7%。这意味着无需植入电极、也不限制头部活动的语音脑机接口,可能有一条比脑电更清晰的信号通路。

微调降到10分钟,PNPL竞赛让脑机语音适配进入临床可行范围

一项于2026年9月3日上传至arXiv的预印本公布了2026年PNPL竞赛的任务设定。该竞赛基于扩展的LibriBrain100数据集,包含32名新增被试,每人约40分钟数据,并新增约80小时的个体内数据。竞赛设2个赛道,Deep赛道关注个体内词分类,追求最佳性能;Broad赛道关注跨被试泛化,将个体微调数据从约40分钟逐步减少至20分钟、10分钟,接近临床可行范围。2025年竞赛的获胜者在语音检测和音素分类任务上分别达到95.6%和73.6%的F1分数。该预印本未经同行评审。

语音脑机接口缺少统一度量,新指标OVMI让不同系统可比

语音脑机接口(speech BCI)将神经活动转化为语言,有望帮助瘫痪患者恢复沟通。然而,由于不同系统使用不同的数据集、记录方法、语音类型和词汇表,其报告的准确率等指标难以直接比较。研究人员提出开放词汇互信息(OVMI),一种信息论度量,用于在统一尺度上评估不同系统的通信能力。研究表明,仅基于系统支持词汇计算的准确率等常规指标可能高估系统传达用户意图语音的能力。通过选择最大化OVMI的词汇,在3个语音领域中实现了最高16.3%的相对准确率提升。该研究以预印本形式发布于arXiv,尚未经过同行评审。

逐层对比学习挑出神经可见层,脑电图像检索准确率升至86.4%

一项预印本研究提出,通过逐层对比学习选择CLIP模型的中间层作为神经可见性最优层(NVOL),可改善脑电(EEG)信号与图像语义特征之间的跨模态对齐。在THINGS-EEG数据集上,基于NVOL的200-way图像检索平均Top-1准确率达78.1%,结合CSLS后升至86.4%。该框架还把检索与生成耦合,利用条件扩散先验重建受试者特异的NVOL特征,再映射至CLIP空间驱动Stable Diffusion XL生成图像,在语义与结构指标上优于单阶段末层扩散。该研究2026年9月2日上传至arXiv,尚未经同行评审。
2026 年 8 月

超100小时脑磁图数据开放:LibriBrain100加速非侵入式语音解码研究

一个名为LibriBrain100的大型脑磁图(MEG)数据集于2026年8月25日发布,包含超过100小时的高质量数据,其中约80小时来自单一受试者,创下同类数据集中个体内数据深度的新纪录。该数据集旨在为神经语音解码研究提供标准化评估基准,并附带开源工具和在线竞赛。研究团队利用现有解码模型在词分类基准上取得了最先进性能,验证了数据质量和大规模个体内数据的价值。此外,数据集还包含32名受试者每人约40分钟的额外数据,以补偿个体数据不足。

可解释脑机接口框架:结合情感识别提升意念转语音解码

一项新研究提出一种可解释的脑机接口(BCI)框架,将情感状态识别与脑电(EEG)信号解码相结合,用于实现情感感知的意念转语音(thought-to-speech)。该框架在公开的想象语音EEG数据集上进行了测试,采用受试者独立设置,评估了分类准确率、精确率、召回率、F1分数、推理速度和可解释性。结果显示,与传统不透明模型相比,该方法持续提升了解码可靠性,并提供了清晰、具有临床意义的见解。研究为瘫痪、肌萎缩侧索硬化症、闭锁综合征等影响自然言语的患者提供了辅助沟通工具的实际基础。

38名儿童设计自己的脑控沟通界面:他们想要动画、颜色和声音

一项针对38名8至12岁典型发育儿童的研究让他们使用P300脑机接口增强与替代沟通(P300-BCI-AAC)设计应用,创建自己偏好的图片界面,以了解儿童对这类沟通界面的设计偏好。研究发现,儿童普遍选择喜欢的颜色、动画效果(尤其是缩放动画)和声音提示;动画有助于视觉可达性和目标定位,背景颜色变化用于融入偏好色彩,视频GIF和图片覆盖层则增加个人相关性。这些发现强调了运动、颜色、个性化和视觉清晰度在儿童BCI-AAC界面中的初步重要性,为开发可定制、有吸引力的系统奠定了基础,也为未来纳入日常使用AAC的儿童及运动障碍人群的研究提供了方向。

深部脑刺激到脑机接口,综述梳理植入式神经技术的三个共同瓶颈

迷你综述指出,深部脑刺激系统、脑机接口和言语神经假体等脑植入物正从概念验证走向早期临床部署,尽管针对的临床问题不同,却共享传感、解码、刺激或输出、供电与遥测、慢性临床验证构成的闭环架构,转化速度由这些共享环节的瓶颈决定。近期里程碑包括一个皮层接口获监管批准、植入式BCI试验不断增多。综述对比了从开环走向闭环的深部脑刺激、恢复运动与感觉功能的脑机接口、以及把尝试言语解码为文本、语音和面部动画的言语神经假体三条线,并梳理柔性电极、AI辅助解码与神经形态边缘处理等进展,认为三类技术始终卡在长期稳定性、神经编码与公平可及三个共同瓶颈上,需要配套治理框架。该研究2026年8月19日发表于《Frontiers in Neuroscience》。

EEG引导目标说话人提取应对试验内注意切换,SAGE的SI-SDR达8.67dB切换延迟2.04秒

研究者称,EEG引导的目标说话人提取框架SAGE于2026年8月3日以预印本形式上传至arXiv,尚未经过同行评审。在试验内听觉注意切换场景下,神经噪声与固有延迟会延迟或干扰注意跟踪,传统方法难以应对动态切换,常在切换点造成不连续。SAGE把试验内切换当作动态选择处理,用稳健分离器生成两条候选语音流,并用EEG引导的切换感知门控模块产生平滑融合权重、抑制切换伪影。研究者称,SAGE还集成延迟补偿对齐与不确定性驱动的保守策略,优于基线方法,达到8.67dB SI-SDR与88.24% STOI,平均切换延迟降至2.04秒。
2026 年 7 月

Paradromics脑机接口植入患者大脑,获FDA批准开展临床试验

美国密歇根州的外科医生将Paradromics公司开发的脑机接口Connexus植入一名运动神经元疾病患者的大脑。该患者因疾病几乎丧失言语能力。Connexus通过植入运动皮层下1.5毫米处的421个微电极读取单个神经元信号,信号经患者胸部收发器传出,由AI转化为屏幕上的文字。Paradromics总部位于得克萨斯州奥斯汀,于2025年秋获得FDA批准开展该临床试验。

多用户解码模型:让言语脑机接口新用户微调不到200句

侵入式言语脑机接口能把尝试说话时的皮层活动解码成文字,现有最优系统的词错误率已低至1%,但代价是要先采集数千句训练数据,从植入设备到能顺畅沟通,中间要经过漫长的采集期。加州大学戴维斯分校团队提出一个基于Transformer的解码模型,跨6名侵入式言语脑机接口受试者联合训练。对每一名受试者,无论性别、病因或尝试发声策略如何,多用户模型的解码都优于仅用其个人数据训练的模型,相对词错误率平均降低超过50%。更关键的是,该模型在此前未参与训练的用户上,只用不到200句话微调,就实现了低于7%的词错误率。该预印本2026年7月27日上传至bioRxiv,尚未经过同行评审。

N400时间窗影响语义神经解码

芬兰Aalto University团队在一项MEG词语启动实验中,把经典N400诱发反应与语义向量解码放在同一框架下比较。25名芬兰语母语者阅读语义相关程度不同的词组后,不相关启动词引发更高的N400反应,并为语义解码器提供了最佳训练样本。研究者称,语义信息从刺激开始后约100至500毫秒均可解码,但在N400峰值过后,脑活动不再稳定映射到与语境无关的语义向量。这项结果提示,N400时间窗结束可能标志着神经表征由词语特异信息转向更广泛语境。该研究为bioRxiv预印本,尚未经过同行评审。

格勒诺布尔大学医院注册闭锁综合征患者慢性言语脑机接口研究

格勒诺布尔大学医院注册了一项临床研究(登记号NCT07698496),评估慢性脑机接口用于闭锁综合征(LIS)患者言语康复的可行性与有效性。研究背景指出,非侵入式沟通方法认知负荷高且效率低,而现有侵入式言语BCI仍依赖经皮连接器,存在感染风险;目前缺乏适合长期居家使用的全植入无线实时言语BCI。本研究采用颅内硬膜外植入式脑机接口结合语音合成器,SpeechBCI方案将在同一受试者中测试两种互补方案:言语BCI(主要目标,BCI_PAROLE装置)与光标BCI(次要目标),两者均使用WIMAGINE颅内硬膜外系统。该试验目前处于登记阶段,尚无临床结果。

脑磁图加深度学习解码听觉与视觉想象,视觉任务准确率超七成

研究团队让18名右利手参与者分别想象声音和画面,同时用脑磁图记录脑信号,再比较卷积神经网络与线性逻辑回归两种解码模型。卷积神经网络在两个任务上都高于随机水平,视觉想象的准确率超过70%。更值得注意的是,即使只用与当前任务无关的皮层区域训练,模型仍能显著解码,说明想象内容并非局限于单一感觉区,而是分布在有重叠的神经网络里。这为把听觉与视觉信息一起纳入脑机接口解码提供了实验依据。
2026 年 6 月

想象语音脑电分类最高准确率达98%,动态小波自动挑基

一项发表于《Computers in biology and medicine》的研究提出动态小波基选择增强方法,用于改善非侵入式EEG想象语音分类。该方法为每个EEG片段计算小波熵,选择信息量更高的小波基,再向相应小波系数注入高斯噪声,增强后的信号由带通道激励机制的卷积神经网络分类。研究数据包含32个通道、8种刺激和10名参与者。词语与元音组合实验的最高分类准确率达到98%,Cohen's kappa为0.95,但完整类别分类的表现较低。研究者称,该方法优于传统数据增强策略和静态小波方法,为处理EEG噪声与非平稳性提供了自适应路径。
2026 年 2 月

Layer 7阵列在4名术中患者中解码语言和光标方向,准确率最高84%

《Neurosurgical Focus》发表Precision Neuroscience的Layer 7皮层接口术中研究。4名清醒开颅患者接受1024通道微皮层脑电记录,4词语言分类准确率为77.5%,4方向光标分类准确率为78%至84%。6块阵列中每块有954至990个通道进入分析,手术过程中未报告器械相关不良事件。研究时间短、样本小,属于术中可行性验证,不是运动恢复关键性试验。
© 2026 BCIwiki.com 产业简报 主题索引 提交线索 订阅本站 修订记录 关于我们