Arctop发布了一篇论文配套文章,介绍其“基于脑反馈的强化学习(RLbF)”框架。该框架利用实时脑电测量,解码出工作负荷、压力等认知状态,作为奖励信号来训练大语言模型。文章称,这一方法能让模型在对话中感知听者的认知状态,并实时调整表达方式,从而改善沟通效果。目前,该框架已在其应用“Isaac”中部署,但仅使用单一维度(认知负荷)进行自适应。与传统RLHF依赖事后主观反馈不同,RLbF利用脑电信号提供连续、非自愿的反馈,使模型能实时感知话语对听者大脑的影响。这一方法首次将脑信号用于语言模型训练,但尚处于早期部署阶段,仅支持单一维度,且具体技术细节未完全公开。