
脑机百科消息(bciwiki.com),Arctop发布了一篇论文配套文章,介绍其“基于脑反馈的强化学习(RLbF)”框架,该框架利用实时脑电测量解码认知状态(如工作负荷和压力)作为奖励信号来训练大语言模型。文章于2026年8月23日发布在Arctop官网,作为其论文的通俗版解读,论文全文可在预印本平台获取。
文章指出,传统的人类反馈强化学习(RLHF)依赖于用户事后给出的稀疏、主观且缓慢的反馈,而RLbF利用脑电信号提供连续、非自愿的反馈,使模型能够实时感知其话语在听者大脑中引起的反应。该框架定义了五维认知状态,包括愉悦度、认知负荷、听觉专注、心流状态和压力,每个维度由Arctop自有的专有模型测量。
Arctop表示,该框架已在其应用“Isaac”中部署,目前仅使用认知负荷这一单一维度进行自适应。Isaac通过脑电设备实时监测用户的认知状态,并据此调整对话风格。文章还提出了三阶段微调路径,从监督微调过渡到强化学习,并讨论了奖励黑客等潜在风险。