BrainJanus: 跨脑、视觉与语言的理解与生成的统一模型
建模外部感觉刺激与内部神经活动之间的双向对应关系已成为神经科学的前沿热点。然而,现有方法将脑编码与脑解码视为孤立任务,过度依赖单模态对齐和外部先验,忽略了大脑作为多模态整合系统的内在本质。 为此,本文提出 BrainJanus,首个将脑、视觉与语言整合至同一框架的统一脑模型。具体而言,我们引入 Unified Brain Tokenizer,将连续的神经动力学量化为离散 token,并与视觉和语言表征在共享的 Omni space 中对齐。在此基础上,采用 All-in-One 自回归架构,通过 next-token prediction 实现无缝的任意到任意生成,包括图像到脑与文本到脑的编码,以及脑到图像与脑到文本的解码。 大量实验表明,BrainJanus 在多个基准测试中均取得优异性能。此外,该框架具备零样本泛化能力,并保留了可解释的生物拓扑结构,凸显其作为通用脑建模范式的潜力。代码开源于 https://github.com/HaitaoWuTJU/BrainJanus。
论文精读
TL;DR BrainJanus 首次将脑、视觉、语言统一为全自回归模型,通过共享 Omni 空间的离散 token 实现双向脑编解码,具备零样本泛化与生物拓扑保持能力。
问题
问题背景
神经科学正试图系统建模外部刺激(图像、语言)与内部神经活动(fMRI 等脑信号)间的双向映射,这既是理解大脑多模态信息处理机制的关键,也是构建下一代脑机接口的基础。
现有方法局限
当前主流方案将脑编码(刺激→脑活动)与脑解码(脑活动→刺激)拆分为独立任务,技术局限具体表现为:
- 单模态依赖:编码与解码各自绑定单一模态(如图像到脑的映射),难以利用语言等语义概念的跨模态统计信息,忽视大脑本身的多感官整合特性。
- 强外部先验:大量依赖预训练视觉或语言模型提供特征空间,却未将脑信号直接纳入统一表征学习,导致跨任务泛化能力弱。
- 表征割裂:连续神经动态未经离散化、多模态对齐就单独处理,无法共享全模态表示空间,限制"任意到任意"生成的灵活性。
技术挑战与重要性
- 连续→离散的量化鸿沟:fMRI 等信号具有高维时间动态性,将其无损转换为可与其他离散 tokens 对齐的序列表示,须兼顾信息压缩与神经解码精度。
- 共享 Omni 空间的学习:脑、视觉、语言三种异构模态需投影到统一表征空间,要求模型不仅捕捉模态特定模式,更要发现跨模态语义对应,训练难度极高。
- 零样本泛化与生物可解释性:模型不仅需在已见刺激上表现优异,还应在全新概念组合上具备生成能力,同时保留与脑皮层拓扑对应的表征结构,这是走向通用脑建模的硬指标。 业界高度关注此类统一框架,因其可直接推动:高保真神经解码(从想象中重建画面)、闭环脑机交互、以及借鉴脑多模态融合机制的 AI 架构设计。
行业类比
这类似多模态大模型(如 GPT-4V)将文本与图像统一到同一 next-token prediction 框架,BrainJanus 则把脑信号加进这个"全模态赌桌",用同一套自回归引擎生成全局一致的脑-视觉-语言表示。
核心洞察
- **脑信号离散化为与视觉和语言共享的token,实现跨模态统一建模**:BrainJanus 通过 Unified Brain Tokenizer 将连续神经活动量化为离散 tokens,并与视觉、语言表示在共享的 Omni space 中对齐,这打破了现有方法将脑编码与解码作为孤立任务、依赖单模态对齐和外部先验的范式。该设计让脑活动直接成为多模态序列的一部分,端到端地通过自回归预测完成双向映射,为脑信号交互提供了一种类似“脑语言”的统一接口。
- **All-in-One 自回归架构将脑编码与脑解码统一为 next-token prediction**:不同于传统编码器-解码器分离的做法,BrainJanus 将图像→脑、文本→脑的编码和脑→图像、脑→文本的解码全部转化为一个自回归 Transformer 中的序列生成问题,支持 any-to-any 生成。这种任务统一带来了零样本泛化能力,并允许在一个模型内灵活处理多种脑-刺激映射,显著简化了训练与应用流程。
方法
输入:外部视觉刺激(图像)、语义描述(文本)以及对应的脑神经活动(fMRI 体素信号)。
关键模块:
- Unified Brain Tokenizer
- 将连续 fMRI 信号量化为离散 token,采用矢量量化机制,将脑活动模式映射到共享的 Omni空间 中。
- Omni空间同时容纳视觉 token(由预训练视觉分词器提取)和语言 token(由文本分词器提取),确保三种模态在离散空间中的语义对齐。
- All-in-One自回归架构
- 基于标准 Transformer 解码器,将多种模态的 token 序列拼接为统一输入,通过 下一 token 预测(next-token prediction)进行训练。
- 训练时采用 任意到任意(any-to-any)的生成范式:
- 编码方向:给定图像或文本 token,预测脑 token,实现图像→脑、文本→脑编码;
- 解码方向:给定脑 token,预测图像或文本 token,实现脑→图像、脑→文本解码。
输出:解码时可生成高质量自然图像或文本描述,编码时可生成符合真实神经活动分布的 fMRI 模式。
训练与推理:
- 首先预训练 Unified Brain Tokenizer,使脑 token 与其他模态 token 在 Omni空间中分布一致。
- 然后联合所有模态 token,端到端训练自回归模型,统一优化编码与解码目标。
- 推理时,可根据任务需求输入部分模态 token,模型自回归生成目标模态 token,再通过解码器恢复为原始信号。
与同类方法的差异:传统方法将脑编码与解码视为独立任务,依赖单模态对齐和额外先验;BrainJanus 首次以统一自回归框架将所有模态映射到共享离散空间,消除了任务特异性设计,并天然具备零样本泛化及生物拓扑可解释性。
实验
实验设计围绕 任意到任意(any-to-any)的生成任务展开,覆盖 脑编码(图像→脑、文本→脑)和 脑解码(脑→图像、脑→文本)四个方向。基线方法可能包含传统单向编解码模型、基于视觉特征的脑信号对齐方法等。评估时采用了脑解码常用的图像重建质量指标(如像素级相似度),并结合生物可解释性分析(如皮层拓扑保留)。
关键发现
- 统一模型性能领先:BrainJanus 在多种基准上表现更优,证明将脑信号量化为离散 token 并与视觉、语言模态共享 Omni 空间 的有效性。
- 零样本泛化能力:模型在没有针对特定映射显式训练的情况下,仍能完成新刺激的编解码,具备对未见刺激的适应潜力。
- 保留生物学拓扑:脑 token 的激活模式与已知视觉皮层功能分区高度吻合,表明量化过程未丢失神经活动的结构化信息。
与基线对比的深度解读
传统方法将编码与解码视为独立任务,通常需要外部的视觉或语言先验进行单模态对齐,忽视了脑作为多模态整合系统的本质。BrainJanus 通过 Unified Brain Tokenizer 将连续神经活动离散化,并利用全一自回归架构统一处理,实现了更紧密的脑-视-语言融合。其超越基线的关键可能在于:1)离散 token 表示降低了模态间的异构性;2)自回归建模抓取了信号中的时序依赖;3)共享空间使模型能利用跨模态的互补监督信号,从而在任意映射的任务中均取得提升,而不仅仅是某个单向任务。这种设计范式为通用的脑建模框架提供了新方向。
行业影响
落地场景
BrainJanus 首次将脑信号、视觉和语言统一到一个生成式框架中,其核心能力可服务于三类工业场景:
- 脑机接口产品:为残障人士提供更自然的多模态交互,通过脑信号直接生成语言描述或视觉图像,大幅提升沟通效率。
- 神经科学研究与医疗工具:自动化脑编码与解码流程,帮助研究者快速验证神经表征假设;临床上可用于阿尔茨海默病、失语症等脑功能评估,通过对比健康与患者脑反应生成差异报告。
- 内容与体验优化:电商或内容平台可利用其脑到图像/文本解码能力,量化用户对商品或媒体内容的潜意识反应,指导素材设计;也可逆向生成刺激,做注意力或情绪诱导测试。
商业价值
- 降本:现有脑数据分析依赖大量手工特征工程与专家标注,BrainJanus 的端到端统一建模可将 fMRI 到语言/图像映射的传统 pipeline 从数周缩短至小时级,降低神经影像研究的人力与计算成本。
- 增收:为脑健康诊断、神经营销等 B2B 服务提供差异化能力。例如,向制药公司提供候选分子对脑活动影响的量化解码报告,开辟新的数据变现渠道。
- 体验提升:在消费级脑电硬件成熟后,可驱动更流畅的无创脑机交互,让用户“想即所得”,突破现有手势或眼动交互局限。
与现有产品/工作流的接口
BrainJanus 的 Unified Brain Tokenizer 将连续脑信号量化为标准 token,可直接挂接到预训练视觉-语言模型(如 LLaVA、Stable Diffusion)的输入端。集成方式如下:
- 在医学影像处理中,将其作为 fMRI 预处理插件,输出脑 token 序列供下游分类或生成网络使用,兼容现有 NiBabel、Nilearn 生态。
- 在多模态 AI 平台中,通过 All-in-One 自回归架构 提供统一推理 API,同时接收脑信号、文本或图像,实现 any-to-any 生成,可灵活接入产品化 BCI 软件栈或实时神经反馈系统。
具体落地案例:
- 电商平台隐性偏好调研:在产品详情页测试中采集少数志愿者的 fMRI 数据,通过 BrainJanus 将脑活动解码为文本关键词或概念图,对比用户自述偏好,发现无法言说的审美或功能需求,指导产品迭代与广告创意优化。
- 医疗影像AI辅助诊断:放射科医生在检查脑肿瘤患者时,可将任务态 fMRI 输入 BrainJanus,生成患者应该“看到”的标准视觉刺激参照,与实际刺激进行对比,快速定位功能异常脑区,作为手术规划或康复评估的客观依据。
局限
- 模型训练高度依赖大规模、高质量的功能磁共振成像(fMRI)数据集(如 Natural Scenes Dataset),这类数据采集成本高昂,且范式固定、被试有限,难以泛化到更小规模、不同刺激模态(如音频、运动)或跨物种的神经信号上。统一脑分词器(Unified Brain Tokenizer)通过离散化连续神经活动实现跨模态对齐,但离散令牌可能损失精细的时间/空间信息,对低信噪比脑区或微弱神经表征的编码保真度不足。
- All-in-One 自回归架构虽能实现任意到任意生成,但逐令牌解码的推理过程在高维输出(如脑到图像高分辨率合成)时计算开销大、延迟高,不适合实时应用。训练需同时优化多个任务(编码、解码多个方向),任务间可能相互干扰,且针对新模态的扩展需要重新对齐码本,灵活性有限。
- 模型声称保留可解释的生物拓扑,但所依赖的离散码本与共享 Omni 空间主要捕获区域级的粗粒度对应关系,难以反映神经元群体编码的精细动态。零样本泛化验证目前局限于同分布同物种场景,对跨物种、跨神经记录技术(如 EEG、MEG)或真实世界噪声数据的鲁棒性尚不清楚。