6 月 29 日,Meta 发布 Brain2Qwerty v2——一个完全非侵入式的脑到文本解码系统。它不依赖开颅手术或植入电极,只通过脑磁图(MEG)扫描仪采集志愿者打字时的脑信号,就能解码出完整的句子。平均词准确率 61%,最佳受试者 78%,而此前最优的非侵入式方法的同一指标仅为 8%。
这个数字跳跃意味着非侵入式脑机接口(BCI)首次进入了「能看懂句子」的区间,而不是只能猜对几个字母。
三级架构:从原始信号到完整句子
Brain2Qwerty v2 的核心是一条三级深度学习管线。
第一级是卷积编码器(Conformer),直接在原始 MEG 信号上学习特征,替代了传统 BCI 研究中手工设计的神经事件检测流程。传统方法需要人工标记如「受试者准备按键」「按键瞬间」等事件——这不仅依赖领域专家经验,还会丢失信号中未被预设模板捕获的信息。端到端学习的编码器不再需要这些中间步骤。
第二级是 Transformer,对编码器输出的字符级表示进行长程建模,将连续的脑信号窗口映射为候选字符序列。
第三级是一个在大脑数据上微调过的大语言模型。与常见做法——让 LLM 在编码器输出文本上做拼写纠正——不同,Brain2Qwerty v2 的 LLM 直接读取编码器产生的神经嵌入(Neuro Tokens),从神经信号层面引入语义约束。消融实验表明,这种「神经 LLM」设计在字符错误率、词错误率和语义错误率三个指标上均优于仅做文本层纠正的方案。
Meta 团队还部署了 AI Agent 来自动探索解码管线的优化空间,但最终训练配置仍由工程师手动选定。
论文报告,9 名志愿者每人佩戴 MEG 扫描仪打字约 10 小时,共产生约 22,000 句训练数据。整个实验在西班牙 BCBL(Basque Center on Cognition, Brain and Language)完成。
v1 到 v2:不只是数据量的增长
Brain2Qwerty v1 于 2025 年 2 月发布,同日在 Nature Neuroscience 正式发表。v1 的核心贡献是证明了非侵入式 MEG 信号中确实包含足够解码打字内容的信息——35 名受试者,MEG 下平均字符错误率(CER)32%,最佳受试者 19%。但 v1 有一个关键限制:它必须知道每一次按键的精确时间戳才能工作,这意味着无法实时运行。
v2 解决了这个问题。新模型从连续 MEG 信号中直接生成句子,不需要外部按键时间信息。再加上每名受试者的训练数据扩大了 10 倍,模型从 v1 的字符级解码升级为字符、词、句子三级联合解码,性能出现质变。
衡量标准也相应升级——从 CER 转向词准确率。v1 的 32% CER 大致对应约 48% 词准确率,v2 的 61% 相当于 39% 词错误率(WER),最佳受试者 WER 低至 22%。
Meta 还确认了一个关键实验选择:MEG 远超 EEG。v1 论文中,同等条件下 EEG 的 CER 是 65%,几乎是 MEG(32%)的两倍。这解释了为什么 v2 放弃 EEG,专注 MEG。
缩放定律:数据越多越准,还没到天花板
论文中最重要的发现之一是解码准确率随数据量呈对数线性增长——在现有数据范围内没有观察到性能平台。这对于 BCI 领域意味着什么?
侵入式 BCI 目前拥有压倒性的准确率优势。通过植入电极,已有系统实现 92% 以上的句子级准确率,甚至有 ALS 患者借助手术植入的 BCI 恢复了全职工作所需的沟通能力。Neuralink 等公司正在将这类植入设备商业化。
但侵入式方案的最大障碍是规模:每一次植入都是一台脑外科手术,伴随感染、组织反应和硬件退化风险。如果能用更多的非侵入式数据训练来缩小差距,整个 BCI 的可及性格局就会被改写。
Meta 在论文中明确表示,「性能差距可能通过数据扩展部分弥合」,并将此作为继续推进非侵入式路线的主要信心来源。
开源策略:代码全放,数据分批
Meta 此次一并开源了 Brain2Qwerty v1 和 v2 的完整训练代码(CC BY-NC 4.0 许可),BCBL 在 Hugging Face 上发布了 v1 数据集。v2 数据集目前处于禁运期,等待期刊接收后发布。
这延续了 Meta 在脑科学方向的开放策略。Brain2Qwerty 是 Meta「数字大脑项目」(Digital Brain Project)的一部分,该项目还包括用于感知编码的 Tribev2 模型、大规模脑数据处理工具 NeuralSet、以及系统化评估框架 NeuralBench。Meta 此前已为该项目的开放数据集设立了 500 万美元资助基金。
研究团队明确表示 Brain2Qwerty v2 不会成为商业产品。高级研究员 Jean-Rèmi King 称商业化该系统「太难了」。
三个关键限制
尽管准确率暴涨,Brain2Qwerty v2 离临床应用还有显著距离。
第一个限制是硬件。实验中使用的 MEG 扫描仪有 306 个传感器,需要磁屏蔽室,体型庞大且极其昂贵,只能部署在少数研究型医院。Meta 在论文中提到了可穿戴 MEG 技术(光学泵磁力计,OPM)作为潜在的解决方案,但这项技术本身也尚在研究阶段。
第二个限制是任务设计本身。模型学习的是健康志愿者实际打字的脑信号——而它目标用户(因脑损伤失去沟通能力的患者)恰恰无法打字。论文承认,对于完全锁定综合征患者,需要将任务重建为基于想象动作而非真实按键的形式,这条路目前「不确定」。
第三个限制是实时性。虽然 v2 不再需要外部按键时间戳,但模型仍需等整个打字会话结束后才能输出句子,无法提供逐字实时反馈。对于需要交互式沟通的患者,这是一个显著的实用障碍。
为什么这件事发生在 Meta
Brain2Qwerty 不只是一个孤立的实验室项目。它属于 Meta 的 FAIR(Fundamental AI Research)实验室——一个以基础研究而非产品为导向的团队,近年来在开放科学上的投入超过了任何其他科技巨头(从 Llama 开源到最近的数字大脑项目)。
这件事放在行业背景中看更有意思:当 OpenAI 和 Anthropic 在前沿模型的「政府批准」准入机制中博弈时,Meta 正系统性地在 AI for Science 方向上积累开源资产。Brain2Qwerty v2 证明,端到端深度学习 + LLM 的范式不只适用于文本和图像——当信号足够多、数据量足够大时,它同样可以吃进人类大脑的磁信号,吐出可读的句子。
剩下的问题是时间:MEG 硬件的小型化进度、以及从「实际打字」到「想象打字」的任务迁移——这两项都不是 AI 能独立解决的。