Zyphra 于 7 月 17 日发布了 ZUNA1.1,这是一款面向 electroencephalography (EEG)——即脑活动电信号记录——的开源基础模型。该模型以宽松的 Apache 2.0 许可发布,旨在像早期基础模型之于文本和图像那样,为杂乱的神经数据提供处理能力。
The model
ZUNA1.1 是一款 3.8 亿参数的 transformer 编码器-解码器,构建为 diffusion autoencoder。相较最初的 ZUNA1,其最主要升级在于灵活性:它接受 0.5 秒至 30 秒的可变长度输入,而不再局限于固定的 5 秒片段——当真实记录并不会整齐地按窗口到来时,这一差异在实际应用中尤为重要。
What it does
该模型可对 EEG 进行 去噪、重建缺失通道并对记录进行 上采样——补上真实脑电数据中常见的空缺。Zyphra 表示,在留出样本的重建误差上,它的表现与经典 spherical-spline 插值相当或更优,后者是其试图替代的标准技术。diffusion autoencoder 会学习压缩信号并随后重新生成,这使模型能够推断那些中途丢失或原本就未被记录的通道的合理数值。
From headbands to research rigs
关键在于,它能跨硬件泛化。借助 position-aware tokenization,ZUNA1.1 可适配任意电极布局——从 4 电极消费级头带到 256 通道研究级设备都能使用。这种跨设备可移植性,正是长期以来让神经数据被分割、难以复用的原因。
Open weights
该模型基于约 350 万通道小时的公开 EEG 数据训练而成,高于前一版本约 200 万通道小时;其模型、代码和权重均可免费获取。对于一个标注脑数据稀缺且成本高昂的领域而言,这样一款开放、与硬件无关的基础模型,降低了初创公司和学术机构开发神经技术与脑机接口的门槛。Zyphra 更为人熟知的是其高效语言和多模态模型,如今正将同样以效率优先的理念应用于生物信号,押注开放基础设施能够培育开发者生态,而这最终将推动采用。
