用轻量模型实现多人脑影像视觉重建,参数少效果好。
VoxelFormer: Parameter-Efficient Multi-Subject Visual Decoding from fMRI
- 用分块压缩+查询驱动的Transformer,降低脑信号处理复杂度。
- 在7T自然场景数据集上,训练过的受试者重建效果接近现有方法。
- 适合想做跨人脑解码、资源有限的研究者使用。
基于fMRI的视觉重建近年取得显著进展,但多数方法依赖个体特异性训练,限制了可扩展性与实际应用。我们提出VoxelFormer,一种轻量级Transformer架构,支持多受试者联合训练以实现脑影像到视觉内容的解码。该模型融合了用于高效体素压缩的Token Merging Transformer(ToMer)和基于查询的Q-Former,生成固定长度的神经表示,并对齐于CLIP图像嵌入空间。在7T Natural Scenes Dataset上的评估显示,VoxelFormer在训练过的受试者上实现了具有竞争力的检索性能,同时参数量显著低于现有方法。结果表明,体素合并与查询驱动的Transformer是实现参数高效神经解码的有前景策略。
原文摘要 · Abstract (English)
Recent advances in fMRI-based visual decoding have enabled compelling reconstructions of perceived images. However, most approaches rely on subject-specific training, limiting scalability and practical deployment. We introduce \textbf{VoxelFormer}, a lightweight transformer architecture that enables multi-subject training for visual decoding from fMRI. VoxelFormer integrates a Token Merging Transformer (ToMer) for efficient voxel compression and a query-driven Q-Former that produces fixed-size neural representations aligned with the CLIP image embedding space. Evaluated on the 7T Natural Scenes Dataset, VoxelFormer achieves competitive retrieval performance on subjects included during training with significantly fewer parameters than existing methods. These results highlight token merging and query-based transformers as promising strategies for parameter-efficient neural decoding.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。