双引导大脑扩散模型:从人类视觉刺激的fMRI自然图像重建
1College of Information Science and Engineering, Northeastern University, Shenyang 110819, China.
Bioengineering (Basel, Switzerland)
|October 28, 2023
概括
这项研究引入了一种新的双导向大脑扩散模型 (DBDM),用于从大脑活动 (fMRI) 中重建视觉刺激. DBDM有效地重建视觉和语义细节,在视觉解码方面表现优于以前的方法.
科学领域:
- 神经科学是一个神经科学.
- 机器学习 机器学习
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 从功能磁共振成像 (fMRI) 信号重建视觉刺激是神经科学和机器学习的一个重大挑战.
- 之前的研究通常集中在重建像素级特征或语义特征,但不是同时进行两者.
研究的目的:
- 引入一种新的三阶段方法,即双引导大脑扩散模型 (DBDM),用于从fMRI数据中进行全面的视觉重建.
- 通过整合视觉和语义信息来提高视觉刺激重建的准确性和完整性.
主要方法:
- 使用非常深度变异自编码器 (VDVAE) 来从fMRI信号进行初始粗略图像重建.
- 使用引导语言图像预训练 (BLIP) 模型对重建图像进行语义注释.
- 应用了多功能扩散 (VD) 模型的图像到图像管道,用于最终的自然图像恢复,以视觉和语义数据为指导.
主要成果:
- 与现有方法相比,DBDM模型在定性和定量评估中表现出优越的性能.
- 在重建语义细节方面取得了最先进的结果,Inception,CLIP和SwaV的距离分别为0.611,0.225和0.405.
- 验证了模型在捕捉原始视觉刺激的底层细节和语义内容方面的有效性.
结论:
- 双引导大脑扩散模型 (DBDM) 通过整合视觉和语义指导,有效地从fMRI数据中重建视觉刺激.
- DBDM代表了视觉解码研究的重大进步,在捕获低级和高级图像特征方面提供了更高的准确性.
- 这些发现突显了先进的深度学习模型在理解大脑对视觉信息的表现方面的潜力.


