在阅读和听力过程中使用EEG数据集进行多模态语义对齐和神经解码
Sitong Chen1, Beiqianyi Li2, Cuilin He2
1Department of Biomedical Engineering, Southern University of Science and Technology, Shenzhen, China.
Scientific data
|December 23, 2025
概括
我们介绍了ChineseEEG-2,这是用于大脑与计算机接口研究的新数据集. 这一数据集有助于解码语言任务期间的大脑活动,推进神经解码和大脑-LLM对齐.
科学领域:
- 神经科学是一个神经科学.
- 人工智能的人工智能
- 计算语言学 计算语言学
背景情况:
- 大规模的基准数据集对于基于EEG的神经解码至关重要.
- 通过说话,听话和阅读方式对脑语言数据进行配对,对于将神经活动与大语言模型 (LLM) 保持一致至关重要.
- 这样的数据集很少,特别是对于非英语语言.
研究的目的:
- 介绍中文EEG-2,一个高密度的EEG数据集,用于在现实中文语言任务中对神经解码模型进行比较.
- 通过大声阅读 (RA) 和被动倾听 (PL) 模式实现精确的时间和语义对齐.
- 支持跨口语,听力和阅读的联合语义对齐学习,并促进大脑-LLM对齐.
主要方法:
- 基于之前的中文EEG数据集,中文EEG-2包含了主动模式:大声阅读 (RA) 和被动倾听 (PL),使用相同的中文数据库.
- 从四名参与者同时进行EEG和音频录制,在RA的时间约为10.8小时.
- 八名参与者在PL的21.6小时内进行EEG记录,使用RA记录.
主要成果:
- 中国EEG-2包括EEG信号,语音音频,从预先训练的语言模型中对齐的语义嵌入以及任务标签.
- 该数据集能够在RA和PL模式之间实现精确的时间和语义对齐.
- 它支持跨口语,听力和阅读的联合语义对齐学习.
结论:
- 中文EEG-2为下一代神经语义解码提供了一个基准数据集,特别是在中文.
- 它可以在多模式语言任务下对神经解码算法进行基准测试.
- 该数据集在复杂的语言处理场景中促进大脑-LLM对齐.


