探索从上下文嵌入中计算的特征与EEG频段功率在中文读句时之间的关系
Yao Wang1,2,3, Tiantian Xue1,2,3, Xingyu Yang1,2,3
1Cognitive Science and Allied Health School, Beijing Language and Culture University, Beijing, China.
Frontiers in neuroscience
|August 14, 2025
概括
这项研究探讨了大型语言模型 (LLM) 的上下文嵌入如何与阅读过程中的大脑活动有关. 研究结果表明,词嵌入之间的距离指标与神经反应相关,支持基于矢量的神经编码理论.
科学领域:
- 认知神经科学 认知神经科学
- 计算语言学 计算语言学
- 语言的神经科学语言的神经科学
背景情况:
- 来自大型语言模型 (LLM) 的上下文嵌入显示了与大脑活动模式的结构相似性.
- 这支持基于向量的神经编码框架用于大脑中的语言处理.
- 语言单元可以用情境敏感的载体来表示,类似于LLM嵌入.
研究的目的:
- 调查相邻的上下文嵌入之间的累积距离指标是否反映阅读理解期间的神经激活强度.
- 通过大规模脑电图 (EEG) 数据测试假设.
主要方法:
- 从阅读任务中利用了大规模的EEG数据集.
- 系统地分析了上下文嵌入的计算衍生距离特征与频率特定带功率之间的关系.
- 检查了与阅读理解相关的神经活动指标.
主要成果:
- 在中国EEG数据集中,马频段功率与各种自然语言处理 (NLP) 特性存在关联.
- 在ZuCo1.0数据集中没有发现可比的马特异性效应.
- 对于两个数据集,在其他频段观察到显著的影响.
结论:
- 该研究发现了上下文嵌入和神经反应的距离指标之间的关联,与基于矢量的神经编码框架保持一致.
- 结果表明,文本和数据集特征可能会影响这些关联.
- 需要进一步讨论不同频段的定向关联和认知影响.


