价值衰减的状梯度解释了多巴胺模式和强化学习计算的区域差异
Ayaka Kato1,2, Kenji Morita3,4
1Department of Psychiatry, Icahn School of Medicine at Mount Sinai, New York, New York 10029-5674.
概括
突触可塑性的值衰减解释了强化学习 (RL) 中异质多巴胺信号. 这种机制统一了在不同大脑区域和RL算法中观察到的多种多巴胺模式,表明渐变调节计算.
科学领域:
- 计算神经科学是一种神经科学.
- 强化学习的学习理论
- 多巴胺的神经生物学
背景情况:
- 多巴胺在奖励预测错误 (RPE) 中的作用受到争论,在大脑区域和条件中观察到异质的模式.
- 现有的强化学习 (RL) 理论难以调和这些多样化的多巴胺信号模式.
- 区域多巴胺异质性与各种RL算法之间的准确关系仍然难以捉摸.
研究的目的:
- 展示如何将价值衰变纳入RL模型可以连贯地解释异构的多巴胺信号.
- 将价值衰减与特定的RL算法联系起来,包括预测状态表示,层次RL和分布式RL.
- 建议在条状体内有一个中侧到侧侧的价值梯度或突触衰变调整区域RL计算.
主要方法:
- 开发了结合价值衰变的计算模型,表示突触可塑性衰变.
- 分析了在不同状态表示下,价值衰减如何影响RPE信号.
- 构建了具有和没有值衰减的等级和分布式RL模型,以模拟条形电路活动.
主要成果:
- 价值衰退解释了在特定状态表示下升的RPE,并解释了色的多巴胺升和依赖暗示类型/间隔的模式.
- 一个带有和没有价值衰变的合层次的RL模型成功地复制了不同的条状多巴胺电路活动模式.
- 有和没有值衰变的分布式RL模型阐明了区域多巴胺模式如何与分布式编码强度相关.
结论:
- 通过突触可塑性实现的价值衰减,为理解RL中的多种多巴胺RPE信号提供了一个统一的框架.
- 状体内值或突触衰变的梯度可以通过调节多巴胺/RPE信号来调整区域RL计算.
- 该框架将区域多巴胺异质性与不同的RL算法相协调,为灵活的学习和习惯形成提供了洞察力.


