Reinforcement learning: computing the temporal difference of values via distinct corticostriatal pathways

Kenji Morita1, Mieko Morishima, Katsuyuki Sakai

  • 1Physical and Health Education, Graduate School of Education, The University of Tokyo, 7-3-1 Hongo, Bunkyo-ku, Tokyo 113-0033, Japan. morita@p.u-tokyo.ac.jp

Summary

This study proposes a novel mechanism for how midbrain dopamine neurons compute reward prediction error signals. It involves distinct corticostriatal neuron subpopulations representing current and past states to calculate temporal differences, offering a unified view of basal ganglia function.