强化学习参数的规定捕捉了老鼠行为的长期变化
François Cinotti1,2, Etienne Coutureau3, Mehdi Khamassi1
1Institut des Systèmes Intelligents et de Robotique, Sorbonne Université, CNRS, Paris, France.
The European journal of neuroscience
|June 26, 2024
概括
在做决策任务的预训练期间,老鼠逐渐稳定了他们的学习策略. 一个元学习模型解释了他们如何根据平均奖励率调整学习速度或逆温度.
科学领域:
- 神经科学是一个神经科学.
- 计算生物学 计算生物学
- 动物行为 动物行为
背景情况:
- 在不可预测的环境中,动物面临着一个学习困境:利用当前的知识或探索新的信息.
- 在初始学习期间,对这种探索-利用权衡的监管仍然不太了解.
研究的目的:
- 为了研究老鼠如何在任务获取过程中随着时间的推移而调整他们的强化学习策略.
- 为了比较计算模型来解释学习中的长期行为变化.
主要方法:
- 在24天内观察了24只老鼠在一个三臂强盗任务上.
- 分析了老鼠表现的每日变化和胜利转移趋势.
- 利用计算建模,包括元学习方法.
主要成果:
- 鼠标的表现和胜利转移趋势在训练前几天逐渐稳定.
- 行为适应被成功地模拟为一个元学习方法.
- 该模型表明,学习速度或逆温度是由平均奖励率调节的.
结论:
- 在最初的任务学习过程中,老鼠逐渐调整他们的强化学习参数.
- 超级学习为理解不确定的环境中的适应性学习提供了一个框架.
- 平均回报率是调节勘探开发动态的一个关键因素.


