Optimal Foraging
Observational Learning
Reinforcement
Randomized Experiments
Reinforcement Schedules
Decision Making: P-value Method
您也可能阅读
通过共同作者、期刊和引用图与本文相关的文章。
By Rui Miao1, Babak Shahbaba2, Annie Qu2
1National Heart, Lung, and Blood Institute.
这项研究引入了使用异质数据进行个性化离线强化学习 (RL) 的新框架. 被惩罚的悲观的个性化政策学习 (P4L) 算法优化了针对不同人群的政策,优于现有的方法.
科学领域:
背景情况:
研究的目的:
主要方法:
主要成果:
结论: