在数字心理健康干预中对机器学习预测的最小数据集大小的估计
Kirsten Zantvoort1, Barbara Nacke2, Dennis Görlich3
1Institute of Information Systems, Leuphana University, Lüneburg, Germany. kirsten.zantvoort@leuphana.de.
NPJ digital medicine
|December 18, 2024
概括
数字心理健康中的小型数据集 (N≤300) 高估了人工智能 (AI) 的预测能力. 建议最小数据集大小为500-1000以确保可靠的AI模型在这个领域的概括性.
科学领域:
- 数字心理健康数字心理健康
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 人工智能 (AI) 具有改变心理健康护理的潜力.
- 人工智能结果的概括性存在担忧,原因是数据集的小规模和方法的局限性.
研究的目的:
- 确定数字心理健康中的AI模型所需的最小数据集大小.
- 分析特定领域的学习曲线,以预测数字干预中的学情况.
主要方法:
- 在数字干预研究中,利用3654名用户的数据探索学习曲线.
- 分析了不同数据集大小 (N=100-3654),特征组 (F=2-129) 和算法 (从原始贝叶斯到神经网络) 的预测性能.
主要成果:
- 发现小数据集 (N≤300) 过高估计了预测能力.
- 复杂的模型在小数据集上过度适应,但在更大的数据集上得到了改进.
- 模型性能趋同要求数据集大小为750-1500个用户.
结论:
- 在数字心理健康领域的人工智能研究中,建议的最低数据集大小为500-1000名用户.
- 强调需要经验参考来指导AI研究设计和解释在这个领域.


