基于GPT的自动化评估工具的开发和性能验证,用于PEDro规模的自动化评估工具
Yu-Jeng Ju1, Yi-Ching Wang1, Fan Chou2
1School of Occupational Therapy, College of Medicine, National Taiwan University, Taipei, Taiwan.
Archives of physical medicine and rehabilitation
|March 2, 2026
概括
一个自动化的GPT-PEDro评估工具 (GPT-PEDro ET) 显示出高可靠性和有效性,用于评估随机对照试验 (RCT) 的质量. 这种工具可以简化研究中的方法质量评估.
科学领域:
- 医疗信息学 医疗信息学
- 临床研究方法论 临床研究方法论
- 医疗保健中的人工智能
背景情况:
- 佩德罗尺度是评估随机对照试验 (RCT) 方法质量的广泛使用的工具.
- 使用PEDro尺度对RCT进行手动评估可能耗时且资源密集.
- 自动化这一过程可以提高研究质量评估的效率和一致性.
研究的目的:
- 开发一个自动化的 GPT-PEDro 评估工具 (GPT-PEDro ET).
- 验证GPT-PEDro ET的性能,包括其在评价者内部的可靠性和并发有效性.
- 评估该工具在使用PEDro尺度评估RCT的方法质量的有效性.
主要方法:
- 进行了一项采用重复测量设计的心理测量验证研究.
- 分析了125个关于中风康复中神经促进干预的RCT.
- 绩效通过使用类内相关系数 (ICC),流行率调整和偏差调整的卡帕 (PABAK) 统计数据以及布兰德-阿尔特曼分析来评估.
主要成果:
- 对于总得分 (ICC=1.00) 和单个项目 (PABAK=0.94-1.00),GPT-PEDro ET表现出几乎完美的评分内可靠性.
- 同时有效性被发现为中等到高,总分数的ICC为0.83,单个项目的PABAK从0.68到0.97.
- 该工具与已建立的可靠性和有效性指标有很强的一致性.
结论:
- GPT-PEDro ET是一个潜在的有价值的自动化工具,用于评估RCT的方法质量.
- 该工具表现出强大的心理测量特性,表明其在研究环境中的实用性.
- 它有可能减少与手动质量评估相关的工作量,并支持临床和研究应用.


