大型语言模型在睡眠医学随机对照试验数据提取中的准确性:一项概念验证研究
Zhen Peng1, Xingwei Wu2, Zongshi Qin3
1Key Laboratory of Population Health Across Life Cycle, Ministry of Education of the People's Republic of China, Anhui Medical University, Anhui, China; School of Public Health, Anhui Medical University, Anhui, China.
Sleep medicine reviews
|November 5, 2025
概括
克劳德3.5 AI在提取睡眠医学研究数据方面表现优于ChatGPT 4o,通过多句话提示实现了更高的准确性,用于组大小和事件计数等任务.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 睡眠医学研究 睡眠医学研究
背景情况:
- 大型语言模型 (LLM) 在自动化数据提取以进行系统审查方面表现有前途.
- 准确的数据提取对于睡眠医学系统性审查的有效性至关重要.
研究的目的:
- 为了比较ChatGPT 4o和Claude 3.5对睡眠医学随机对照试验 (RCT) 中关键变量的数据提取性能.
- 为了评估单句和多句子对 AI 数据提取准确性的影响,提示策略.
主要方法:
- 两个基于LLM的AI工具 (ChatGPT 4o,Claude 3.5) 在一个睡眠医学数据库中的648个RCT上进行了测试.
- 数据提取的准确性被评估为组大小,事件数,平均值和标准偏差.
- 性能与使用单句和多句语句提示符纠错的元数据进行了比较.
主要成果:
- 与ChatGPT 4o (69.1%) 相比,Claude 3.5 实现了更高的整体准确性 (71.5%).
- 克劳德3.5在所有数据提取任务中表现出卓越的性能,在准确性方面具有显著的优势.
- 对两种AI工具来说,多句提示比单句提示更高的准确性.
结论:
- 与ChatGPT 4o相比,Claude 3.5在睡眠医学研究中显示出更大的准确数据提取潜力.
- 有效的提示策略,例如使用多个句子,可以显著提高AI数据提取性能.
- 在帮助研究人员提取睡眠医学系统性审查的数据方面,LLM显示出前景.
更多相关视频
04:54Author Spotlight: IntelliSleepScorer — A High-Accuracy, Accessible GUI Software for Automated Sleep Stage Scoring in Mice and its Application in Psychiatric Research
Published on: November 8, 2024
961
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
