大型语言模型的准确性,用于胸部外科的文献查:诊断研究
Zhang-Yi Dai1, Fu-Qiang Wang1, Cheng Shen1
1Department of Thoracic Surgery, West China Hospital of Sichuan University, Chengdu, China.
Journal of medical Internet research
|March 11, 2025
概括
大型语言模型 (LLM) 显著改善了系统审查的文献选,比传统的机器学习工具提供了更高的准确性和效率. 这一进步通过减少手工工作量来简化研究,而不会影响科学质量.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 证据综合 证据综合
背景情况:
- 系统审查和元分析需要广泛的文献选.
- 当前的机器学习工具对此任务的准确性不足.
- 大型语言模型 (LLM) 为自动选提供了一个潜在的解决方案.
研究的目的:
- 为了评估LLM辅助文献选的准确性.
- 将LLM性能与手动选和传统的ML工具进行比较.
- 评估LLM查的敏感性,特异性和SROC曲线.
主要方法:
- 一项诊断研究比较了LLM辅助查 (ChatGPT-4o,Claude-3.5) 与手动查 (参考标准) 在6个胸部手术元分析中.
- 还评估了两个开源的ML工具 (ASReview,Abstrackr).
- 计算了灵敏度,特异性和SROC曲线;LLM提示被事后改进.
主要成果:
- 通过LLM辅助的全文选显示高聚合灵敏度 (0.87) 和特异性 (0.96),AUC为0.96.
- 标题/抽象查结果的综合灵敏度为0.73和特异性为0.99 (AUC为0.97).
- 在LLM的表现显著超过ASReview (AUC0.66) 和Abstrackr (AUC0.78).
- 随时后期的快速修订提高了LLM的灵敏度至0.98,同时保持了高的特异性.
结论:
- 法律法学证明了在系统审查文献选中提高效率和准确性的巨大潜力.
- 在灵敏度和AUC等性能指标上,LLM超越了传统的机器学习工具.
- 这项技术可以简化研究工作流程,而不会影响证据合成的质量.
更多相关视频
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
2.3K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
