基于METRICS的放射学研究方法质量评估中的大型语言模型:聊天GPT与笔记本LM与放射科医生
1Department of Radiology, Uskudar State Hospital, Istanbul 34662, Turkey; Department of Radiology, University of Health Sciences, Basaksehir Cam and Sakura City Hospital, Istanbul 34480, Turkey.
European journal of radiology
|February 12, 2025
概括
大型语言模型 (LLM) 显示了使用METRICS工具评估放射学研究质量的潜力. 虽然比人类专家更快,但LLM需要进一步发展,以便在方法质量评估中完全协调.
科学领域:
- 医疗成像中的人工智能
- 放射学研究方法论研究方法论
背景情况:
- 评估放射学研究的方法质量对于可靠的临床翻译至关重要.
- 现有的质量评估工具可能无法完全捕捉复杂的放射学研究的细微差别.
研究的目的:
- 评估大语言模型 (LLM) 在评估放射学研究的方法质量的有效性.
- 通过使用方法学RadiomICs评分 (METRICS) 工具,将LLM绩效与人类专家评估进行比较.
主要方法:
- 2024年的开放式放射学文章使用METRICS工具被ChatGPT-4,NotebookLM和两位专家放射学家评估.
- 评估者之间的可靠性是使用类内相关系数 (ICC) 来评估的.
主要成果:
- 与人类专家相比,LLM显示出了显著的速度优势.
- 聊天GPT-4的中位数为79.5%,笔记本LM为61.6%,人类专家为69.0%.
- 与人类专家相比,NotebookLM没有显著差异 (p > 0.05),而ChatGPT-4则有 (p < 0.05). 国际刑事法院表示LLM和人类专家之间的协议较差至中等.
结论:
- 通过使用METRICS工具,LLM显示出用于自动化放射学研究质量评估的前景.
- 为了实现与人类专家评估完全一致,需要进一步的进展.
- 在放射学中,LLM为高效和可扩展的质量评估提供了潜在的解决方案.


