在解决欧洲放射学文凭 (EDiR) 基于文本的多重响应问题的过程中,生成预训练过的变压器4o (GPT-4o):与放射科医生进行的一项比较研究
Jakub Pristoupil1, Laura Oleaga2, Vanesa Junquero2
1Department of Imaging Methods, Motol University Hospital and Second Faculty of Medicine, Charles University, Prague, Czech Republic.
Insights into imaging
|March 22, 2025
概括
发电预训练型变压器4o (GPT-4o) 在欧洲放射学文凭 (EDiR) 基于文本的问题上显著超过了人类候选人,实现了更高的准确性和可靠性. 这证明了GPT-4o.
科学领域:
- 医疗教育中的人工智能
- 放射学 检查 评估 评估
- 在医疗保健中的自然语言处理.
背景情况:
- 欧洲放射学文凭 (EDiR) 考试评估了放射科医生的基本知识.
- 在标准化医疗检查中评估高级AI模型 (如GPT-4o) 的性能至关重要.
- 了解AI在回答复杂的,基于文本的医学问题的能力是新兴的研究领域.
研究的目的:
- 评估GPT-4o在回答EDiR考试中的多个答案问题的准确性.
- 为了比较GPT-4o与人类候选人 (EDiR参与者和医学学生) 的性能.
- 评估GPT-4o在不同放射学子专业的可靠性和准确性.
主要方法:
- 一项前性研究将GPT-4o的反应与42名EDiR候选人和26名医学学生的反应进行了比较.
- 这项研究使用了52个基于文本的EDiR多重答案问题,重点关注回忆和理解.
- 绩效指标包括准确率,真假阳性率和评价者之间的一致性 (卡帕统计).
主要成果:
- GPT-4o的平均得分为82.1%,明显超过EDiR候选人 (49.4%) 和医学学生.
- 与人类参与者相比,GPT-4o表现出更高的真实阳性率和更低的假阳性率.
- 在大多数放射学子专业中,准确性更高,在EDiR候选人中,GPT-4o的接近完美一致 (κ=0.872) 与中度一致 (κ=0.334).
结论:
- 对于基于文本的EDiR问题,GPT-4o在准确性和可靠性方面明显超过了人类候选人.
- 这些发现表明,人工智能工具 (如GPT-4o) 在回答事实上的放射学问题方面具有很大的潜力.
- 需要进一步的研究来探索GPT-4o的表现与不同的问题格式和候选人群体.
更多相关视频
07:45Author Spotlight: Standardizing Mouse In Vivo PET Imaging with Body Conforming Molds and Automated Analysis
Published on: October 25, 2024
289
09:00Author Spotlight: Validation of SICOLE-R for Assessing Cognitive and Reading Skills in Spanish-Speaking Children and Its Role in Personalized Education
Published on: August 16, 2024
649
