人工智能在儿科心脏病中的精度多式模式图像解释
Michael N Gritti1,2,3, Rahil Prajapati3, Dolev Yissar1
1Division of Cardiology, The Labatt Family Heart Centre, The Hospital for Sick Children, Toronto, Ontario, Canada.
Cardiology in the young
|November 11, 2024
概括
聊天GPT-4在解释多模式儿科心脏病图像方面表现有限,在有或没有视觉辅助器件的情况下表现类似. 在该领域临床使用之前,需要大量的AI培训.
科学领域:
- 心脏病学 心脏病学
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 多式成像对于诊断和治疗儿科心脏病的必要.
- 人工智能 (AI) 聊天机器人,如ChatGPT-4,解释这些医疗图像的能力仍然未被评估.
- 评估AI在医学图像解释方面的熟练程度对于潜在的临床应用至关重要.
研究的目的:
- 评估ChatGPT-4在解释多模式儿科心脏病图像中的准确性.
- 为了比较ChatGPT-4在以图像为基础的问题上的表现,有和没有视觉输入.
- 通过使用各种成像方式来确定人工智能在儿童心脏病知识评估中的精度.
主要方法:
- 采用了横截面研究设计.
- 随机选择了100个多选题,其中包含来自"儿童心脏病委员会审查"的图像.
- 聊天GPT-4的测试是关于它能够回答带有和没有附带图像 (心声图,血管图,X射线图,心电图) 的问题.
主要成果:
- 聊天GPT-4正确回答了41%的基于图像的问题,性能因图像类型而异 (心电图:54%,血管图:29%).
- 没有图像的精度为37%,与使用图像的性能相比没有显著差异 (p=0.56).
- 人工智能在心电图像上的表现明显好于仅文本问题 (p<0.04),但与图像相比,与图像不一致.
结论:
- 聊天GPT-4在解释多模式儿科心脏病图像方面表现不佳.
- 无论提供图像还是不提供图像,AI的准确性都是可比的,这表明图像解释技能有限.
- 在考虑将ChatGPT用于儿科心脏病应用之前,需要进行广泛的AI培训和对临床推理的进一步研究.


