评估人工智能解决细微心脏病学子专业问题的能力:ChatGPT和CathSAP
Saumya Nanda1, Khaled Abaza2, Pyae Hein Kyaw1
1Department of Internal Medicine, Maimonides Medical Center, Brooklyn, New York.
概括
像ChatGPT这样的人工智能 (AI) 模型在医疗评估中显示出潜力,在培训后显著提高了干预心脏病检查的得分. 需要进一步的研究来优化AI用于医学教育和评估.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 心脏病评估心脏病学评估
背景情况:
- 大型语言模型 (LLM) 在医疗保健方面表现有前途,但需要对专业医疗检查进行评估.
- 人工智能在干预性心脏病学委员会检查中的表现在很大程度上是未被探索的.
研究的目的:
- 评估聊天生成预训练变压器 (ChatGPT) 在Cath自我评估计划 (CathSAP) 考试中的表现.
- 为了将ChatGPT的表现与平均测试者进行比较.
- 评估教育材料对ChatGPT响应的影响.
主要方法:
- 一项横截面研究使用了来自CathSAP问题库的360个问题.
- 在接触相关教育材料之前和之后评估了ChatGPT的性能.
- 使用克鲁斯卡尔-瓦利斯人口平等等级测试来确定统计学意义.
主要成果:
- 聊天GPT最初的得分为54.44%,在培训后提高到79.16% (P = .0003).
- 改善的分数与人类平均受试者的平均分数相当.
- 聊天GPT在基础科学和药理学方面表现出色,但在解剖学相关问题上扎.
结论:
- 在医疗评估场景中,ChatGPT表现出适应性和学习潜力.
- 人工智能性能随着接触有针对性的教育内容而显著提高.
- 进一步的研究对于解决AI的局限性 (如视觉处理,偏见) 和优化其在医学教育中的作用至关重要.


