实验评估人工智能在解决心脏病学多项选择委员会考试中的表现
Jessica Huwiler1,2, Luca Oechslin1, Patric Biaggi1,2
1Heart Clinic Zurich, Zurich, Switzerland.
Swiss medical weekly
|October 28, 2024
概括
人工智能 (AI) 聊天机器人通常在心脏病学考试中扎,大多数都未能获得通过分数. 虽然一些人工智能模型显示出希望,但当前的语言模型在医学知识应用中存在局限性.
科学领域:
- 心脏病学 心脏病学
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 人工智能 (AI) 在医学教育和实践中的整合正在迅速推进.
- 在高风险的医疗评估中,评估人工智能工具的能力至关重要.
研究的目的:
- 评估商业上可用的AI聊天机器人在理论心脏病委员会考试中的表现.
- 将人工智能聊天机器人与人类心脏病学研究员的准确性进行比较.
主要方法:
- 对36名心脏病学研究员和精选的AI聊天机器人进行了一组88个多选择心脏病学考试问题.
- 使用Top-1和Top-2准确度指标来评估性能.
主要成果:
- 心脏病学研究员的平均准确率为98%,所有参与者都通过了.
- 大多数人工智能聊天机器人表现出平均Top-1准确率为47%,Top-2准确率为67%.
- 只有两个聊天机器人,Jasper质量和ChatGPT加4.0,达到73%的最低通过分数.
结论:
- 目前的AI语言模型在准确解决理论医学委员会考试方面存在局限性.
- 广泛使用的聊天机器人通常无法在专业医疗评估中获得合格分数.
- 人工智能语言模型的未来进展可能会提高它们在医学知识应用中的实用性.


