评估聊天机器人在台湾精神病学执照考试中的表现,使用Rasch模型
Yu Chang1, Chu-Yun Su2, Yi-Chun Liu1,3
1Department of Psychiatry, Changhua Christian Hospital, Changhua 500, Taiwan.
Healthcare (Basel, Switzerland)
|November 27, 2024
概括
最先进的聊天机器人,特别是2024年2月之后发布的聊天机器人,在精神病学医学教育方面表现有前途. 聊天GPT-o1-预览表现出色,在复杂案件中表现出优势,但在专业法律和精神病学知识方面需要改进.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 精神病诊断 精神病诊断 精神病诊断
背景情况:
- 人工智能 (AI) 聊天机器人在医学教育和临床决策支持中的作用,特别是在精神病学等专业领域,还没有得到很好的定义.
- 了解当前人工智能模型的功能和局限性对于其有效地融入精神病学实践至关重要.
研究的目的:
- 评估领先的人工智能聊天机器人在精神病学许可证考试问题上的表现.
- 通过使用拉什模型,在精神病学知识和临床推理的背景下,确定这些聊天机器人的优缺点.
主要方法:
- 通过2024年台湾精神病学执照考试的100个选择题,评估了22个排名最高的AI聊天机器人.
- 评分聊天机器人的准确性,并采用拉什模型来量化聊天机器人的能力相对于考试的通过标准.
主要成果:
- 在2024年2月之后发布的AI聊天机器人,包括ChatGPT-o1-preview,成功通过了考试.
- 聊天GPT-o1-预览显示了统计学上显著的优越能力 (p < 0.001),比通过值高出1.92个逻辑.
- 在复杂的精神病情景和伦理考虑中观察到优势,而局限性包括最近的法律修正案和专业心理药理学的知识差距.
结论:
- 人工智能聊天机器人是精神病医学教育和临床决策支持的潜在有价值的工具.
- 人工智能技术的不断进步表明,这些模型将在未来的精神病学实践中变得越来越重要.


