在产科和妇科中生成脚本一致性测试的大型语言模型:ChatGPT和Claude
Zuhal Yapıcı Coşkun1,2, Yavuz Selim Kıyak3, Özlem Coşkun3
1Department of Obstetrics and Gynecology, Ministry of Health, Ankara Bilkent City Hospital, Ankara, Türkiye.
Medical teacher
|April 30, 2025
概括
像ChatGPT-4o和Claude 3.5 Sonnet这样的大型语言模型 (LLM) 在生成产科和妇科临床推理评估的脚本一致性测试 (SCT) 项目方面表现有希望. 需要进一步精细化,以适合医学学生的困难级别.
科学领域:
- 医学教育 医学教育
- 医疗保健中的人工智能
- 临床推理评估评估
背景情况:
- 脚本一致性测试 (SCT) 是评估临床推理的宝贵工具.
- 生产高质量的SCT项目可能会耗时.
- 大型语言模型 (LLM) 提供了在医学教育中自动化内容创建的潜力.
研究的目的:
- 评估ChatGPT-4o和Claude 3.5 Sonnet在生成产科和妇科的SCT项目中的性能.
- 根据临床推理评估的预定义标准,评估人工智能生成的SCT项目质量.
主要方法:
- 一项横截面研究产生了五个常见的产科和妇科主题的SCT项目.
- 16名小组成员使用11个质量标准评估AI生成的SCT项目.
- 描述性统计比较了ChatGPT-4o和Claude 3.5 Sonnet的性能.
主要成果:
- 聊天GPT-4o获得了90.57%的质量标准一致; 克劳德 3.5 索内特获得了91.48%.
- 两种模型的整体表现都很好,但医学生的项目难度很难 (71.25%为ChatGPT-4o,76.25%为Claude 3.5 Sonnet).
结论:
- 在LLM可以生成有效的SCT项目来评估产科和妇科的临床推理.
- 提炼是必要的,以确保医学生适当的难度水平.
- 人工智能有可能提高初级保健机构SCT生成效率.


