在儿童和青少年精神病学知识评估中,大型语言模型ChatGPT和Gemini的性能
Johanna Charlotte Neubauer1, Anna Kaiser1,2, Leon Lettermann3
1Central Institute of Mental Health, Mannheim, Baden-Württemberg, Germany.
PloS one
|September 19, 2025
概括
像ChatGPT和Gemini这样的大型语言模型在儿童和青少年精神病学知识评估中表现出了良好的表现. 然而,准确性因主题而异,需要在临床使用前仔细考虑.
科学领域:
- 人工智能的人工智能
- 医学教育 医学教育
- 精神病学是一个精神病学.
背景情况:
- 大型语言模型 (LLM) 越来越多地用于各种领域,包括医学教育.
- 评估LLM的实际知识对于其在专业领域的可靠应用至关重要.
- 儿童和青少年精神病学需要准确和最新的知识,以有效的实践.
研究的目的:
- 评价四个领先的LLM (ChatGPT 4o,ChatGPT o1-mini,Gemini 2.0 Flash,Gemini 1.5 Flash) 在儿童和青少年精神病学中回答多选择题的问题.
- 评估这些LLM在这个专业医疗领域的实际知识基础.
- 在精神病学知识回忆中识别不同LLM模型的潜在优点和弱点.
主要方法:
- 使用了来自儿童和青少年精神病学委员会审查指南的150个多选题.
- 每个问题都向每个LLM提出了10次,随机的答案顺序以确保可靠性.
- 准确度是以正确答案的百分比计算出来的,模型之间进行了统计比较.
主要成果:
- 总体准确度在68.3%至78.9%之间,表明ChatGPT和Gemini模型的整体性能良好.
- 双子座2.0闪光灯的性能优于双子座1.5闪光灯,这表明AI能力有所提高.
- 心理药理学问题比那些具有明确诊断标准的疾病,如精神分裂症或饮食障碍的问题更具挑战性.
结论:
- 在儿童和青少年精神病学中,LLM有助于知识获取的潜力.
- 跨主题的准确性变化,潜在的偏见和误解风险是显著的限制.
- 在将LLM整合到该领域的临床决策过程中之前,需要仔细考虑.


