大型语言模型和皮肤病学人类受访者表现的比较分析
Aravind Baskar Murthy1, Vijayasankar Palaniappan2, Suganya Radhakrishnan2
1Department of Dermatology, Venereology and Leprosy, SRM Medical College Hospital and Research Center, Chengalpet, Tamil Nadu, India.
Indian dermatology online journal
|March 24, 2025
概括
微软的Bing Chat和ChatGPT在回答皮肤病问题方面表现优于人类受访者. 聊实现了78.2%的准确性,明显超过了ChatGPT (59.8%) 和人类专家 (43%).
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 皮肤病学研究 皮肤病学研究
背景情况:
- 生成型人工智能 (AI) 和大型语言模型 (LLM) 越来越多地被用于医学研究.
- 本研究的重点是LLMs的应用,特别是ChatGPT和微软Bing Chat,在皮肤病学,阴道病学和麻风病领域.
研究的目的:
- 评估ChatGPT和微软Bing Chat在回答与皮肤病学,阴道病学和麻风病有关的医疗问题的准确性.
- 为了比较这些LLM与人类受访者 (最后一年的研究生) 的表现.
- 评估LLM产生的人工幻觉的频率.
主要方法:
- 一套60个问题,包括多选题,填空题和基于场景的格式,用于评估.
- 在2023年8月10日至23日之间访问了ChatGPT版本3.5和微软Bing聊天.
- 通过正确响应得分和整体准确度来测量性能,并采用统计分析 (ANOVA).
主要成果:
- 微软的Bing聊天实现了最高的整体准确度 (78.2%),其次是ChatGPT (59.8%) 和人类受访者 (43%).
- 在大多数问题类型和主题中,Bing Chat表现出优异的表现,除了血管疾病,炎症疾病和麻风病.
- 与Bing Chat不同的是,ChatGPT在难题上表现出更高的准确性 (55%) 并在4个实例中表现出人工幻觉.
结论:
- 大型语言模型,特别是Bing Chat,在医学知识评估方面显示出重大潜力,在本研究中表现优于人类受访者.
- 在某些特定的皮肤病领域,LLM 具有局限性,例如炎症疾病和麻风病.
- 这些发现强调了需要制定监管框架,以指导在医疗保健和研究中负责任地使用LLM.


