在皮肤病学中实施GPT-4学习模型:对医疗质量和实用性的评估
Aryan Naik1, Peter Vien1, Thanh-Nga Tran2
1Larner College of Medicine, The University of Vermont, Burlington, Vermont, USA.
概括
像GPT-4这样的大型语言模型 (LLM) 在皮肤病学中显示出潜力,但需要验证. 虽然GPT-4输出通常是安全的,但在医疗质量评估中得分很差,这表明需要进一步优化.
科学领域:
- 人工智能在医学中的应用
- 皮肤学人工智能应用程序
背景情况:
- 像GPT-4这样的大型语言模型 (LLM) 可以生成临床信息.
- 缺乏评估GPT-4皮肤病输出的医疗质量和准确性.
研究的目的:
- 评估皮肤病学中GPT-4模型的医疗质量和治疗建议准确性.
- 将GPT-4输出 (ChatGPT-4,Copilot) 与33种皮肤病的UpToDate (UTD) 进行比较.
主要方法:
- GPT-4模型生成了33种疾病的摘要和治疗方法.
- DISCERN评分评估了医疗质量;皮肤科医生评估了与UTD治疗的一致性.
- 统计分析包括配对的t测试和ANOVA.
主要成果:
- UTD的内容质量被评为"公平",而ChatGPT-4和Copilot被DISCERN评为"差".
- 与Copilot相比,ChatGPT-4治疗建议与UTD的一致性 (33.5%) 显著更高.
- 在GPT-4模型中,几乎没有产生有害的建议.
结论:
- GPT-4模型作为皮肤病学工具具有前景,但需要验证.
- 可以将LLM参数和查询结构优化为皮肤病学.
- 未来的LLM,与皮肤科医生的判断一起使用,可以提高患者的护理和节省时间.

