评价GPT-4响应的痕或Keloids患者教育:大型语言模型评估研究
Mingjun Rao1, Tang Xiujun1, Wang Haoyu1
1Department of Plastic Surgery, Guizhou Provincial People's Hospital, 83 Zhongshan East Road, Nanming District, Guiyang, 550002, China, 86 15343315902.
JMIR medical informatics
|March 3, 2026
概括
像GPT-4这样的大型语言模型显示出对教育患者关于痕和状体的承诺,提供准确可靠的信息. 然而,提高可读性和减少人工智能产生的参考错误对于患者的信任和可访问性至关重要.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 患者教育 患者教育
背景情况:
- 痕和状体会导致严重的身体和心理痛苦,影响患者的生活质量.
- 患者寻求在线信息,但现有的资源往往不可靠或难以理解.
- 大型语言模型 (LLM) 提供了医疗信息传递的潜力,但需要验证准确性和患者教育.
研究的目的:
- 系统地评估GPT-4在为患者提供痕和状体的教育方面的表现.
- 重点领域包括准确性,可靠性,可读性和GPT-4生成的参考文献的质量.
- 评估GPT-4的实用性,作为一个患者教育工具,用于痕和状体管理.
主要方法:
- 从Reddit社区和医疗网站收集了354个关于痕和状体的问题.
- 将问题输入GPT-4以模拟现实世界的患者互动.
- 使用人工智能驱动的工具 (PEMAT-AI,DISCERN-AI,GQS,REA) 评估GPT-4反应,并通过专家外科医生对准确性,安全性和临床适当性进行审查.
主要成果:
- GPT-4显示出高准确度 (平均3.9/5) 和可靠性,具有良好的可理解性 (75.5%) 和信息质量 (4.28/5).
- 可读性中等 (12年级水平),表明需要简化.
- 11.8%的引用是幻觉,尽管95.1%的真实引用来自权威来源.
结论:
- GPT-4显示出作为治疗痕和状体的患者教育工具的巨大潜力,提供准确可靠的信息.
- 需要提高可读性 (针对6-8年级水平) 和减少参考幻觉.
- 优化LLM以简化语言和强大的参考验证将最大限度地提高它们在患者教育中的临床实用性.


