评估聊天生成器预训练变压器对有关先天性上肢差异的常见患者问题的反应的准确性
Niklaus P Zeller1, Ayush D Shah1, Ann E Van Heest1,2
1University of Minnesota Medical School, Minneapolis, MN.
Journal of hand surgery global online
|June 16, 2025
概括
聊天生成预训练变压器 (ChatGPT) 4.0为患者关于先天性上肢差异 (CULD) 的问题提供了可靠的答案. 然而,反应的深度各不相同,很少将患者指导到手术医生,因此需要谨慎使用CULDs信息.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 儿科整形外科 儿科整形外科
背景情况:
- 先天性上肢差异 (CULDs) 对患者和家人来说是一个独特的挑战.
- 准确和可访问的信息对于管理CULD和治疗选择至关重要.
- 像ChatGPT这样的大型语言模型 (LLM) 提供了患者教育的潜力,但需要验证.
研究的目的:
- 评估ChatGPT 4.0在回答关于CULDs的常见问题时的准确性和可靠性.
- 评估ChatGPT 4.0关于CULD及其治疗的响应质量.
主要方法:
- 两位儿科手术医生发现了父母关于CULDs的常见FAQ.
- 十六个常见问题,涵盖sydactyly,多指纹,辐射纵向缺陷,指hypoplasia,和一般的CULDs被输入到ChatGPT-4.0.0.
- 响应以1至4的质量评级,使用独立聊天来防止偏见.
主要成果:
- 聊天GPT 4.0为CULDs常见问题提供了主要可靠的,基于证据的答案,51%不需要澄清.
- 观察到响应深度的显著变化,只有8%的响应被评为不满意.
- 聊天GPT经常建议咨询医疗保健提供者 (81次),但很少将患者推给手术医生 (9次).
结论:
- 聊天GPT 4.0可以为大多数CULD的常见问题提供基于证据的答案.
- 响应的可变性,全面性和向手部外科医生转诊率低,表明需要谨慎.
- 应谨慎使用LLM作为CULDs的患者教育工具,因为信息可能不总是个性化或全面的.


