评估ChatGPT在解决甲状腺癌患者查询方面的能力:全面的混合方法评估
Matthew A Gorris1, Reese W Randle2, Corey S Obermiller3
1Division of Endocrinology and Metabolism, Wake Forest University School of Medicine, Winston Salem, NC 27101, USA.
Journal of the Endocrine Society
|January 30, 2025
概括
聊天GPT提供了关于甲状腺癌的不准确和不完整的信息,使其不可靠的患者使用. 专家评估显示,AI产生的甲状腺癌内容在准确性,完整性和满意度方面存在重大缺陷.
科学领域:
- 在瘤学瘤学.
- 内分泌学 在内分泌学.
- 医疗保健中的人工智能
背景情况:
- 患有甲状腺癌的患者经常有未满足的信息需求.
- 在线资源,包括像ChatGPT这样的生成AI,越来越多地被患者用于健康信息.
研究的目的:
- 评估ChatGPT对甲状腺癌相关查询的响应质量和可靠性.
主要方法:
- 对ChatGPT提出了20个甲状腺癌问题.
- 八名甲状腺癌专家 (内分泌学家和内分泌外科医生) 评估了反应.
- 评估包括准确性,完整性和满意度,使用7点的利克特等级和评论的定性分析.
主要成果:
- 只有57%的答案被认为是准确的,56%是完整的,52%是令人满意的.
- 对198条评论的定性分析显示,经常存在批评.
- 关键问题包括过度强调饮食/以及关于手术和放射性治疗风险的不准确/不完整信息.
结论:
- 关于甲状腺癌信息,ChatGPT目前的性能对于无监督患者使用是不够的.
- 人工智能工具在准确性和完整性方面需要显著改进,才能成为甲状腺癌患者可靠的资源.


