聊天GPT生成的头部和部和口面部手术信息的准确性:一个多中心协作分析
Luigi Angelo Vaira1,2, Jerome R Lechien3,4, Vincenzo Abbate5
1Maxillofacial Surgery Operative Unit, Department of Medicine, Surgery and Pharmacy, University of Sassari, Sassari, Italy.
概括
人工智能 (AI) 在回答头手术问题方面表现出高准确度,但在临床场景中存在局限性. 虽然有希望,但人工智能尚未成为专家可靠的决策工具.
科学领域:
- 医疗人工智能 医疗人工智能
- 外科教育的外科教育
- 头部和部手术 头部和部手术
背景情况:
- 人工智能 (AI) 的快速发展为医疗应用提供了机会.
- 像ChatGPT (聊天式生成预训练变压器) 这样的大型语言模型正在越来越多地被探索其在临床环境中的潜力.
- 在头部和部手术等专业领域评估AI的准确性至关重要.
研究的目的:
- 评估ChatGPT4对头手术问题和临床情景的答案的准确性和完整性.
- 评估人工智能模型提供的参考资料的质量.
- 确定AI作为头部和部外科医生的决策支持工具的潜在实用性.
主要方法:
- 一项观察和评价研究,涉及来自意大利14个头手术单位的18名外科医生.
- 开发了144个临床问题和15个临床场景,涵盖了头部和部手术的子专业.
- 在ChatGPT4中输入问题和场景,并使用Likert尺度对答案的准确性,完整性和参考质量进行评估.
主要成果:
- 在开放式问题上,ChatGPT4获得了高准确性 (中位数为6/6) 和完整性 (中位数为3/3),其中87.2%的答案被评为几乎完全正确.
- 人工智能模型正确回答了84.7%的闭式问题,并在81.7%的临床场景中提供了完全或几乎完全正确的诊断.
- 然而,文献参考资料的质量很差,在46.4%的案例中,来源不存在,在56.7%的案例中,建议的程序被认为是完整的.
结论:
- 聊天GPT4在回答与头部和部手术相关的查询方面表现出良好的准确度.
- 人工智能处理复杂临床场景的能力是有希望的,但需要进一步发展.
- 目前,人工智能还不能成为头手术专家可靠的决策支持工具,因为其完整性和参考可靠性受到限制.


