整形外科手术中手术内决策支持的大型语言模型:聊天GPT-4和双子座之间的比较
Cesar A Gomez-Cabello1, Sahar Borna1, Sophia M Pressman1
1Division of Plastic Surgery, Mayo Clinic, 4500 San Pablo Rd S, Jacksonville, FL 32224, USA.
Medicina (Kaunas, Lithuania)
|June 27, 2024
概括
与Gemini Pro相比,ChatGPT-4在整形手术决策支持方面表现出更高的准确性和相关性,尽管这两种大型语言模型 (LLM) 都显示出在手术内使用的潜力.
科学领域:
- 人工智能在医学中的应用
- 手术决策支持系统 手术决策支持系统
- 整形和重建手术 整形和重建手术
背景情况:
- 大型语言模型 (LLM) 越来越多地被认为具有帮助外科医生的潜力,通过减少认知负载和提高患者的治疗结果来帮助外科医生.
- 人工智能工具在外科实践中的整合是一个快速发展的领域.
研究的目的:
- 评估和比较OpenAI的ChatGPT-4和谷歌的Gemini Pro (1.0 Pro) 作为在整形和重建手术中的手术内决策支持工具的性能.
- 评估LLM对外科手术场景产生的反应的准确性,相关性,可读性和响应时间.
主要方法:
- 从五项整形手术手术中提出了32个手术内情景,这些情景向ChatGPT-4和Gemini Pro展示.
- 通过使用利克特尺度来评估答案的医学准确性和相关性.
- 使用弗莱什-金凯德等级水平 (FKGL) 和弗莱什阅读易度 (FRE) 评分来评估可读性.
- 记录和比较使用统计测试 (曼-惠特尼U和学生的t-测试) 的响应时间.
主要成果:
- 聊天GPT-4提供比双子Pro.显著更准确 (p=0.022) 和相关 (p=0.032) 的响应.
- 双子Pro提供了更可读的响应,具有显著较低的FKGL (p < 0.0001) 和更快的响应时间 (p < 0.0001).
- 两种模型之间的Flesch阅读易度得分没有发现显著差异 (p=0.174).
结论:
- 虽然ChatGPT-4在准确性和相关性方面表现出色,但这两种LLM都显示出在整形外科手术中作为术内决策支持工具的前景.
- 性能不一致凸显了需要进一步优化和培训,以确保这些AI工具在临床环境中的可靠性.


