机器人的战斗:评估四个大型语言模型处理不同手术主题的能力
1Department of Surgery, American University of Beirut Medical Center, Beirut, Lebanon.
The American surgeon
|May 27, 2025
概括
在手术问题上,ChatGPT 4.0的表现优于谷歌巴德和医疗聊天,显示了与Copilot AI相似的结果. 这项研究评估了各种手术主题的大型语言模型聊天机器人的性能.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 进行外科手术培训.
背景情况:
- 大型语言模型 (LLM) 聊天机器人越来越多地被整合到各种专业领域.
- 它们在外科手术等专业领域的应用需要严格的性能评估.
- 了解聊天机器人的功能对于有效融入外科教育和实践至关重要.
研究的目的:
- 为了比较四个不同的大型语言模型聊天机器人的性能:ChatGPT 4.0,医疗聊天,谷歌巴德和Copilot AI.
- 评估聊天机器人的表现,涉及多种不同的手术主题和问题类别.
- 确定每个聊天机器人在响应外科查询时的优缺点.
主要方法:
- 使用了114个涉及9个主题的多项选择手术问题.
- 这些问题是向ChatGPT 4.0,医疗聊天,谷歌Bard和Copilot AI提出的.
- 聊天机器人响应被记录并分析成绩指标.
主要成果:
- 与谷歌巴德 (P < 0.0001) 和医疗聊天 (P = 0.0013) 相比,ChatGPT 4.0的性能明显优越.
- 在ChatGPT 4.0和Copilot AI之间没有观察到显著的性能差异 (P = 0.9663).
- 对于耳鼻喉 (ENT) (P = 0.0199) 和胃肠道 (GI) (P = 0.0124) 问题,以及巴德的诊断和管理问题 (P = 0.0281) 的表现有显著差异.
结论:
- 这项研究为手术领域中不同LLM聊天机器人的性能提供了宝贵的见解.
- 识别特定的聊天机器人的优点和局限性,可以指导它们在外科教育和临床决策支持中的最佳使用.
- 进一步的研究可以完善人工智能工具的应用,以加强外科培训和知识传播.


