试验新的前沿:人工智能驱动的聊天机器人在手术中进行手术
Zayd M Al Rawi1, Benjamin J Kirby2, Peter A Albrecht3
1University of Missouri School of Medicine, Columbia, USA.
概括
人工智能 (AI) 大型语言模型正确地回答大多数手术问题,但完整性和有用性各不相同. 需要进一步改进,以确保患者安全,并防止人工智能产生的医疗建议中的错误信息.
科学领域:
- 整形外科 整形外科 整形外科
- 人工智能在医学中的应用
- 医疗信息系统 医疗信息系统
背景情况:
- 患者和医疗专业人员越来越多地使用AI和大型语言模型 (LLM).
- 需要评估人工智能对常见手术查询的反应的准确性.
- 假设:LLM主要为手术问题提供正确的答案.
研究的目的:
- 评估人工智能生成的手术问题的答案的准确性,完整性和有用性.
- 评估AI响应质量的评审者间协议.
- 告知医学界关于人工智能在手术中的能力和局限性.
主要方法:
- 编制了56个手术问题,基于格林的手术手术,第8版.
- 对ChatGPT (OpenAI) 提出问题.
- 两个独立的手术医生审查了回应的准确性,完整性和有用性,使用科恩的卡帕进行协议分析.
主要成果:
- 聊天GPT为80%的问题提供了正确的答案 (45/56).
- 70%的回答被认为是有用的 (39/56) 和57%的回答被认为是完整的 (32/56).
- 观察到公平到适度的互评协议 (科恩的卡帕),对正确性,有用性和完整性存在分歧.
结论:
- 根据响应质量,LLM显示有潜力影响患者的感知和转诊模式.
- 虽然一般准确,但人工智能响应需要完整性和精度的提高.
- 手术医生和社会必须与人工智能开发人员合作,以确保患者的安全和准确的医疗信息.


