人工智能大型语言模型链接聊天机器人的性能在胃食道逆流病的手术决策中
Bright Huo1, Elisa Calabrese2, Patricia Sylla3
1Division of General Surgery, Department of Surgery, McMaster University, Hamilton, ON, Canada.
Surgical endoscopy
|April 17, 2024
概括
大型语言模型 (LLM) 聊天机器人显示了胃食道逆流病 (GERD) 手术中的临床建议的潜力. 然而,准确性各不相同,这凸显了需要用基于证据的数据进行进一步的LLM培训的需要.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 手术指南 手术指南
背景情况:
- 大型语言模型 (LLM) 提供了作为临床建议有效来源的潜力.
- 这项研究评估了LLM聊天机器人的性能,以指导胃食道逆流症 (GERD) 的外科治疗.
研究的目的:
- 评估各种LLM聊天机器人的准确性,为GERD手术管理提供建议.
- 将聊天机器人的性能与美国胃肠道和内镜外科医生协会 (SAGES) 的指导方针进行比较.
主要方法:
- 根据GERD手术治疗的SAGES指南,开发了9例患者病例.
- 查询了ChatGPT-3.5,ChatGPT-4,Copilot,Google Bard和Perplexity AI的管理建议,并进行了查询.
- 准确的响应被定义为符合SAGES指南的响应.
主要成果:
- 谷歌巴德为成人外科管理提供了最准确的建议 (85.7%的KQ).
- 对于儿科手术管理,Copilot和谷歌巴德实现了100%的准确性.
- 在聊天机器人中,患者指导的准确性差异很大,谷歌Bard和ChatGPT-4显示出更高的性能.
结论:
- 在咨询GERD手术管理方面,LLM聊天机器人既有前途又有局限性.
- 医疗保健提供者和患者应批判性地评估LLM产生的建议.
- 为提高可靠性,对LLM提供基于证据的健康信息的加强培训至关重要.


