人气的人工智能聊天机器人的准确性和可读性的比较分析,用于 Hernia 管理
Thisun Udagedara1, Ashley Tran1, Sumaya Bokhari2
1Division of Upper GI and General Surgery, Keck School of Medicine of USC, Los Angeles, CA, USA.
The American surgeon
|June 25, 2025
概括
与微软Copilot相比,Google Gemini和OpenAI ChatGPT-4在回答 inguinal hernia修复问题方面表现出更高的准确性. 虽然对外科医生有效,但高读数水平可能会影响患者的理解.
科学领域:
- 医疗信息学 医疗信息学
- 在外科手术中使用人工智能
- 临床决策支持 临床决策支持
背景情况:
- 大型语言模型 (LLM) 在临床环境中表现有前途,但它们在 inguinal hernia repair (IHR) 中的具体实用性尚未得到充分证实.
- 本研究通过评估准确性和可读性来解决了解IHR的LLM绩效的差距.
研究的目的:
- 评估三个领先的LLM (微软Copilot,Google Gemini,OpenAI ChatGPT-4) 对有关 inguinal hernia修复的问题产生的答案的准确性和可读性.
- 为了比较这些LLMs在IHR内的不同临床类别的表现.
主要方法:
- 根据临床指导方针制定了30个与IHR相关的问题,并分为诊断,术后护理,外科管理和其他类别.
- 来自Copilot,Gemini和ChatGPT-4的响应被六位最小侵入性外科医生评估,使用5点的利克尔特度表来确定准确度.
- 使用六种经过验证的公式来评估可读性.
主要成果:
- 吉普特-4和双子飞机的准确度比副驾驶飞机要高得多 (双子飞机:4.35 ± 0.82,吉普特-4:4.30 ± 0.89,副驾驶飞机:3.75 ± 0.99;P < 0.001).
- 双子座和GPT-4都在术后护理和外科管理类别中表现出色.
- 所有的LLM都产生了大学到大学毕业生阅读水平的响应,表明可比的可读性,但对患者有潜在的可访问性问题.
结论:
- 与微软Copilot相比,OpenAI ChatGPT-4和谷歌Gemini在 inguinal hernia修复查询中提供了更高的准确性.
- 在外科实践中,LLM显示出作为辅助工具的潜力,尽管它们的高阅读水平需要仔细考虑患者沟通.
- 预计LLM的未来进展将提高准确性,可读性和临床适用性.
更多相关视频
05:33Introduction of an Integrated Pathology Image Management, Artificial Intelligence, and Reporting System
Published on: July 11, 2025
275
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
594
