在内镜腰部手术中评估大型语言模型的性能:比较分析
Hao Li1, Cheng Zeng1, Lei Miao2
1Department of Orthopedics, Beijing Jishuitan Hospital, Capital Medical University, Beijing, PR China.
Annals of medicine and surgery (2012)
|August 11, 2025
概括
克劳德3.5索内特在为外科医生提供高质量,相关的内镜腰部手术信息方面表现出色. 然而,ChatGPT o1预览版是非医疗用户更喜欢的,因为它易于理解.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 脊椎外科 患者教育 患者教育
背景情况:
- 大型语言模型 (LLM) 显示了医疗保健中患者教育的潜力.
- 评估LLM在专业医疗领域的表现,如内镜腰部手术至关重要.
- 了解医疗专业人员和非专业人士之间的用户感知差异很重要.
研究的目的:
- 为了比较ChatGPT o1-preview,Claude 3.5 Sonnet,以及Gemini 1.5 Pro.的性能,我们需要使用
- 根据患者的问题,评估LLM生成的关于内镜腰部手术的信息.
- 为了评估脊柱外科医生和非医学志愿者的反应.
主要方法:
- 制定了关于内镜腰部手术的十个常见患者问题.
- 收集了三个LLM (ChatGPT o1-预览,克劳德 3.5 索内特,双子 1.5 Pro) 的答案.
- 脊椎外科医生对质量,可读性,相关性和人文关怀的反应进行了评价;非医学志愿者评估了可理解性和满意度.
主要成果:
- 克劳德3.5小说在整体质量,可读性和相关性方面获得了外科医生的最高分 (ICC:0.686).
- 在非医疗志愿者中,ChatGPT o1预览最受欢迎 (49%的赞同),其次是Gemini 1.5 Pro (29%) 和Claude 3.5 Sonnet (22%).
- 课内相关系数表明,在LLMs中,不同级别的评审者之间的可靠性不同.
结论:
- 克劳德3.5索内特为医疗专业人员提供了关于内镜腰部手术的优质信息.
- 对非专业用户来说,ChatGPT o1预览显示了更好的理解性和满意度.
- 在患者教育方面,LLM具有显著的潜力,但对医疗应用的技术和伦理考虑是必不可少的.


