评估不同大型语言模型在整形和美容手术上的表现:一个横截面盲目的研究
Hengqing Cui1,2, Ziqi Zhang1,2, Jun Zhang1,2
1Department of Plastic and Cosmetic Surgery, School of Medicine, Tongji Hospital, Tongji University, Shanghai, 200092, China.
Aesthetic plastic surgery
|November 1, 2025
概括
在对美容整形手术大型语言模型 (LLM) 的研究中,DeepSeek R1的表现优于GPT-4o和Claude 3.5,表现出卓越的全面性和人文关怀. 这项研究指导了临床决策支持和整形外科患者咨询的LLM选择.
科学领域:
- 人工智能在医学中的应用
- 医疗信息学 医疗信息学
- 整形外科的应用 整形外科的应用
背景情况:
- 大型语言模型 (LLM) 在医学上表现有前途,但在美容整形手术中未得到充分探索.
- 整形手术需要医学知识,审美判断和沟通技能的融合.
- 对LLM的系统评估对于临床决策支持和在该领域的患者咨询至关重要.
研究的目的:
- 评估GPT-4o,DeepSeek R1和Claude 3.5在美容整形手术中的功能.
- 评估面部美学,身体轮和非手术干预的表现.
- 为LLM选择提供基于证据的建议,并为未来的模型开发提供信息.
主要方法:
- 开发了125个问题,涵盖多选题,案例分析,指导方针和咨询.
- 使用盲目的整形外科专家评估LLM反应.
- 根据准确性,全面性,可读性,人文关怀和伦理性来评估答复.
主要成果:
- 深度搜索R1显示性能优于或与GPT-4o和Claude 3.5.5相提并论.
- 深度搜索R1在全面性 (P=0.04),可读性 (P<0.001) 和人文关怀 (P<0.001) 方面表现出色.
- 克劳德3.5的可信度和全面性得分较低,限制了其临床决策支持的可靠性.
结论:
- 在全面性,可读性和人文关怀方面,DeepSeek R1表现出卓越.
- GPT-4o在科学准确性和安全性方面表现出优势.
- 克劳德3.5在逻辑连贯性方面表现出相对强项,但在可信度方面存在局限性.


