评估大型语言模型作为双眼手术的医学咨询工具:英语和中文的跨语言研究
Jiawei Xin1,2, Xiaoyu He3
1Department of Dermatology, Xiangya Hospital, Central South University, Changsha, 410008, China.
Aesthetic plastic surgery
|January 12, 2026
概括
大型语言模型 (LLM) 是双眼手术咨询的工具. 像ChatGPT-4o和Gemini-2.0-Flash这样的顶级模型在英语中表现良好,而DeepSeek-R1在中文评估中领先.
科学领域:
- 医学美学 医学美学
- 医疗保健中的人工智能
- 眼科医生 眼科 眼科
背景情况:
- 双眼手术是一种流行的整形手术.
- 高咨询量给整形外科医生带来负担.
- 大型语言模型 (LLM) 可以减轻这种负担.
研究的目的:
- 评估各种LLM在回答双眼手术常见问题的有效性.
- 为了比较英语和中文的LLM成绩.
- 为在整形外科咨询中利用LLM提供见解.
主要方法:
- 收集了16个关于双眼手术的常见问题.
- 使用英语和中文两种输入评估了15个LLM.
- 专家整形外科医生在专业性,患者友好性,信息性,实用性和清晰性方面获得了LLM的答案.
- 统计分析包括弗里德曼和Nemenyi测试.
主要成果:
- 在英语输入方面,ERNIE-Bot,ChatGPT-4o和Gemini-2.0-Flash表现最好.
- 对于中文输入,DeepSeek-R1,DeepSeek-V3,Gemini-2.0-Flash,和ERNIE-Bot都在使用.
- 几个LLM在语言和维度上表现明显较差.
结论:
- 在双眼手术中,LLM显示出作为有效的医疗咨询工具的潜力.
- 调查结果为寻求信息的英语和中文用户提供了指导.
- 未来的工作应该涉及专门的医疗数据微调和外科医生-LLM合作验证.


