领先的大型语言模型在回答复杂的鼻整形咨询问题的比较性能.
Khodayar Goshtasbi1,2, Corliss Best3, Bethany Powers4
1Department of Otolaryngology-Head and Neck Surgery, University of California, Irvine, California, USA.
Facial plastic surgery & aesthetic medicine
|January 15, 2025
概括
与其他大型语言模型 (LLM) 相比,Claude和ChatGPT在鼻整形咨询中表现出了卓越的知识. 整形外科医生评价克劳德回答复杂问题最高,其次是聊天GPT.
科学领域:
- 医疗人工智能 医疗人工智能
- 在医疗保健中的自然语言处理.
- 手术咨询平台 手术咨询平台
背景情况:
- 大型语言模型 (LLM) 显示了医学讨论的潜力,但缺乏在鼻整形等专业领域的比较分析.
- 在复杂的医疗场景中评估LLM响应的准确性和质量对于其安全应用至关重要.
研究的目的:
- 评估和比较领先的大型语言模型 (LLMs) 在回答复杂的鼻整形咨询问题方面的表现.
- 为了确定哪个LLM提供最准确和最有信息的答案,根据专家整形外科医生的判断.
主要方法:
- 对四名LLM提出了十个开放式的鼻整形问题:ChatGPT-4o,谷歌双子座,克劳德和Meta-AI.
- 答案是匿名的,随机的,并由七名专门从事鼻整形的整形外科医生进行排名.
- 分析了可读性指标,包括Flesch阅读易度 (FRE) 和Flesch-Kincaid等级 (FKG).
主要成果:
- 克劳德获得了最高的整体得分,在十个问题中的七个问题中排名为最佳模型.
- 接下来是ChatGPT-4o,它在三个问题上提供了最好的答案,并获得了第二高的总分.
- Meta-AI和Google Gemini的表现类似,Meta-AI的可读性得分 (FKG和FRE) 比Claude和ChatGPT要低得多.
结论:
- 根据专家外科医生评估,克劳德在回答复杂的鼻整形咨询问题方面表现出色.
- 聊天GPT-4o也表现出强的表现,超过了Meta-AI和谷歌双子座.
- 建议进行进一步的研究,以追踪LLM在专业医疗领域不断发展的能力.


