在口腔和面外科手术中对大型语言模型进行比较
Ricardo Grillo1, Alexandre Hugo Llanos2, Claudio Costa2
1Department of Oral and Maxillofacial Surgery, School of Dentistry, University of São Paulo, São Paulo, Brazil.
The British journal of oral & maxillofacial surgery
|October 11, 2025
概括
六个大型语言模型 (LLM) 被测试用于口腔和面外科手术 (OMFS) 内容生成. 人工智能显示出对OMFS任务的潜力,但由于可变的准确性和偶尔的幻觉,需要人类监督.
科学领域:
- 口腔和面外科手术 (OMFS)
- 人工智能 (AI) 在医学中的应用
背景情况:
- 大型语言模型 (LLM) 在各种领域越来越多地使用.
- 它们在OMFS等专业医疗领域的应用需要仔细评估.
研究的目的:
- 评估六个LLM在生成OMFS相关内容方面的表现.
- 评估五个不同的OMFS任务的准确性,全面性和相关性.
主要方法:
- 六名LLM被要求执行五项与OMFS相关的具体任务.
- 答案被评分为相关性,全面性和准确性.
- 统计分析 (克鲁斯卡尔-瓦利斯测试) 与LLM绩效进行比较.
主要成果:
- 总体而言,LLM的表现相似,在各个任务中都有不同的优缺点.
- 双子座和困惑在识别销书方面表现出色;ChatGPT和Copilot在引用文章方面扎.
- 对于系统审查的想法,Copilot和Claude是有效的;ChatGPT,Claude,Copilot和DeepSeek准确地确定了新兴趋势.
结论:
- 法律学士在支持OMFS的临床,学术和研究任务方面显示出显著的潜力.
- 人类的监督是至关重要的,因为精度和幻觉的可能性受到限制.
- 人工智能应该被整合为一个补充工具,补充OMFS的人类专业知识.


