牙科执照考试中的大型语言模型:系统审查和元分析
Mingxin Liu1, Tsuyoshi Okuhara2, Wenbo Huang3
1Department of Health Communication, Graduate School of Medicine, The University of Tokyo, Bunkyo, Tokyo, Japan.
International dental journal
|November 12, 2024
概括
大型语言模型 (LLM) 对牙科教育有希望,但目前的许可证考试的准确性不足以用于临床使用. GPT-4表现最好,尽管需要更多牙科专用培训数据.
科学领域:
- 人工智能在牙科中的应用
- 医疗教育 技术 技术 医学教育
背景情况:
- 大型语言模型 (LLM) 越来越多地融入到各种专业领域.
- 它们在牙科等专业领域的应用需要严格的评估.
研究的目的:
- 系统地审查和对LLMs在全球牙科执照考试中的表现进行元分析.
- 在不同的语言和地理背景下评估LLM准确性.
- 为了告知牙科教育和诊断的潜在应用.
主要方法:
- 按照PRISMA指南进行系统审查和元分析.
- 在PubMed,科学网和Scopus (2022年1月至2024年5月) 进行的搜索.
- 使用QUADAS-2进行质量评估,并进行定性和定量性能分析.
主要成果:
- 包括来自8个国家的11项研究.
- GPT-4的准确度达到了72%,超过了GPT-3.5 (54%) 和Bard (56%).
- GPT-3.5在英语地区表现更好;GPT-4的表现在全球范围内是一致的.
结论:
- LLM,特别是GPT-4,显示出潜力,但缺乏当前临床牙科应用的准确性.
- 牙科培训数据不足和基于图像的诊断方面的挑战限制了LLM的表现.
- 目前的LLM还不适合牙科教育或临床诊断.


