最新的大型语言模型在回答牙科多选题时的准确性:一项比较研究
Huy Cong Nguyen1, Hai Phong Dang1, Thuy Linh Nguyen1
1Faculty of Dentistry, PHENIKAA University, Hanoi, Vietnam.
PloS one
|January 29, 2025
概括
最新的大型语言模型 (LLM) 在牙科多选题 (MCQ) 上表现不同. 像Copilot,Claude和ChatGPT这样的顶级LLM在基于文本的问题上表现出色,而基于图像的问题的性能需要改进.
科学领域:
- 人工智能在牙科中的应用
- 用于医学教育的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在各种专业领域越来越多地被使用.
- 评估LLM在牙科等专业领域的表现对于采用至关重要.
研究的目的:
- 评估最近的大型语言模型 (LLM) 在回答牙科多选题 (MCQ) 中的准确性.
- 为了比较六个领先的LLM在基于文本和基于图像的牙科MCQ上的表现.
主要方法:
- 从董事会审查书中使用了1490个牙科MCQ.
- 六个高级的LLM (ChatGPT 4.0 omni,Gemini Advanced 1.5 Pro,Copilot Pro,Claude 3.5 Sonnet,Mistral Large 2,Llama 3.1 405b) 被评价. 这是一个非常好的项目.
- 统计分析 (χ2测试) 确定了准确度的显著差异 (p < 0.05).
主要成果:
- 在6个LLM中,在总数,基于文本和基于图像的MCQ中发现了显著的性能差异 (p<0.001).
- 副驾驶 (85.5%),克劳德 (84.0%) 和聊天GPT (83.8%) 实现了最高的整体准确度.
- 拉玛 (72.4%) 的准确性最低,所有测试的LLM在基于文本的问题上表现更好,而不是基于图像的问题.
结论:
- 较新的LLM在回答牙科MCQ方面表现出更强大的能力.
- 领先的LLM显示出对文本的高准确性,但对基于图像的牙科问题的准确性较低.
- 牙科专业人员和学生应利用最新的LLMs进行教育和临床支持.


