从基于证据的内科医疗到生成人工智能:对11个大型语言模型的比较研究
Lucas Peixoto de Araújo1, Laura Barreto Moreno2, Bruna Cavalcante Chaves de Araújo1
1Department of Cariology, Restorative Sciences, and Endodontics, School of Dentistry, University of Michigan, Ann Arbor, Michigan, USA.
生成型大语言模型 (LLM) 在内牙诊断中显示出高精度,与美国内牙医协会 (AAE) 和欧洲内牙学会 (ESE) 的指导方针保持一致. 然而,性能各不相同,因此在临床使用前需要专家监督.
科学领域:
- 牙科诊断 牙科诊断 牙科诊断
- 医学中的人工智能
- 牙周内科医院 牙周内科医院 牙周内科医院
背景情况:
- 生成型大语言模型 (LLM) 越来越多地用于牙科.
- 基于临床指南的LLMs的诊断准确性和可重复性尚未得到充分证实.
- 美国内脏病学会 (AAE) 和欧洲内脏病学会 (ESE) 的权威立场声明提供了基于证据的标准来评估内脏病学LLM绩效.
研究的目的:
- 评估各种生成型大语言模型 (LLM) 的诊断准确性和可重复性.
- 将LLM的绩效与AAE和ESE的既定内牙指南进行比较.
- 识别LLM成果的变化及其与内牙科最佳实践的协调.
主要方法:
- 这项研究遵循了TRIPOD-LLM指南,评估了11个LLM,包括ChatGPT,Gemini,Claude,Perplexity和DeepSeek模型.
- 从AAE和ESE的立场陈述中提取的60个多选题,在每一个LLM中进行了五轮的管理,产生了3300个答案.
- 主要结局是完全正确的准确性;次要结局是模型内部的一致性,使用千平方测试和邦费罗尼调整进行分析.
主要成果:
- 在11个LLM中观察到所有正确度的显著变化 (χ2 = 50.56,df = 10,p < 0.001).
- 聊天GPT 4o和Claude Opus 4获得了最高准确率的95.0%,而DeepSeek的表现最低,为63.3%.
- 在大多数模型中,模型内部一致性通常超过90%,尽管DeepSeek的一致性较低,为75.0%.
结论:
- 大多数评估的LLM在与AAE和ESE内牙指南进行基准比较时,显示出高的诊断准确性和可重复性.
- 尽管取得了进步,但性能变化和潜在的自信错误输出强调了严格验证的必要性.
- 专家监督对于LLMs在内牙科的安全和有效临床整合至关重要.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
06:16Involving Individuals with Developmental Language Disorder and Their Parents/Carers in Research Priority Setting
Published on: June 6, 2020
相关概念视频
The Evidence for Evolution
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Components of Language
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...
Language and Cognition
Comparative Excretory Systems
