评估大型语言模型在指导牙科从业人员对儿科患者护理方面的实用性:比较AI研究
Mithula Raj1, Vignesh Ravindran2, Abirami Arthanari3
1Post graduate, Dept of Pediatric and Preventive Dentistry, Saveetha Dental College & Hospitals, Saveetha Institute of Medical and Technical Sciences, Saveetha University, Chennai, Tamil Nadu, India.
聊天GPT-4o在评估儿科牙科查询方面表现出色,在九个大型语言模型 (LLM) 中提供了卓越的临床质量和独创性. 这突出了人工智能.
科学领域:
- 人工智能在牙科中的应用
- 自然语言处理应用程序
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地用于临床决策支持.
- 在儿科牙科中LLM的有效性在各种平台上尚未得到充分证实.
- 在儿科牙科背景下对LLM绩效进行比较分析的需要.
研究的目的:
- 为了比较9个儿童牙科问题的临床质量,可读性和原创性.
- 评估当代LLM的表现,包括ChatGPT,Gemini,Claude,Grok和DeepSeek. 这就是我们的目标.
主要方法:
- 横截面研究评估了九个LLM (ChatGPT-3.5,ChatGPT-4o,双子座2.0,双子座2.5,克劳德3.5海库,克劳德3.7索内特,格洛克-3,格洛克-3迷你,深度搜索-V3).
- 20个儿科牙科问题作为一次性查询.
- 专家评估使用修改的全球质量尺度 (MGQS),弗莱什阅读易度得分 (FRES),弗莱什-金凯德分级水平 (FKGL) 和特尔尼丁相似度指数;通过ANOVA和科恩的卡帕进行统计分析.
主要成果:
- 聊天GPT-4o获得了最高的整体临床质量 (MGQS:4.28 ± 0.24),超过了所有其他模型.
- 最低的分数是DeepSeek-V3 (2.18 ± 0.19);其次是ChatGPT-3.5,其次是ChatGPT-4o.
- 观察到中度可读性 (FRES/FKGL),克劳德模型显示较高的语言复杂性;跨模型的低至中度响应相似性;实质性的评审者间一致性 (κ = 0.78).
结论:
- 聊天GPT-4o表现出卓越的临床相关性,连贯性和独创性,表明作为儿科牙科决策辅助的潜力.
- 在LLM表现的变化需要批判性评估和谨慎的整合到临床工作流程.
- 未来的研究应该探索进一步的应用,并完善专业牙科领域的LLM整合.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
相关概念视频
Ethics in Research
The Stanford Prison Experiment
Bullying
Sex Linked Disorders
Sexually Transmitted Infections
Conduct Disorder
