评估六个大型语言模型在儿科牙科的基于证据的潜力:对生成人工智能的比较研究
Anastasia Dermata1, Aristidis Arhakis2, Miltiadis A Makrygiannakis3,4
1School of Dentistry, Aristotle University of Thessaloniki, 54124, Thessaloniki, Greece.
概括
大型语言模型 (LLM) 在儿科牙科中显示出潜力,但需要严格使用. 在评估的AI工具中,ChatGPT 4显示出最高的诊断准确性和临床适用性.
科学领域:
- 人工智能在牙科中的应用
- 儿科牙科应用 儿科牙科应用
- 大型语言模型 (LLM)
背景情况:
- 生成型人工智能 (AI) 和大型语言模型 (LLM) 越来越多地用于牙科.
- 在儿童牙科等专业领域,LLM的可靠性和诊断准确性在很大程度上仍未得到验证.
- 评估人工智能工具对于其安全有效地融入临床实践至关重要.
研究的目的:
- 评估六种不同儿童牙科LLM的诊断准确性,临床适用性和患者教育潜力.
- 为了比较谷歌AI的Gemini和Gemini Advanced,OpenAI的ChatGPT-3.5,-4o和-4以及微软的Copilot的性能.
- 确定最可靠的LLM来支持基于证据的儿科牙科护理.
主要方法:
- 对六名法学士提出了与儿科牙科相关的10个临床问题.
- 两位独立专家使用详细的分数表 (0-10) 评估了答案.
- 包括弗里德曼和克鲁斯卡尔-瓦利斯测试在内的统计分析被用来比较LLM的性能和可靠性.
主要成果:
- 聊天GPT 4获得了最高的平均得分 (8.08),表明在准确性,全面性和相关性方面表现优越.
- 双子座高级 (8.06) 和ChatGPT 4o (8.01) 也表现出强的性能,优于其他模型.
- 虽然存在差异,但大多数LLM (除Copilot外) 的得分都高于6.5,表明一般效用,但ChatGPT 4显示出统计学上显著的优势.
结论:
- 法律学士学位表现有前途,作为基于证据的儿科牙科的支持工具.
- 目前的LLM不能被认为是完全值得信赖的,不应该取代专业判断或科学知识.
- 牙科专业人员必须批判性地评估人工智能生成的信息,并使用LLM作为补充资源.
更多相关视频
07:32Author Spotlight: 3D Movement Assessment of Maxillary Posterior Teeth in Clear Aligner Treatment
Published on: February 23, 2024
1.1K
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
7.5K
