人工智能在植入牙科的可靠性:对跨多种语言模型的临床准确性和幻觉模式进行比较分析
1Professor, Department of Periodontology, School of Dentistry, Tehran University of Medical Sciences, Tehran, Iran.
The Journal of prosthetic dentistry
|November 20, 2025
概括
检索增强的人工智能系统在植入牙科中显示高精度,零制造,与幻觉的传统模型不同. 提示可以改进较旧的AI,但不能改进新的AI或RAG系统.
科学领域:
- 牙科植入物学 牙科植入物学
- 医疗保健中的人工智能
- 生物医学信息学 生物医学信息学
背景情况:
- 人工智能 (AI) 语言模型在植入式牙科中越来越多地用于临床决策和学术写作.
- 不同的人工智能模型的可靠性和制造率尚未确立,这给基于证据的实践带来了风险.
研究的目的:
- 在植入牙科中评估各种AI模型的准确性.
- 评估人工智能在基于证据的提示下产生虚假信息的频率.
主要方法:
- 一项横截面的比较研究评估了五种人工智能模型:GPT-4o,模型4.1,模型4.5,ScholarQA和OpenEvidence.
- 在基于证据的提示条件下,模型被测试了15个植入式牙科临床问题.
- 对传统的大型语言模型和检索增强生成 (RAG) 系统分析了临床准确性和幻觉模式,包括伪造的引用.
主要成果:
- 检索增强生成 (RAG) 系统 (ScholarQA,OpenEvidence) 实现了80%的准确性,制造率为0%.
- GPT-4o具有较高的参考率 (82%) 和统计制造率 (85.7%),而较新的模型显示制造率增加.
- 基于证据的提示提高了GPT-4o的准确性,但没有减少制造;RAG系统显示的响应最小.
结论:
- 传统的生成人工智能模型经常产生幻觉,包括伪造的引用和数据.
- 检索增强系统避免了伪造的引用,但仍然产生了不正确的解释.
- 幻觉仍然是人工智能在临床和学术环境中使用的障碍;促使旧模型比新的或RAG系统更受益.


