大型语言模型在周植入体疾病:它们的表现如何?
Vasiliki P Koidou1, Georgios S Chatzopoulos2, Lazaros Tsalikis3
1Research Associate, Centre for Oral Immunobiology and Regenerative Medicine and Centre for Oral Clinical Research, Institute of Dentistry, Queen Mary University of London (QMUL), London, England, UK.
The Journal of prosthetic dentistry
|March 7, 2025
概括
在对植入牙科问题进行评估的四个大型语言模型 (LLM) 中,Google Gemini Advanced表现最好. 然而,由于潜在的不准确性,牙科专业人员必须在患者护理中谨慎使用AI工具.
科学领域:
- 牙科 牙科是指牙科的专业.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 对医学和牙科的临床应用有希望.
- 评估LLM业绩至关重要,以防止不准确和潜在的伤害.
研究的目的:
- 评估和比较四个LLM关于植入牙科的答案的基于证据的质量.
- 专注于与周围植入物疾病预防和治疗相关的临床问题.
主要方法:
- 关于植入周围疾病的十个开放式问题被提出给ChatGPT 4.0,谷歌双子,谷歌双子高级和微软Copilot.
- 两名牙周科医生独立评估了LLM的准确性,全面性,清晰性和相关性,分数从0到10分.
- 在Cronbach的alpha和类间相关系数的使用中证实了评估者内部的可靠性.
主要成果:
- 谷歌双子高级获得了最高的平均得分,而谷歌双子获得了最低的平均得分.
- 谷歌双子高级和谷歌双子之间的性能差异在统计学上是显著的 (P=.005).
- 审查员得分显示了高的评估者内部可靠性.
结论:
- 牙科专业人员在使用LLM获取围植疾病信息时应谨慎使用.
- 目前的LLM不能取代牙科专业人员,并且需要在患者护理中仔细考虑.
- 需要进一步的研究来完善专业牙科领域的LLM准确性.


