牙周科的大型语言模型:评估它们在临床相关问题上的表现
Georgios S Chatzopoulos1, Vasiliki P Koidou2, Lazaros Tsalikis3
1PhD candidate, Department of Preventive Dentistry, Periodontology and Implant Biology, School of Dentistry, Aristotle University of Thessaloniki, Thessaloniki, Greece; and Visiting Research Assistant Professor, Division of Periodontology, Department of Developmental and Surgical Sciences, School of Dentistry, University of Minnesota, Minneapolis, Minn.
The Journal of prosthetic dentistry
|November 19, 2024
概括
这项研究评估了牙周信息的大型语言模型 (LLM). 聊天GPT 4.0表现出最高的性能,提供全面和准确的答案,而其他模型显示出不同的结果.
科学领域:
- 牙周病学 牙周病学
- 人工智能在牙科中的应用
- 大型语言模型 (LLM)
背景情况:
- 人工智能 (AI) 对临床牙科有希望,但不准确的反应会带来重大风险.
- 访问牙周信息的大型语言模型 (LLM) 的可靠性需要研究.
研究的目的:
- 评估和比较四个LLM对常见临床牙周病学问题的答案的基于证据的潜力.
- 评估LLM产生的答案的全面性,科学准确性,清晰性和相关性.
主要方法:
- 对ChatGPT 4.0,谷歌双子,谷歌双子高级和微软Copilot提出了十个开放式牙周学问题.
- 两个牙周科医生独立评估了使用预定义标题的答案,分数从0-10.
- 评估者内部和评估者间的可靠性被评估,Kruskal-Wallis测试比较了LLM成绩.
主要成果:
- 聊天GPT 4.0获得了最高的平均分数,在统计学上显著优于谷歌双子 (P=.042).
- 评估人员发现ChatGPT 4.0的答案非常全面,科学准确,清晰和相关.
- 所有测试的LLM都表现相对良好,但质量上有显著差异.
结论:
- 专业人士必须认识到LLM的局限性;这些工具不应该取代牙科专业人员,以避免对患者护理产生负面影响.
- 在评估的LLM中,ChatGPT 4.0在与牙周相关的查询中表现最高.
- 需要继续进行研究,以确保LLMs在牙科实践中安全有效地整合.


