评估大型语言模型在牙周内科临床决策中的表现
Yağız Özbay1, Deniz Erdoğan2, Gözde Akbal Dinçer3
1Department of Endodontics, Faculty of Dentistry, Karabük University, Karabük, Türkiye. yagiz_ozbay@hotmail.com.
BMC oral health
|April 28, 2025
概括
与ChatGPT-3.5和谷歌Bard相比,ChatGPT-4在牙周内科中表现出更高的准确性. 虽然先进的大型语言模型 (LLM) 是有前途的,但它们在临床环境中仍然会产生一些不准确的信息.
科学领域:
- 牙科 牙科是指牙科的专业.
- 人工智能的人工智能
背景情况:
- 生成型人工智能大语言模型 (LLM) 越来越多地用于医疗保健,包括牙周内科.
- 人工智能产生的信息对于临床决策的准确性存在担忧.
- 评估内牙科LLM的表现对于安全有效的整合至关重要.
研究的目的:
- 为了比较谷歌Bard,ChatGPT-3.5和ChatGPT-4在回答内牙科问题的准确性.
- 评估内牙科不同LLM的错误信息率.
主要方法:
- 在谷歌Bard,ChatGPT-3.5和ChatGPT-4上提出了40个临床相关的内牙问题.
- 通过使用Lawshe内容有效性指数证实了问题的有效性.
- 两个失明的内牙科医生用3点的利克特度表来评估聊天机器人的准确性.
主要成果:
- 聊天GPT-4获得了最高的准确度得分和最低的错误信息率.
- 在ChatGPT-4和谷歌Bard (P=0.004) 之间发现了统计学上显著的差异.
- 聊天GPT-3.5的表现比谷歌巴德更好,但比聊天GPT-4.
结论:
- 聊天GPT-4为内牙科查询提供了更准确和更有信息的答案.
- 所有评估的LLM都表现出不同程度的不完整或不正确答案.
- 需要进一步的研究来完善临床内牙科应用的LLM准确性.


