人工智能聊天机器人在脉和近根诊断中的比较准确性:一个横截面研究
João Daniel Mendonça de Moura1, Carlos Eduardo Fontana2, Vitor Henrique Reis da Silva Lima3
1Postgraduate Program in Clinical Dentistry, University Center of Pará (CESUPA), Belém, Pará, Brazil.
Computers in biology and medicine
|October 29, 2024
概括
该研究评估了AI聊天机器人用于诊断牙科疾病,发现Bing和ChatGPT 4.0是最准确的. 牙医必须批判性地解释人工智能聊天机器人的输出,以获得可靠的临床应用.
科学领域:
- 人工智能在牙科中的应用
- 人工智能聊天机器人的诊断准确性
- 牙周内病例分析
背景情况:
- 人工智能 (AI) 聊天机器人越来越多地用于医疗保健.
- 它们在牙科中的诊断和治疗建议能力需要彻底评估.
- 了解人工智能在脉和根周疾病病例中的表现至关重要.
研究的目的:
- 评估四个人工智能聊天机器人的诊断准确性 (ChatGPT 3.5,ChatGPT 4.0,Bard,Bing) 针对虚构的脉和周根性疾病.
- 为了评估他们的治疗建议表现.
- 调查聊天机器人响应的一致性和输入变化的影响 (语言,数据顺序).
主要方法:
- 一个横截面的比较研究,使用了11个虚构的脉/外根性疾病病例.
- 案例被介绍给四个人工智能聊天机器人,使用葡萄牙语和英语,信息顺序不同.
- 统计分析包括Kruskal-Wallis,Dwass-Steel-Critchlow-Fligner,后勤回归和二项式测试.
主要成果:
- Bing (86.4%) 和ChatGPT 4.0 (85.3%) 显示出更高的诊断准确度,显著优于Bard (28.6%) 和ChatGPT 3.5 (46.5%).
- 对于ChatGPT 4.0 (94.4%),Bing (93.2%) 和ChatGPT 3.5 (86.3%) 的治疗建议准确性很高,而Bard的治疗准确性更低 (75%).
- 观察到总体一致性很高 (98.29%),葡萄牙语提示导致了更相关的额外信息请求.
结论:
- 在评估的AI聊天机器人中,Bing和ChatGPT 4.0的诊断准确度最高.
- 巴德在诊断和治疗建议方面表现最低.
- 牙医必须批判性地解释人工智能聊天机器人的输出,因为在临床实践中可靠性不一致.


