在牙科创伤学中,域特定聊天机器人和通用聊天机器人的性能比较
Vipin Kumar1, Akshat Sachdeva1, Sidhartha Sharma1
1Division of Conservative Dentistry and Endodontics, Centre for Dental Education and Research, All India Institute of Medical Sciences, New Delhi, India.
概括
牙科创伤的AI聊天机器人Dental Trauma Evo在回答有关骨折和脱口的问题时表现出最高的准确性. 虽然表现良好,但建议进一步进行临床验证,以便在实践中使用.
科学领域:
- 牙科 牙科是指牙科的专业.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 人工智能 (AI) 聊天机器人越来越多地用于牙科创伤学.
- 人们仍然担心人工智能在牙科创伤护理中的可靠性.
- 这项研究评估了牙科创伤EvoAI聊天机器人对牙骨折和口的准确性.
研究的目的:
- 为了评估牙科创伤 Evo AI 聊天机器人的准确性.
- 将其性能与牙科创伤学领域的其他领先AI聊天机器人进行比较.
- 评估聊天机器人对各种问题格式 (MCQ,真假,是/否) 的答案.
主要方法:
- 使用了45个关于牙骨折和口的验证问题.
- 四个聊天机器人 (牙科创伤Evo,ChatGPT-4o,DeepSeek R1,谷歌双子座2.5) 进行了测试.
- 通过使用费舍尔的精确测试来验证答案的准确性和一致性.
主要成果:
- 牙科创伤Evo获得了最高的整体精度 (85.43%).
- 谷歌Gemini,DeepSeek和ChatGPT-4o紧随其后,它们的准确率分别为81.72%,80.24%和79.75%.
- 聊天机器人性能因问题类型而异,没有观察到统计学上显著的差异.
结论:
- 牙科创伤 Evo 聊天机器人基于国际牙科创伤学协会的指导方针表现出有希望的初步性能.
- 进一步的研究和临床验证对于实际实施至关重要.
- 建议对AI模型进行改进,以获得最佳的临床效用.


