在修复牙科中评估不同大型语言模型的准确性,可靠性,一致性和可读性
Zeyneb Merve Ozdemir1, Emre Yapici1
1Department of Restorative Dentistry, Faculty of Dentistry, Kahramanmaras Sutcu Imam University, Kahramanmaras, Turkey.
概括
人工智能 (AI) 聊天机器人在回答复原牙科问题的可靠性不同. 聊天GPT-4o和Chatsonic为患者教育提供了有希望的准确性,尽管可读性需要改进.
科学领域:
- 人工智能在牙科中的应用
- 数字卫生技术数字卫生技术
- 恢复性牙科应用程序 牙科应用程序
背景情况:
- 人工智能 (AI) 的整合正在迅速改变包括牙科在内的各种领域.
- 评估AI聊天机器人在专业医疗领域的性能对于其安全有效的实施至关重要.
- 修复牙科,其复杂的信息需求,为AI评估提供了一个独特的领域.
研究的目的:
- 评估来自多个人工智能聊天机器人的响应对复原牙科查询的可靠性,一致性和可读性.
- 为了比较不同的AI模型的性能,包括ChatGPT-3.5,ChatGPT-4,ChatGPT-4o,Chatsonic,Copilot和Gemini Advanced.
- 确定人工智能生成的内容对牙科专业人员和患者的适用性.
主要方法:
- 对六个AI聊天机器人提出了45个基于知识的和20个具体的问题 (患者相关和牙科专用).
- 使用DISCERN问卷进行了可靠性评估.
- 可读性通过Flesch阅读易度和Flesch-Kincaid等级水平得分进行评估.
- 通过分析对基于知识的问题的答案来确定准确性和一致性.
主要成果:
- 聊天GPT-4,ChatGPT-4o,Chatsonic和Copilot显示出"良好的"可靠性,而ChatGPT-3.5和Gemini Advanced则显示出"相当"的可靠性.
- 在基于知识的问题上,ChatGPT-4o获得了最高的准确率 (93.3%).
- 聊天机器人之间的可读性得分没有显著差异,但通常超过了患者教育建议的水平.
- 聊天GPT-4显示了响应的最高一致性.
结论:
- 在修复牙科中,人工智能聊天机器人的性能在准确性,可靠性和一致性方面有很大差异.
- 聊天GPT-4o和Chatsonic显示了恢复性牙科学术和患者教育的潜力.
- 目前的AI响应可读性可能需要调整,以便在牙科教育中获得最佳的患者理解.
相关概念视频
Improving Translational Accuracy
2.5K
2.5K
Data Validation
5.0K
Data validation is an essential part of a comprehensive assessment. Validation is confirming or verifying and opening the door to gathering more assessment data as it clarifies vague or unclear data. The process of checking and verifying the collected information is called data validation. The primary purpose of data validation is to ensure data is as free from error, bias, and misinterpretation as possible.
Nursing assessment guides are generally based on holistic models rather than medical...
Nursing assessment guides are generally based on holistic models rather than medical...
5.0K


