基于大型语言模型的聊天机器人对牙科创伤管理的评估:基于准确性,一致性和信息质量的比较研究
Vasfiye Isik1, Rana Ikbal Sengul2, Soner Sismanoglu3
1Department of Endodontics, Faculty of Dentistry, Istanbul University-Cerrahpaşa, Istanbul, Turkey.
概括
困惑,克劳德AI和ChatGPT-5在回答创伤性牙损伤问题的准确性方面进行了比较. 困惑导致真假准确性,而ChatGPT在开放式问题的可读性方面表现出色.
科学领域:
- 牙科创伤学 牙科创伤学
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 基于大型语言模型 (LLM) 的聊天机器人为医疗保健信息检索提供了潜在的工具.
- 在牙科等专业医疗领域评估这些人工智能工具的性能至关重要.
- 创伤性牙损伤 (TDI) 需要准确和及时的信息,以有效管理.
研究的目的:
- 为了比较三个领先的基于LLM的聊天机器人 (ChatGPT-5,Claude AI,Perplexity) 对TDI的准确性,一致性,可读性和信息质量.
- 评估这些人工智能工具对牙科创伤临床决策支持的适用性.
- 根据牙科创伤管理中的特定用例,提供有关选择合适的人工智能工具的见解.
主要方法:
- 使用40个向每个聊天机器人提交三次的真假陈述来评估准确性和一致性.
- 评估了对25个基于案例的开放式问题的答案的可读性,可理解性,可操作性和信息可靠性.
- 使用了包括Flesch阅读易度 (FRE) 和mDISCERN分数在内的定量指标.
主要成果:
- 困惑在真假问题上表现出最高准确度,其次是Claude AI和ChatGPT-5.
- 在开放式响应中,ChatGPT-5获得了最佳可读性得分.
- 困惑在可理解性和可操作性方面表现出色,而克劳德AI显示出优越的信息可靠性.
结论:
- 基于LLM的聊天机器人在牙科创伤管理中发挥了补充作用,具有不同的优势.
- 困惑,克劳德AI和ChatGPT-5为TDI信息检索的不同方面提供了明显的优势.
- 建议基于特定需求的AI工具的战略选择,加上必要的人类临床监督.
更多相关视频
05:49Author Spotlight: Advancing CBCT and Digital Dental Image Integration with AI-Assisted Digitization
Published on: February 23, 2024
1.3K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
