评估大型语言模型在解决患者关于内牙疼痛的问题:可访问聊天机器人的比较分析
Sanaa Aljamani1, Yazan Hassona2, Hoda A Fansa3
1Department of Restorative Dentistry, School of Dentistry, The University of Jordan, Amman, Jordan; Jordan University Hospital, Amman, Jordan.
Journal of endodontics
|May 7, 2025
概括
与双子座相比,ChatGPT-3.5提供了更高质量的,更可靠的关于内牙疼痛的答案,但难以读取. 双子座更易于阅读,但不太全面,突出了人工智能监督患者教育的必要性.
科学领域:
- 医疗保健中的人工智能
- 医疗信息学 医疗信息学
- 患者教育 技术 技术
背景情况:
- 越来越多的患者依赖大语言模型 (LLM) 来获取健康信息,因此需要进行可靠性评估.
- 在患者教育中使用人工智能治疗内牙疼痛等疾病是有争议的.
- 持续评估医疗保健领域的LLM绩效对于负责任的整合至关重要.
研究的目的:
- 评估和比较ChatGPT-3.5和Gemini在响应患者关于内牙疼痛的询问方面的表现.
- 评估人工智能对内牙疼痛产生的反应的质量,可靠性和可读性.
- 为牙科患者教育开发人工智能驱动的工具提供信息.
主要方法:
- 整理和分类了62个关于内牙疼痛的常见问题.
- 来自ChatGPT-3.5和Gemini的响应使用标准化工具进行分析:全球质量评分 (GQS),可靠性指标和可读性指数 (Flesch-Kincaid,Gobbledygook的简单测量).
- 进行了统计分析,以比较两个LLM的表现.
主要成果:
- 与双子座相比,ChatGPT-3.5的整体质量 (GQS) 和可靠性显著提高 (P < .001).
- 双子提供了比ChatGPT-3.5 (P < .001) 更可读的答案 (第6-7年级水平),这需要更高的阅读水平.
- 尽管可读性更好,但双子座的答案缺乏ChatGPT-3.5的深度和完整性.
结论:
- 聊天GPT-3.5在提供高质量,可靠的内牙疼痛信息方面表现出色,尽管其复杂性可能会限制患者的可访问性.
- 双子座提供了增强的可读性,但损害了信息的全面性和深度.
- 专业监督对于将人工智能工具整合到医疗保健中至关重要,以确保准确,可访问和同情的患者教育.


