相关实验视频
Updated: Jan 16, 2026

07:37
Assessment and Communication for People with Disorders of Consciousness
Published on: August 1, 2017
9.6K
评估AI聊天机器人响应的可靠性和可读性,用于Microtia患者教育
Supriya Dadi1, Taylor Kring1, Kyle Latz1
1University of Miami Miller School of Medicine.
The Journal of craniofacial surgery
|October 2, 2025
概括
人工智能聊天机器人为耳部微病患者提供指导,但质量不同. 谷歌Gemini显示出最好的质量和可读性,尽管没有一个平台对患者信息始终是最佳的.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 患者教育 患者教育
背景情况:
- 耳部微症是一种先天性形,会导致面部不对称和显著的心理社会困扰.
- 患者和家人经常寻求人工智能聊天机器人的指导,以获取有关微病及其手术治疗的信息.
- 评估人工智能聊天机器人的性能对于提供可靠的健康信息至关重要.
研究的目的:
- 评估领先的人工智能聊天机器人对以患者为中心的微小问题查询的质量和可读性.
- 为了比较不同的AI模型在提供可访问和准确的健康信息方面的表现.
- 确定最能支持患者和家庭在微观空间中导航的AI平台.
主要方法:
- 对AI聊天机器人提出了25个以患者为中心的关于微小的问题:ChatGPT 4o,Google Gemini,DeepSeek和OpenEvidence.
- 通过修改的DISCERN信息质量标准和SMOG可读性评分来评估答案.
- 使用包括ANOVA在内的统计分析来确定聊天机器人性能中的显著差异.
主要成果:
- 谷歌双子表现出最高质量 (DISCERN分数M=37.16),而DeepSeek (M=14.63) 和谷歌双子 (M=14.73) 提供了最好的可读性.
- 开放式证据表现出最差的可读性 (M=18.06),而ChatGPT的质量得分较低 (M=30.32).
- 平均DISCERN分数为32.19,平均SMOG分数为15.93,这表明在本科阅读水平上质量很好.
结论:
- 没有一个AI聊天机器人始终符合微型信息的最佳质量和可读性标准.
- 谷歌双子在质量和可读性评估中表现相对较好.
- 确保AI聊天机器人响应可访问性至关重要,因为对这些工具的依赖性增加了健康信息.

