不同的人工智能聊天机器人的准确性和可重现性,对基于患者的视网膜问题的反应:一项比较研究
Motasem Al-Latayfeh1,2, Abdelwahab Aleshawi3, Omar S El-Mulki4
1Department of Special Surgery, Faculty of Medicine, the Hashemite University, Zarqa, Jordan.
Clinical ophthalmology (Auckland, N.Z.)
|February 20, 2026
概括
生成型人工智能 (AI) 聊天机器人显示出在视体网关怀中患者教育的前景,ChatGPT-5.o和DeepSeek R1显示出高准确性和可重复性. 然而,性能因型号和条件而异,需要仔细的临床实施.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 生成型人工智能 (AI) 聊天机器人越来越多地被寻求健康信息的患者使用.
- 人工智能聊天机器人在为复杂的眼科疾病提供准确信息方面的可靠性尚未得到充分证实.
- 这项研究评估了领先的人工智能聊天机器人在响应以患者为中心的玻璃视网膜查询方面的表现.
研究的目的:
- 为了比较五个人工智能聊天机器人的准确性,全面性和可重现性,在回答患者关于视网膜状况的问题时.
- 评估AI聊天机器人作为眼科患者教育工具的适用性.
主要方法:
- 来自美国眼科医生学会数据库的135个以患者为中心的玻璃质问卷被使用.
- 在标准化条件下,五个人工智能聊天机器人 (ChatGPT-5.o,DeepSeek R1,Meta AI,Grok 3.0,Google Gemini 2.5 Pro) 进行了两次查询.
- 两位独立的视网膜眼科医生评估了反应的准确性和可重复性.
主要成果:
- 聊天GPT-5.o实现了最高的准确性 (94%) 和高可重现性 (96.3%).
- 深度搜索R1显示出最大的可重现性 (98.5%) 和高精度 (92.6%).
- 格洛克3.0和谷歌双子座2.5 Pro的准确性和可重复性较低,而Meta AI的表现适度.
- 与糖尿病视网膜病变相比,玻璃切除术和与年龄相关的黄斑变性问题获得了更高的准确性得分.
结论:
- 聊天GPT-5.o和DeepSeek R1的准确性和可复制性与临床标准相提并论,这表明它们作为患者教育资源的潜力.
- 不同的人工智能模型和眼科疾病的性能变化强调需要谨慎采用.
- 持续优化至关重要,以确保人工智能聊天机器人为玻璃甲状腺护理提供安全可靠的信息.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.2K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.7K
