通过人工智能改变白内障护理:评估大型语言模型在解决白内障相关问题的表现
Xinyue Wang1,2,3,4, Yan Liu1,2,3,4, Linghao Song1,2,3,4
1Eye Institute and Department of Ophthalmology, Eye and ENT Hospital, Fudan University, Shanghai, China.
Frontiers in artificial intelligence
|September 22, 2025
概括
对于与白内障相关的查询,评估了五种流行的大型语言模型 (LLM). 聊天GPT-4o在准确性,完整性和无害性方面表现出色,显示出AI.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地用于医疗信息检索.
- 评估LLM在眼科等专业临床领域的表现至关重要.
- 与白内障相关的查询是人工智能协助可能有益的共同领域.
研究的目的:
- 评估五个领先的LLM在回答白内障相关的医疗问题方面的表现.
- 使用关键质量指标,将LLM输出与人类生成的响应进行比较.
- 分析眼科内不同临床主题子组的LLM绩效.
主要方法:
- 进行了对五个LLM (ChatGPT-4,ChatGPT-4o,Gemini,Copilot,Llama 3.5) 的比较评估.
- 进行了定性和定量评估,与人类反应进行了比较.
- 使用了七个指标:准确性,完整性,简洁性,无害性,可读性,稳定性和自我纠正.
主要成果:
- 聊天GPT-4o在准确性,完整性和无害性方面表现出卓越的性能.
- 双子座在简洁方面领先,而Copilot显示出最好的稳定性.
- 所有评估的LLM在问题类型上表现与人类相当或比人类更好,具有强大的自我纠正能力.
结论:
- 临床学术课程显示出提供关于白内障相关临床问题的准确和全面信息的巨大潜力.
- 在关键质量评估中,ChatGPT-4o成为了表现最佳的公司.
- 临床医生和患者必须批判性地评估人工智能产生的信息,承认当前的局限性.

