在干眼综合征中LLM的比较分析 医疗信息 医疗信息
Gloria Wu1, Hrishi Paliath-Pathiyal2, Obaid Khan3
1Department of Ophthalmology, School of Medicine, University of California, San Francisco, CA 94143, USA.
Diagnostics (Basel, Switzerland)
|August 14, 2025
概括
大型语言模型 (LLM) 显示,在不同的人口群体中提供公平的干眼综合征信息方面存在显著差异. 医生监督对于人工智能生成的医疗保健内容至关重要,以确保公平,防止护理延误.
科学领域:
- 眼科医生 眼科 眼科
- 医疗保健中的人工智能
- 健康 公平 卫生 公平
背景情况:
- 干眼综合征影响了1600万美国人,造成了大量的医疗保健费用.
- 大型语言模型 (LLM) 越来越多地用于健康信息,需要评估它们的公平指导.
- 了解LLM在不同人群中提供干眼信息方面的表现至关重要.
研究的目的:
- 评估和比较五个主要的LLM (Grok,ChatGPT,Gemini,Claude.ai,Meta AI) 干眼综合征信息传递.
- 评估不同人口群体 (白人,黑人,东亚人,西班牙裔男性和女性) 的LLM绩效.
- 识别文化敏感度,内容深度和信息传递方面的差异.
主要方法:
- 使用模拟62岁患者干眼症状的标准提示.
- 分析了LLM响应的词数,可读性,文化敏感性,关键词覆盖率和响应时间.
- 人口统计类别包括白人,黑人,东亚人和西班牙裔男性和女性.
主要成果:
- 在LLMs中观察到单词数量,文化敏感性和医学术语覆盖率的显著差异.
- 双子座提供了最全面的答案,而Claude.ai是最简洁的.
- 格洛克对少数群体的文化意识更高,而MetaAI的文化定制最小.
- 所有模型都建议咨询专家,但内容深度和公平性各不相同.
结论:
- 在LLM生成的关于文化敏感性和内容深度的干眼信息中存在实质性的差异.
- 没有一个LLM系统地针对所有人口群体的眼睛干燥的全部原因.
- 医生监督和人工智能生成的医疗保健信息的标准化对于公平获取和及时护理至关重要.


