相关实验视频
Updated: Jun 12, 2026

09:17
Using Retinal Imaging to Study Dementia
Published on: November 6, 2017
21.6K
在视网膜血管疾病分类上发现ChatGPT的语言差异:横截面研究
Xiaocong Liu1,2, Jiageng Wu2, An Shao1
1Eye Center, The Second Affiliated Hospital, Zhejiang University, Zhejiang, China.
Journal of medical Internet research
|January 22, 2024
概括
在非英语环境中,ChatGPT显示为诊断视网膜血管疾病的医疗助理. 英语提示提高了对中国报告的诊断和推理性能,尽管与人类专家相比,差距仍然存在.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 在英语临床环境中显示出显著的潜力.
- 然而,它们在非英语临床环境中的表现和推理能力仍未得到充分探索.
- 视网膜血管疾病是诊断工具评估的关键领域.
研究的目的:
- 用中国临床数据评估ChatGPT对视网膜血管疾病的诊断准确性.
- 在非英语背景下评估ChatGPT的推理能力.
- 为了比较英语与中文提示对ChatGPT性能的影响.
主要方法:
- 一项横截面研究利用了1226个中国血库光素血管学报告和诊断.
- 通过四种提示策略测试了ChatGPT:直接诊断与逐步推理,中文与英语.
- 绩效指标包括诊断准确度 (F1分数) 和推理错误率.
主要成果:
- 当用英语进行直接诊断时,ChatGPT实现了最高的诊断性能 (F1得分为80.05%),超过了中国提示 (70.47%),但低于眼科医生 (89.35%).
- 与中文提示相比,英语提示导致更完整,更准确的推理过程,幻觉较少 (P<.001).
- 在中文和英语提示之间观察到回忆 (P=.03) 和F1得分 (P=.04) 的显著差异,这表明在英语提示时功能增强.
结论:
- 在非英语的临床环境中,ChatGPT可以作为一个有价值的诊断医疗助理,特别是在英语提示时.
- 与人类眼科医生相比,表现差距和语言差异突出了这些局限性.
- 对更强大的LLM进行进一步的研究对于推进眼科实践至关重要.

