在眼科中评估大型语言模型:系统审查
Zili Zhang1, Haiyang Zhang1, Zhe Pan2
1State Key Laboratory of Eye Health, Department of Ophthalmology, Shanghai Ninth People's Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, China.
Journal of medical Internet research
|October 27, 2025
概括
大型语言模型 (LLM) 在眼科中表现有前途,但缺乏标准化的评估. 目前的研究大大支持基于文本的封闭源代码模型,阻碍了临床整合和性能合成.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 在眼科护理中提供了变革性的潜力.
- 目前在眼科的LLM评估实践是分散的,缺乏系统的评估.
- 需要进行全面的评估,以确定研究缺口并指导临床整合.
研究的目的:
- 系统地绘制眼科LLM评估的当前格局.
- 评估合成LLM绩效数据用于常见的眼科任务的可行性.
主要方法:
- 在主要数据库 (PubMed,科学网,Embase,IEEE Xplore) 进行了系统的文献搜索,截至2024年11月17日.
- 包括187项定量评估眼科LLM的研究,并提取了LLM类型,数据模式,子专业,任务,评估维度和临床一致性.
- 进行了描述性统计,费舍尔精确测试和探索性随机效应元分析.
主要成果:
- 大多数研究 (187) 专注于闭源LLM (例如,ChatGPT,Gemini) 和仅文本评估 (n=168).
- 开源LLM的代表性不足 (13.4%),特别是在纯评估研究 (4.8%).
- 评估倾向于全面的眼科和诊断任务,对多式联络数据,非英语语境或现实世界部署的探索有限;元分析显示高异质性 (I2=94.5%).
结论:
- 眼科的LLM评估丰富,但高度异质,限制了绩效聚合.
- 在评估开源模型,多式联运任务和现实世界的适用性方面存在重大差距.
- 标准化的基准和分阶段的临床验证对于安全的LLM整合到眼科护理中至关重要.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.0K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
