眼科大型语言模型的评估:定量与定性方法
Ting Fang Tan1, Arun J Thirunavukarasu2, Chrystie Quek1
1Singapore National Eye Centre, Singapore Eye Research Institute, Singapore, Singapore.
Current opinion in ophthalmology
|September 5, 2025
概括
在眼科中评估大型语言模型 (LLM) 和生成人工智能 (AI) 需要多样化的指标,而不仅仅是准确性. 标准化的基准和精准的数据集对于强大的临床验证和整合至关重要.
科学领域:
- 眼科 眼科
- 人工智能
- 医疗信息学
背景情况:
- 大型语言模型 (LLM) 和生成人工智能 (AI) 越来越多地应用于临床眼科.
- 评估这些人工智能工具的性能对于它们安全有效地融入医疗保健至关重要.
- 目前的评估方法通常只关注准确性,可能会忽视人工智能的其他关键方面.
研究的目的:
- 审查并强调LLM和眼科人工智能应用的评估指标的重要性.
- 讨论共同采用的定量和定性评估指标.
- 确定阻碍该领域强大的AI评估的挑战.
主要方法:
- 对眼科LLM和AI评估的现有文献进行系统审查.
- 在已发表的研究中使用的定量和定性指标的分析.
- 确定当前评估实践中的共同挑战和局限性.
主要成果:
- 在各种眼科临床应用中,生成人工智能表现有前途.
- 除了准确性,定量和定性指标提供了更全面的LLM输出评估.
- 主要挑战包括缺乏标准化的基准和有限的高质量的临床数据集.
结论:
- 一系列的评估指标存在,但缺乏标准化.
- 应对数据集策划和基准开发方面的挑战至关重要.
- 对于验证临床人工智能应用并促进其融入眼科实践而言,强有力的特定领域评估至关重要.


