眼科の大型言語モデルの評価:定量的な対質的な方法
Ting Fang Tan1, Arun J Thirunavukarasu2, Chrystie Quek1
1Singapore National Eye Centre, Singapore Eye Research Institute, Singapore, Singapore.
Current opinion in ophthalmology
|September 5, 2025
まとめ
眼科における大型言語モデル (LLM) と生成型人工知能 (AI) の評価には,精度を超えた多様な指標が必要です. 標準化されたベンチマークと厳選されたデータセットは 堅実な臨床検証と統合に不可欠です
科学分野:
- 眼科について
- 人工知能
- 医療情報学
背景:
- 大型言語モデル (LLM) と生成型人工知能 (AI) は,臨床眼科においてますます適用されています.
- これらのAIツールのパフォーマンスを評価することは,安全で効果的な医療への統合に不可欠です.
- 現在の評価方法は,AIの性能の他の重要な側面を無視して,しばしば正確性だけに焦点を当てています.
研究 の 目的:
- 眼科におけるLLMおよび生成AIアプリケーションの評価メトリックの重要性を検討し,強調する.
- 一般的に採用されている定量・定性評価指標について議論する.
- この分野における強力なAI評価を妨げている課題を特定する.
主な方法:
- 眼科におけるLLMとAI評価に関する既存の文献の体系的なレビュー.
- 出版された研究で用いられた定量・定性指標の分析
- 現在の評価慣行における共通の課題と限界を特定する.
主要な成果:
- ジェネラティブAIは様々な眼科の臨床応用において有望なパフォーマンスを示しています
- 精度を超えて,定量と質のメトリックは,LLMの出力をより包括的に評価します.
- 主な課題は,標準化された基準の欠如と,高品質の臨床データセットの限られた可用性です.
結論:
- 評価メトリックのスペクトルは存在するが,標準化は欠けている.
- データセットの管理とベンチマーク開発の課題に取り組むことが不可欠です.
- 臨床的なAIアプリケーションを検証し,眼科の実践への統合を容易にするには,堅実で領域特有の評価が不可欠です.


