大規模言語モデルの眼科紹介トリアージにおける比較性能
Pedro Cardoso-Teixeira1, João Alves Ambrósio1, Mariana Garcia1
1Ophthalmology Department, Unidade Local de Saúde Entre o Douro e Vouga, Santa Maria da Feira, PRT.
Cureus
|February 23, 2026
まとめ
高度な言語モデル(LLM)は、眼科紹介の分類において有望であり、コンテキスト内学習によって精度が向上します。一般的なケースでは効果的ですが、まれまたは曖昧な苦情に対してはパフォーマンスが低下するため、人間の監視が必要です。
科学分野:
- 眼科学
- 人工知能
- 自然言語処理
背景:
- 医療紹介の自動分類は、効率を向上させることができます。
- 大規模言語モデル(LLM)は、臨床テキストの分析に可能性を提供します。
研究 の 目的:
- ポルトガル語の眼科紹介症例の分類における5つの高度なLLMの分類精度と一貫性を評価すること。
- これらの紹介に対するLLMのパフォーマンスに対する教師ありコンテキスト内学習の影響を評価すること。
主な方法:
- 3,831件のポルトガル語の眼科紹介症例が、5つのLLM(ChatGPT 4o、ChatGPT 5.1、Perplexity Pro、Claude Sonnet 4.5、Claude Opus 4.1)によって分類されました。
- ゼロショットプロンプティング戦略が最初に採用され、その後、コンテキスト内学習(957のラベル付き例)のフェーズが続きました。
- 分類精度、一貫性、およびFleissのκ係数が計算されました。
主要な成果:
- ベースライン精度は平均68.7%で、コンテキスト内学習後は73.4%に向上しました。
- ChatGPT 5.1は最高の精度(79.5%)を達成しました。
- ChatGPT 4oは最大の整合性向上(66.8%から93.8%)を示しました。
- 一般的なカテゴリ(例:糖尿病スクリーニング)では90%を超えましたが、まれまたは曖昧な苦情ではパフォーマンスは低下しました。
- 実行間の合意は、中程度から実質的(κ = 0.462-0.801)でした。
結論:
- 高度なLLMは、眼科紹介の解釈において significant な可能性を示しており、コンテキスト内学習による顕著な精度と一貫性の向上が見られます。
- LLMのパフォーマンスは、まれまたは曖昧な紹介タイプでは低いため、慎重な実装の必要性が強調されています。
- LLMは、人間の監視とさらなる臨床的検証を条件として、眼科におけるスケーラブルで低コストのトリアージ補助として機能する可能性があります。
関連する概念動画
Improving Translational Accuracy
3.7K
3.7K
Improving Translational Accuracy
15.2K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
15.2K


