大型语言模型的比较性能在眼科医生推选中
Pedro Cardoso-Teixeira1, João Alves Ambrósio1, Mariana Garcia1
1Ophthalmology Department, Unidade Local de Saúde Entre o Douro e Vouga, Santa Maria da Feira, PRT.
Cureus
|February 23, 2026
概括
先进的语言模型 (LLM) 在分类眼科推方面表现有前途,通过上下文学习提高准确性. 虽然对常见病例有效,但对于罕见或模两可的投诉,性能下降,需要人类监督.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 医疗推的自动分类可以提高效率.
- 大型语言模型 (LLM) 为分析临床文本提供了潜力.
研究的目的:
- 评估五个先进的LLM的分类准确性和一致性,以分类葡萄牙眼科推小组.
- 评估监督的语境学习对这些推的LLM绩效的影响.
主要方法:
- 3,831个葡萄牙眼科推小贴士被五个LLM分类 (ChatGPT 4o,ChatGPT 5.1,困惑Pro,克劳德·索内特4.5,克劳德·奥普斯4.1).
- 最初使用了零射击提示策略,随后进行了上下文学习阶段 (957个标记的示例).
- 计算了分类的准确性,一致性和Fleiss的kappa协议.
主要成果:
- 基线准确率平均为68.7%,在上下文学习后提高到73.4%.
- 聊天GPT 5.1实现了峰值准确度 (79.5%);聊天GPT 4o显示了最大的一致性增长 (66.8%至93.8%).
- 对于常见类别 (如糖尿病查) 的表现超过了90%,但对于罕见/模两可的投诉,表现较低. 中期协议的范围从中度到实质 (κ = 0.462-0.801).
结论:
- 先进的LLM在解释眼科推方面显示出显著的潜力,通过上下文学习显著提高了准确性和一致性.
- 对于罕见或模两可的转介类型,LLM的表现较低,这凸显了需要仔细实施的需要.
- 在眼科中,LLM可以作为可扩展的,低成本的诊断辅助工具,而这取决于人类监督和进一步的临床验证.
相关概念视频
Improving Translational Accuracy
3.7K
3.7K
Improving Translational Accuracy
15.2K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
15.2K


