在语境学习使大型语言模型能够在脊柱不稳定性瘤得分分类中从合成CT和MRI报告中实现人类水平的表现
Maximilian F Russe1, Marco Reisert2,3, Anna Fink1
1Department of Diagnostic and Interventional Radiology, Faculty of Medicine, Medical Center - University of Freiburg, University of Freiburg, 79106, Freiburg, Germany.
La Radiologia medica
|September 24, 2025
概括
大型语言模型 (LLM) 可以在任务特定的精细化后使用脊柱不稳定性新形成评分 (SINS) 来对脊椎转移稳定性进行分类,从而达到接近人类的性能. 这种精细化,特别是上下文学习,对于医疗应用中的AI准确性至关重要.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 脊柱瘤学 脊柱瘤学
背景情况:
- 脊椎转移的稳定性评估对于患者管理至关重要.
- 脊柱不稳定性瘤评分 (SINS) 是此评估的标准工具.
- 在这个领域评估AI模型的性能是必不可少的.
研究的目的:
- 将最先进的大型语言模型 (LLM) 与SINS分类中的人类专家的性能进行比较.
- 评估特定任务精细化的影响,包括上下文学习,对SINS评分的LLM绩效的影响.
- 探索AI在自动化脊椎转移稳定性评估方面的潜力.
主要方法:
- 追溯分析了100个合成CT和MRI报告,其SINS分数各不相同.
- 四位人类专家 (放射科医生,神经外科医生) 和四位法学士 (Mistral,Claude,GPT-4turbo,GPT-4o) 的性能比较.
- 课程在一般和特定任务的精细形式进行了评估,重点是SINS类别和点分配准确性.
主要成果:
- 人类专家在SINS分类 (98.5%) 和点计算 (92%) 中取得了很高的准确性.
- 一般的LLM表现有限 (26-63%的正确分类,4-15%的正确SINS积分).
- 在上下文学习显著提高了近乎人类水平的LLM绩效 (96-98%分类,86-95%得分),精细的模型显示SINS积分分配的71%-85%的改善.
结论:
- 特定任务的精细化,特别是上下文学习,使LLMs能够在SINS分类中实现接近人类的专家表现.
- 通过LLM,可以实现自动化脊椎转移的稳定性评估.
- 这项研究强调了对于在医疗环境中有效实施人工智能的任务特定改进的必要性.
相关概念视频
Improving Translational Accuracy
14.0K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.0K
Improving Translational Accuracy
3.5K
3.5K

