利用大型语言模型从MRI报告中准确分类肝病变
Daniel Spitzl1, Markus Mergen1, Ulrike Bauer2
1Department of Diagnostic and Interventional Radiology, TUM University Hospital, School of Medicine, Technical University of Munich, Munich, Germany.
Computational and structural biotechnology journal
|June 12, 2025
概括
克劳德3.5索内特擅长从MRI报告中对肝脏病变进行分类,显示大语言模型 (LLM) 可以帮助诊断. 需要进一步验证临床使用.
科学领域:
- 人工智能在医学中的应用
- 医学成像信息学 医疗成像信息学
- 医疗保健的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 显示出临床整合的潜力,但它们在解释复杂的医疗报告,特别是成像发现中的有效性尚未得到充分证实.
- 此前在放射学中LLM的应用有时会产生低于最佳的诊断结果.
- 在放射学报告中解释细微的医学语言和诊断标准对于当前的AI模型来说是一个重大挑战.
研究的目的:
- 评估最先进的大型语言模型 (LLM) 准确分类肝病变的能力.
- 仅基于磁共振成像 (MRI) 报告中的文字描述来评估LLM的性能.
- 将不同的LLM与医生生成的肝损伤分类数据集进行基准比较.
主要方法:
- 使用了一个虚构的88个MRI报告的数据集,旨在模仿真实的临床放射学文档.
- 数据集包括各种肝病变:肝细胞癌,胆管癌,血管瘤,转移和焦点结节性增生.
- 多个LLM (GPT-4o,Deepseek V3,Claude 3.5 Sonnet,Gemini 2.0 Flash) 使用微和宏F1得分对地面真相标签进行了评估.
主要成果:
- 克劳德3.5索内特在评估的LLMs中实现了最高的诊断准确性.
- 克劳德3.5索内特在分类肝病变时显示了0.91的微F1得分.
- 这一表现超过了其他测试的LLM在MRI报告文本的病变分类的具体任务中的表现.
结论:
- 该研究表明,在临床环境中使用LLM作为基于文本的诊断支持的可行性,特别是在资源有限或大量的环境中.
- 法律法学在改善医疗诊断方面表现有前途,但通过前性研究进行严格的验证对于安全的临床整合至关重要.
- 通过基准测试进行全面的绩效评估对于理解和确保LLM在医疗应用中的可靠性至关重要.


