医院特定领域调整对基于BERT的模型对分类神经放射学报告的影响
Siddharth Agarwal1, David Wood1, Benjamin A K Murray1
1School of Biomedical Engineering & Imaging Sciences, King's College London, Becket House, London, UK.
European radiology
|March 18, 2025
概括
对医院特定领域的调整显著改善了基于BERT的放射学报告分类模型. 大型语言模型 (LLM) 在标记数据有限时提供了可行的替代方案.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 放射学 放射学是一门学科.
背景情况:
- 基于BERT的模型越来越多地用于临床文本分类.
- 对于这些模型在神经放射学中的医院特定域调整的有效性尚未得到充分证实.
- 将适应的BERT模型与开源大语言模型 (LLM) 进行比较至关重要.
研究的目的:
- 用BERT模型进行神经放射学报告分类,使用掩面语言建模 (MLM) 评估医院特定领域的适应性.
- 将这些适应模型的性能与开源LLMs进行比较.
主要方法:
- 对126,556份 (KCH) 和86,032份 (GSTT) MRI脑部报告 (2008-2019) 的回顾性分析.
- 伯特模型 (RoBERTa,BioBERT,RadBERT) 在未标记的报告上进行了MLM,用于域调整.
- 模型在二进制和多标签分类任务上进行了评估,比较调整与基线模型和LLMs.
主要成果:
- 医院特定的域调整改善了所有基于BERT的模型 (p < 0.001).
- 在所有报告中,MLM的准确度最高 (KCH: 97.0%,GSTT: 95.5%),BERT模型之间没有显著差异.
- 绩效与报告数量以日志线性扩展;LLama-3.0 70B是顶级的LLM (KCH: 97.1%,GSTT: 94.0%).
结论:
- 建议在新的临床环境中对BERT模型进行医院特定领域的调整.
- 当标记数据稀缺时,LLM是神经放射学报告分类的实用替代方案,只要提供足够的计算资源.


