TECRR:用于机器学习,深度学习和大型语言模型基线的BI-RADS分类的放射性报告的基准数据集
Sadam Hussain1, Usman Naseem2, Mansoor Ali3
1School of Engineering and Sciences, Tecnológico de Monterrey, Monterrey, 64849, Nuevo Leon, Mexico. a01753094@tec.mx.
BMC medical informatics and decision making
|October 24, 2024
概括
一个新的乳腺成像数据集有助于对乳腺成像报告和数据系统 (BI-RADS) 的分类和乳腺密度进行分类. 生物医学生成预训练变压器 (BioGPT) 模型实现了BI-RADS分类的最高准确度.
科学领域:
- 医学成像分析 医学成像分析
- 机器学习在放射学中的应用
- 在医疗保健中的自然语言处理.
背景情况:
- 对于BI-RADS和乳腺密度分类的注释乳房成像数据集的有限可用性.
- 机器学习 (ML),深度学习 (DL) 和自然语言处理 (NLP) 在分析放射性报告方面表现有前途.
- 需要一个精心策划的数据集,以推进乳房成像报告的自动分类.
研究的目的:
- 构建和注释一个新的乳房成像放射学报告数据集.
- 在BI-RADS分类中建立各种ML,DL和大型语言模型 (LLM) 的基准结果.
- 为进入乳腺成像报告分析领域的研究人员提供资源.
主要方法:
- 数据集的创建涉及董事会认证的放射科医生,注释了5046份西班牙语报告,翻译成英语并进行了预处理.
- 利用NLP嵌入技术,如术语频率-反向文档频率 (TF-IDF) 和word2vec用于特征提取.
- 多种分类器的性能比较,包括K-Nearest Neighbour (KNN),支持矢量机 (SVM),随机森林 (RF),长短期内存 (LSTM),BERT和BioGPT.
主要成果:
- 最终的数据集包括5046份独特的乳房成像报告.
- 在BI-RADS类别分类中,BioGPT表现优异,平均灵敏度为0.60.
- 使用预处理数据,BioGPT的表现优于BERT (平均灵敏度为0.54) 的6%.
结论:
- 为BI-RADS和乳腺密度分类提出了一个精选的,注释的乳腺成像数据集.
- 在BI-RADS分类中提供了ML,DL和LLM的基线性能结果.
- 数据集和结果作为未来研究自动化放射性报告分析的基础.
关键词:
根据BI-RADS的分类,它们被分类为两种类型.乳腺放射学报告 乳腺放射学报告ML ML ML 在这里.在NLP中,我们使用了NLP.国际货币基金组织-国际货币基金组织在Word2vec中使用.

