对特定领域的预训练语言模型进行基准评价,以确定临床研究中方法论严谨性的最佳模型
Fangwen Zhou1, Rick Parrish1, Muhammad Afzal2
1Health Information Research Unit, Department of Health Research Methods, Evidence, and Impact, Faculty of Health Sciences, McMaster University, Hamilton, Ontario, Canada.
Journal of biomedical informatics
|April 17, 2025
概括
生物链接BERT模型在对随机对照试验的方法严谨性进行分类时表现出了卓越的表现. 综合评估和值调整对于选择可靠的基于变压器的语言模型来进行临床文献评估至关重要.
科学领域:
- 临床研究中的自然语言处理.
- 机器学习用于基于证据的医学.
- 人工智能在生物医学文献中的分析分析
背景情况:
- 基于变压器的语言模型显示了自动化临床文献批判性评估的潜力.
- 需要进行全面的评估,以确定可靠的模型来评估随机对照试验 (RCT) 的方法严格性.
研究的目的:
- 为了对基于转换器的最先进的语言模型进行基准测试,以对RCT的方法论严谨性进行分类.
- 通过使用各种各样的指标和数据集来评估模型性能.
主要方法:
- 七个基于变压器的语言模型对42575个RCT的标题和摘要进行了微调.
- 模型使用12个方案和指标进行评估,包括交叉损失,布赖尔得分,AUROC和精度.
- 在保留和外部数据集上进行了值调整和测试.
主要成果:
- 三个BioLinkBERT模型在12个评估方案中的8个中表现优于其他模型.
- 在特定方案中,BioBERT,BiomedBERT和SciBERT显示出最高的性能.
- 在外部数据集上,模型性能下降,但类权重调整改善了结果.
结论:
- 在分类RCT的方法严谨性方面,BioLinkBERT模型通常表现优于其他评估模型.
- 全面的评估指标和值调整对于最佳的模型选择至关重要.
- 未来的研究应该侧重于概括性,失衡策略和全文文章培训.
更多相关视频
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
7.4K
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
2.3K
