RDscan:根据预训练模型从文献中提取RNA与疾病的关系
Yang Zhang1, Yu Yang2, Liping Ren2
1Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China, Chengdu 611731, China; School of Healthcare Technology, Chengdu Neusoft University, Chengdu 611844, China.
Methods (San Diego, Calif.)
|May 24, 2024
概括
RDscan是一种新的文本挖掘工具,使用先进的语言模型从生物医学文献中高效地提取RNA疾病关系. 这种方法有助于研究人员了解RNA.
科学领域:
- 分子生物学分子生物学
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
背景情况:
- 越来越多的研究突出了RNA与各种疾病之间的许多联系.
- 从生物医学文献中有效和准确地提取RNA-疾病 (RD) 关系对于推进研究至关重要.
- 现有的方法可能缺乏全面的研发和开发关系挖掘所需的特异性和准确性.
研究的目的:
- 引入RDscan,这是一种用于自动提取RD关系的新型文本挖掘方法.
- 利用预先训练有素的生物医学大语言模型 (LLM) 来增强 RD 信息检索.
- 为访问RDscan的功能提供一个用户友好的Web服务器.
主要方法:
- 使用LLMs的预培训和微调策略开发RDscan.
- 为培训和评估创建一个手动策划的 RD 语料库 (2,082 个积极的, 2,000 个负面的句子).
- 微调的Bioformer和BioBERT模型用于文字分类和命名实体识别 (NER) 任务.
主要成果:
- RDscan在文本分类和NER任务中表现出色.
- 与传统的机器学习方法 (SVM,后勤回归,随机森林) 相比,在5倍交叉验证中取得了优异的结果.
- 成功开发了一个可访问的Web服务器用于RD关系提取.
结论:
- RDscan是第一个专门用于RD关系提取的文本挖掘工具.
- 该工具预计对研究RNA与疾病相互作用的研究人员来说是无价的.
- RDscan提供了一种高效准确的方法,可以从生物医学文献中提取关键信息.


