DUVEL:一个积极学习的注释生物医学语料库,用于识别寡原组合
Charlotte Nachtegael1,2, Jacopo De Stefani2, Anthony Cnudde2,3
1Interuniversity Institute of Bioinformatics in Brussels, Université Libre de Bruxelles-Vrije Universiteit Brussel, Boulevard du Triomphe, CP 263, Brussels 1050, Belgium.
概括
这项研究介绍了DUVEL,这是一种用于提取对理解复杂疾病至关重要的寡原变异组合的新型数据集. 积极学习有效地创建了这个数据集,改善了生物医学关系提取模型的性能.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组学就是基因组学.
背景情况:
- 生物医学关系提取 (bioRE) 数据集目前专注于单个变体,限制了对复杂遗传相互作用的研究.
- 了解二基因和寡基因变异组合对于阐明疾病病因和表观效应至关重要.
- 现有的文献强调了多变体相互作用的重要性,但缺乏用于计算分析的专用数据集.
研究的目的:
- 创建一个独特的数据集 (DUVEL),用于训练计算工具,从科学文献中提取寡生变异组合.
- 解决生物医学关系提取中多基因变异相互作用数据集的稀缺问题.
- 利用主动学习来优化注释过程的效率和成本效益.
主要方法:
- 利用主动学习 (AL) 来指导含有潜在二基因变异组合 (基因变异-基因变异) 的文本片段的注释.
- 从Oligogenic Diseases数据库 (OLIDA) 中预先注释了85篇全文文章,使用PubTator.
- 使用基于AL的注释平台ALAMBIC注释提取的文本片段,创建DUVEL数据集.
主要成果:
- DUVEL数据集包括8442个文本片段,其中794个是优基变异关系的积极实例,覆盖了95%的注释文章.
- 在DUVEL上微调最先进的生物医学语言模型 (BiomedBERT,BiomedBERT-large,BioLinkBERT,BioM-BERT) 显著提高了性能.
- 在微调后,BiomedBERT-large在基因变异对检测方面获得了0.84的最高F1得分,证明了数据集的实用性.
结论:
- DUVEL数据集为推进生物医学关系提取提供了有价值的资源,特别是两个基因和两个变异之间的4-ary关系.
- 积极学习是一种有效的策略,可以创建专门的生物RE数据集,降低注释成本并提高效率.
- DUVEL数据集是免费可用的,促进了计算生物学研究和关于复杂遗传相互作用的科学文献的策划.
相关概念视频
Multiple Allele Traits
34.2K
The Concept of Multiple Allelism
34.2K
Complementary DNA
29.5K
Overview
29.5K
Dihybrid Crosses
74.8K
Overview
74.8K
Genetic Lingo
102.7K
Overview
102.7K
Pedigree Analysis
84.2K
Overview
84.2K
Pleiotropy
40.4K
Pleiotropy is the phenomenon in which a single gene impacts multiple, seemingly unrelated phenotypic traits. For example, defects in the SOX10 gene cause Waardenburg Syndrome Type 4, or WS4, which can cause defects in pigmentation, hearing impairments, and an absence of intestinal contractions necessary for elimination. This diversity of phenotypes results from the expression pattern of SOX10 in early embryonic and fetal development. SOX10 is found in neural crest cells that form melanocytes,...
40.4K


