CNValidatron:使用计算机视觉对 PennCNV 呼叫进行准确和有效的验证.
Simone Montalbano1, G Bragi Walters2, Gudbjorn F Jonsson2
1Institute of Biological Psychiatry, Mental Health Services, Copenhagen University Hospital, Roskilde, Denmark.
bioRxiv : the preprint server for biology
|November 24, 2025
概括
较大的罕见副本数变异 (CNVs) 对进化和疾病风险至关重要. 这项研究开发了一种精确的机器学习模型,以自动化CNV验证,显著改进了现有的大规模基因组分析方法.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 大稀有副本数变异 (CNVs) 是遗传变异,进化和疾病风险的重要驱动因素.
- 基因型阵列是大型队列中CNV检测的最常见来源.
- 现有的CNV调用阵列数据的方法表现出高假阳性率,并且对于全基因组分析无效.
研究的目的:
- 建立最大的人类验证的CNV通话数据集.
- 开发和验证用于自动化CNV验证的机器学习模型.
- 在大型基因组数据集中提高CNV检测的准确性和效率.
主要方法:
- 汇集了近6万个由人类验证的CNV呼叫数据集,来自多个队列和数组的22,500个样本.
- 利用视觉验证来评估CNV呼叫的准确性,识别出高比例的假阳性.
- 通过机器视觉训练了一个卷积神经网络 (CNN),使用验证数据的子集进行自动 CNV 验证.
主要成果:
- 视觉验证显示,53.7%的CNV呼叫是假阳性,9.7%是不清楚的,数据集和基因组区域之间存在显著差异.
- 开发的CNN模型在自动化CNV验证中实现了90%以上的准确性,与人类分析师相比.
- 与基因组测序数据的交叉验证证实了视觉验证方法的高精度.
结论:
- 视觉检查仍然是验证CNV呼叫的黄金标准.
- 开发的机器学习模型有效地自动化了高精度的规模CNV验证.
- 该CNV验证软件可作为R包提供,以促进在基因组研究中的更广泛应用.

