打破跨公司的数据孤岛来训练全基因组预测:小麦的可行性研究
Moritz Lell1, Abhishek Gogna1, Vincent Kloesgen1
1Leibniz Institute for Plant Genetics and Crop Plant Research, Seeland, Germany.
Plant biotechnology journal
|April 20, 2025
概括
整合大数据和人工智能 (AI) 提高了小麦育种中全基因组预测的准确性. 结合多样化的数据集可以提高预测能力,在4000个基因型左右观察到最佳收益.
科学领域:
- 农业科学 农业科学
- 遗传学 是一个遗传学.
- 数据科学数据科学数据科学
背景情况:
- 大数据和人工智能显示出增强全基因组预测准确性的前景.
- 之前在小麦杂交品种的成功促使将这些方法扩展到近亲血统.
研究的目的:
- 整合来自商业小麦育种计划和历史伙伴关系的表型和基因型数据.
- 将基因组最佳线性无偏预测 (GBLUP) 与基于卷积神经网络 (CNN) 的基因组预测进行比较.
- 评估训练集大小对预测能力的影响.
主要方法:
- 来自四个商业小麦品种计划和历史的公私合作伙伴关系的数据整合.
- 对异质数据进行严格的数据策划和SNP归算.
- 基于GBLUP和CNN的基因组预测模型的比较.
主要成果:
- 创建了高质量的基因组预测培训套件,涵盖了12年和168个环境.
- 随着训练集规模的增加,预测能力得到了改善,达到4000个基因型左右.
- 培训集规模的进一步增加导致回报率下降,接近平原.
结论:
- 灵活组合的实验序列是可行的基因组预测.
- 设计训练集或非线性方法等新的方法可以克服预测高原.
- 打破数据仓库可以释放大数据在小麦育种中的潜力.


