基于高分辨率的CUT&Tag数据预测链特异性和细胞类型特异性的G-四复合体
Yizhi Cui1,2, Hongzhi Liu1, Yutong Ming1
1School of Computer Science and Engineering, Beijing Technology and Business University, Beijing, 100048, China.
Briefings in functional genomics
|June 26, 2023
概括
这项研究引入了一种新的计算方法,用于使用G4 CUT&Tag数据预测G四重复 (G4) DNA结构. 开发的XGBoost模型准确地预测了G4的形成,并揭示了侧面序列和转录因子的影响.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 分子生物学分子生物学
背景情况:
- G-四重复 (G4) 结构是整个基因组中发现的非经典DNA图案.
- G4s在各种生物过程中发挥作用,并且以细胞类型特定的方式在功能性基因组区域中得到丰富.
- 准确预测G4s至关重要,但实验方法很费力;需要计算方法.
研究的目的:
- 开发一种用于预测G-四重复 (G4) 结构的新型计算方法.
- 为了利用高分辨率的G4 CUT&Tag测序数据来改进模型训练.
- 分析与G4形成相关的序列特征和转录因子结合动机.
主要方法:
- 使用G4 CUT&Tag测序数据构建了一个新的数据集.
- 开发并应用了XGBoost机器学习模型用于G4预测.
- 进行序列分析以确定影响G4形成的因素.
主要成果:
- XGBoost模型在预测不同细胞类型内和跨细胞类型的G4s方面表现出强的表现.
- 序列分析显示,侧面序列,特别是GC含量,显著影响G4结构形成.
- 确定了G4基因,包括已知的转录因子 (如SP2和BPC) 的基因,这表明它们的调节作用.
结论:
- 开发的计算方法提供了使用G4 CUT&Tag数据进行G4预测的准确方法.
- 侧面序列和特定的转录因子是基因组中G4结构形成的关键决定因素.
- 这项工作增强了我们对G4s在基因组调节中的作用的理解.


