在人类基因组中基于序列的i-Motif候选者的优先排序
Veronica Remori1, Michela Prest1, Mauro Fasano1,2
1Department of Science and High Technology, University of Insubria, Como, Italy.
Frontiers in bioinformatics
|August 28, 2025
概括
这项研究引入了一种计算方法,用于准确预测i-motif DNA结构,这对于基因调节至关重要. 这种精细的方法可以识别出具有高可信度的候选物质,从而减少实验负担并帮助癌症研究.
科学领域:
- 基因组学
- 生物信息学
- 分子生物学
背景情况:
- i-Motifs (iM) 是参与基因调节和基因组稳定的四链DNA结构.
- 目前对IMs的全基因组预测方法具有低的特异性和高的错误阳性率,增加了实验工作量.
研究的目的:
- 开发一种精细的计算方法,用于对i-motif形成序列的高可靠性,全基因组预测.
- 提高特异性并减少i-motif序列识别中的错误阳性率.
主要方法:
- 从多个序列对齐开发了一个位置特定相似度矩阵 (PSSM).
- 用PSSM扫描人类基因组 (hg38) 寻找富含细胞素的基因组,并进行测序.
- 使用排列测试,t测试,Benjamini-Hochberg校正和Z分数来评估统计学意义. 使用随机森林分类器对已知的IM和G四重复体 (G4s) 进行验证.
主要成果:
- 确定了37,075个具有强烈i-motif形成潜力的候选序列 (15-46个核酸).
- 在预测的IMS和已知的G4之间显示了对齐得分和序列相似性的显著差异,证实了结构特异性.
- 使用核酸特征训练的随机森林模型实现了高分类性能,支持候选区别性.
结论:
- 提供了一个可扩展和统计稳定的方法来丰富生物相关的i-motif序列.
- 为实验验证和i-motif向配体的合理设计提供了有价值的资源.
- 促进基因表达的调节,用于癌症和其他疾病.


