DPred_3S:根据多个序列衍生特征,识别了三种物种表达体的二氨酸 (D) 修饰.
Jinjin Ren1,2, Xiaozhen Chen1, Zhengqian Zhang1
1Key Laboratory of Ministry of Education for Gastrointestinal Cancer, School of Basic Medical Sciences, Fujian Medical University, Fuzhou, Fujian, China.
Frontiers in genetics
|January 3, 2024
概括
二氨酸 (D) 是一种在生命中发现的关键RNA修饰. 一个新的机器学习模型,DPred_3S,准确地预测了酵母和细菌中的D位点,推进了表表表转录组研究.
科学领域:
- 分子生物学分子生物学
- 生物信息学是一种生物信息学.
- 基因组学就是基因组学.
背景情况:
- 二氨酸 (D) 是所有生命领域的tRNA中保存的RNA修饰.
- D修饰影响RNA结构,功能,并与疾病和进化有关.
- 新出现的证据表明,二氨酸也发生在mRNA上.
研究的目的:
- 开发一种计算框架,用于识别表皮转录组中的二氨酸 (D) 修饰.
- 为了利用机器学习和表体转录组测序数据进行D位点预测.
- 分析不同物种的D修饰模式.
主要方法:
- 开发一种基于机器学习的预测框架,命名为"DPred_3S".
- 首次利用表表体转录组测序数据进行培训和验证.
- 使用F-score和AUROC评估模型性能,比较各种机器学习算法.
主要成果:
- DPred_3S实现了高预测准确度,AUROC得分为Saccharomyces cerevisiae的0.955,大肠杆菌的0.946和Schizosaccharomyces pombe的0.905.
- 确定了用于D位预测的最佳序列特征.
- 模型性能因物种而异,表明跨物种预测的潜在局限性.
结论:
- 序列上下文是二uridine位点识别的一个重要决定因素.
- 该DPred_3S框架展示了机器学习用于表表转录组分析的可行性.
- 需要进一步的研究来解决跨物种表表表转录组预测的挑战.


