应用机器学习和SERS用于DNA二次结构的精确类型化.
Guantong Xu1, Ying Bao2, Yujing Zhang1
1State Key Laboratory of Supramolecular Structure and Materials, College of Chemistry, Jilin University, 2699 Qianjin Street, Changchun 130012, P. R. China.
Analytical chemistry
|October 16, 2024
概括
这项研究将机器学习与表面增强拉曼光谱学 (SERS) 结合起来,以准确识别像G-quadruplex (G4) 和i-motif (iM) 这样的DNA二次结构. 这种新方法可以快速选和预测各种DNA结构.
科学领域:
- 生物物理化学 生物物理化学
- 分子生物学分子生物学
- 计算生物学 计算生物学
背景情况:
- 表面增强拉曼光谱法 (SERS) 对于分析DNA二次结构是有效的.
- 由于光谱重叠和有限的样本数据,鉴定复杂的DNA构造存在挑战.
研究的目的:
- 为准确的DNA二次结构识别开发协同机器学习和SERS方法.
- 分析各种DNA构造的SERS光谱,包括G-四重复 (G4),i-motif (iM),双链 (DS) 和单链 (SS).
主要方法:
- 使用主要组件分析 (PCA) 进行初始形状分组.
- 应用线性差异分析 (LDA),K-近邻 (KNN) 和支持向量机 (SVM) 进行分类.
- 分析了54个定义良好的寡核酸的SERS光谱.
主要成果:
- PCA成功地将寡核酸分离成G4,IM和其他组.
- 机器学习模型在对训练的序列进行分类时取得了很高的准确性.
- 在不同的pH条件下,正确识别了五个未训练的序列和主要形状 (G4,IM,DS) 的结构.
结论:
- 集成的SERS和机器学习方法显示了快速DNA二次结构选的巨大潜力.
- 这种方法可以准确地预测和识别复杂的DNA结构,有助于分子诊断和研究.


