随机拼接辅助深度学习用于通过拉曼光谱对乳腺癌细胞系进行分类
Yiheng Liu1, Junfeng Liu1, Jiayi Wan1
1Department of Biosciences and Bioinformatics, Xi'an Jiaotong-Liverpool University, Suzhou, Jiangsu 215123, PR China.
Computational and structural biotechnology journal
|June 13, 2025
概括
一个新的深度学习模型,随机拼接-卷积神经网络 (RS-CNN),使用拉曼光谱显著改善了癌症识别. 即使使用有限的数据,它也能达到很高的准确性,超过了用于精确诊断的传统方法.
科学领域:
- 生物医学光谱学 生物医学光谱学
- 计算生物学 计算生物学
- 机器学习 机器学习
背景情况:
- 拉曼光谱为单细胞癌症的识别提供了丰富的生化见解.
- 机器学习增强了光谱分析,但往往受数据量限制.
研究的目的:
- 开发一个深度学习框架,随机拼接-卷积神经网络 (RS-CNN),以克服癌症诊断的拉曼光谱分析数据稀缺.
- 通过光谱连接来增强光谱特征区分,数据集大小和信号质量.
主要方法:
- 开发了RS-CNN,一种深度学习模型,利用来自同一细胞系的拉曼光谱的随机拼接.
- 在6个乳腺癌细胞系中与基准模型 (SVM,LDA,PCA-SVM,PCA-LDA,CNN) 进行了验证的RS-CNN.
- 采用SHAP分析来确定诊断和亚型区分的显著光谱区域.
主要成果:
- 通过 450 个光谱/线,RS-CNN 实现了 98.63% 的精度,显著优于传统模型 (~85%).
- 在数据有限的条件下 (100光谱/线),RS-CNN保持了91.47%的准确性,超过了CNN (70.83%).
- 在独立数据集上达到≥94%的准确性,证明了可概括性.
结论:
- RS-CNN是一种用于临床拉曼诊断的强大的分析模型,在使用有限样本的高精度应用中表现出色.
- 确定了关键的光谱区域 (例如,980厘米-1,1158-1160厘米-1,1603-1607厘米-1),对于癌症诊断和亚型分类至关重要.


