一个基于BERT的米增强剂识别模型与序列表示差异解释相结合
Yajing Pu1, Xintong Hao1, Zhaoqi Zheng1
1College of Biomedical Engineering, Sichuan University, Chengdu, China.
Frontiers in plant science
|June 24, 2025
概括
一个新的RiceEN-BERT-SVM模型改进了使用DNABERT-2和SVM的米增强剂识别. 微分分析解释了微调如何提高模型准确性,以更好地调节基因表达和提高作物产量.
科学领域:
- 基因组学就是基因组学.
- 分子生物学分子生物学
- 生物信息学是一种生物信息学.
背景情况:
- 基因表达调节对于大米分子育种和产量改善至关重要.
- 识别增强剂,关键的基因表达调节剂,是功能基因组学中的挑战.
- 目前用于大米增强剂识别的深度学习方法缺乏高效的特征提取和概括.
研究的目的:
- 引入一种新型模型,即RiceEN-BERT-SVM,以有效和准确地识别米增强剂.
- 整合DNABERT-2用于特征提取和支持矢量机 (SVM) 进行分类.
- 用微分分析阐明性能优化的机制.
主要方法:
- 开发了RiceEN-BERT-SVM模型,将DNABERT-2和SVM集成在一起.
- 利用微分分析来解释特征表示和模型性能.
- 进行5倍交叉验证和独立测试以评估准确性.
主要成果:
- 在5倍交叉验证中,RiceEN-BERT-SVM的准确度达到88.05%,在独立测试中达到87.55%,超过了SOTA模型.
- 微调进一步提高了性能,达到93.63%的最终精度.
- 微分分析显示,通过微调,正负样品特征的分离越来越大,与性能增长相关.
结论:
- 米EN-BERT-SVM模型为米增强剂的识别提供了一个有效和准确的工具.
- 微分分析为优化生物序列分析模型提供了一个可视化解释的框架.
- 这种方法增强了对基因表达调节的理解,从而改善了米的育种和产量.


