基于序列数据的合法和非法木分类的法医应用的双层机器学习模型的开发
Hyung-Eun An1, Min-Ho Mun1, Adeel Malik2
1Department of Biotechnology, Sangmyung University, Seoul 03016, the Republic of Korea.
Forensic science international. Genetics
|May 31, 2024
概括
本研究介绍了一种使用DNA条形码的机器学习模型,以准确识别合法和非法种类,增强执法和社会安全的法医分析.
科学领域:
- 法医植物学和遗传学
- 机器学习在物种识别中的应用.
背景情况:
- (Papaver物种) 有多种应用,包括药用和工业用途.
- 由于片含量,一些花种类在法医学上具有重要意义,需要准确的识别.
- 目前用于马物种识别的DNA条形码方法面临局限性,特别是对研究较少的非法品种.
研究的目的:
- 开发和评估一种基于机器学习的模型,用于使用DNA序列对合法和非法种类进行分类.
- 评估各种遗传标记 (ITS1,ITS2,trnL,trnL-trnF) 和用于识别机器学习算法的性能.
- 建立一个有效的法医工具,以区分合法和非法种.
主要方法:
- 开发一个两层的机器学习模型:1层用于合法/非法分类,2层用于非法物种识别.
- 利用来自四种标记物的DNA序列数据:内部转录间隔器1 (ITS1),内部转录间隔器2 (ITS2),转移RNA白氨酸 (trnL) 和trnL-trnF基因间隔器.
- 我们比较了四种机器学习算法:K-近邻 (KNN),天真贝叶斯 (NB),极端梯度提升 (XGBoost) 和随机森林 (RF).
主要成果:
- 使用结合ITS区域 (ITS1和ITS2) 的KNN模型显示合法/非法分类的最高准确度 (在测试组中为0.889).
- 结合ITS区域的KNN模型在非法物种识别方面也表现最好 (测试组的精度为1000).
- 在盲目样本上的验证证实了第1层准确度高于0.830;第2层确定了P. setigerum DC. 但对P. somniferum L.的结果是不同的.
结论:
- 机器学习,特别是KNN与ITS结合的DNA条形码,是分类和识别树物种的可行和有效工具.
- 开发的模型可以作为一个有效的法医工具,帮助执法部门识别非法贩运.
- 进一步的研究可能会完善物种识别的准确性,有助于提高社会安全.


