通过基于信任的过程,提高样本图像数据集的自动标记的准确性
Quentin Bateux1, Jonathan Koss2, Patrick W Sweeney3
1Institute for Biospheric Studies, Yale University, New Haven, Connecticut, United States of America.
PLoS computational biology
|November 12, 2025
概括
用于标记自然历史标本的深度学习模型通过使用信心值来拒绝不确定的标签来实现更高的准确性. 这种方法显著提高了生物多样性研究中自动化特征数据注释的可靠性.
科学领域:
- 生物多样性信息学 生物多样性信息学
- 计算生物学是一种计算生物学.
- 数字化自然历史数字化自然历史
背景情况:
- 自然历史藏品的数字化产生了大量的标本数据.
- 使用深度学习的自动标签 (例如,CNNs) 承诺效率,但往往缺乏足够的准确性 (80-85%).
研究的目的:
- 开发和验证一种方法,以提高自动标记样品的准确性.
- 增强深度学习对自然历史收藏中特征数据注释的实用性.
主要方法:
- 利用卷积神经网络 (CNN) 的信心分数来过标签.
- 实施用户定义的门来拒绝低置信度预测.
- 对超过60万个草本实验室标本的繁殖状态进行注释.
主要成果:
- 拟议的方法显著提高了准确性,从最初的86%提高到95%以上 (拒绝40%的标签) 或99% (拒绝65%).
- 这种方法提供了灵活性,以满足各种研究准确性和覆盖范围的需求.
- 对注释数据的分析揭示了新的相关性,并证实了标本特征的已知趋势.
结论:
- 信任值是提高自动标记样本可靠性的有效策略.
- 这种方法将潜在不准确的深度学习模型转化为生物多样性研究的有价值的工具.
- 发布的数据集和方法使生物学家能够通过可调整的准确度-覆盖权衡来探索研究问题.


