赫斯皮 (Hespi):一个自动检测来自草本馆样本表的信息的管道
Robert Turnbull1, Emily Fitzgerald1, Karen M Thompson1
1Melbourne Data Analytics Platform.
Bioscience
|August 18, 2025
概括
新的计算机视觉工具Hespi自动从草药馆样本表中提取生物多样性数据. 这加速了生物记录的数字化,用于研究和保护.
科学领域:
- 生物多样性信息学 生物多样性信息学
- 数字植物学数字植物学
- 计算生物学是一种计算生物学.
背景情况:
- 与标本相关的生物多样性数据对于生物,环境和保护研究至关重要.
- 目前从样本图像中手动提取数据是缓慢和低效的,阻碍了大规模分析.
研究的目的:
- 开发一个自动化系统,Hespi (草本实验室样品表管道),以从草本实验室样品标签中有效和准确地提取数据.
- 利用先进的计算机视觉和自然语言处理技术来数字化生物多样性数据.
主要方法:
- 赫斯皮集成了两种对象检测模型,用于表格和标签组件的识别.
- 它采用光学字符识别 (OCR) 和手写文本识别 (HTR) 来进行文本提取.
- 提取的文本与分类学数据库进行验证,并使用多模式大语言模型进行细化.
主要成果:
- 赫斯皮精确地检测和提取来自各种国际草本库的样本表中的文本.
- 该系统成功地分类了标签类型 (印刷,打字,手写,混合).
- 模块化设计允许用户定制和集成特定模型.
结论:
- 赫斯皮显著提高了从草药馆标本中提取权威数据的效率和准确性.
- 该工具促进了大规模生物多样性数据的数字化,支持生物,环境和保护科学.
- 赫斯皮的适应性建筑促进了自然历史收藏的更广泛采用和发展.


