一个新的自动化标签数据提取和数据库生成系统从草本体样本图像使用OCR和NER的OCR和NER
Atsuko Takano1, Theodor C H Cole2, Hajime Konagai3
1Institute of Natural Science and Environment, University of Hyogo/The Museum of Nature and Human Activities, Hyogo, 6 Chome, Yayoigaoka, Sanda, Hyogo, 669-1546, Japan. takano@hitohaku.jp.
Scientific reports
|January 3, 2024
概括
现在可以使用光学字符识别 (OCR) 和命名实体识别 (NER) 技术自动数字提取草本样本数据. 这一进步改善了世界各地自然历史藏品的文档和全球信息可用性.
科学领域:
- 生物多样性信息学 生物多样性信息学
- 数字策划数字策划
- 自然历史收藏 自然历史收藏
背景情况:
- 改善自然历史标本数据的可访问性对于全球研究至关重要.
- 赫巴里亚越来越多地将收藏数字化,但高效的数据提取仍然是一个挑战.
研究的目的:
- 开发一个全自动系统,从草药馆样本图像中提取标签数据.
- 提高自然历史藏品数据输入和处理的效率.
主要方法:
- 使用光学字符识别 (OCR) 进行文本识别.
- 员工命名实体识别 (NER) 用于结构化数据提取.
- 开发了一个可以在标准桌面计算机上运行的系统.
主要成果:
- 在从草药馆图像中完全自动提取标签数据方面取得了进展.
- 已证明适用于各种自然历史标本,包括昆虫学收藏.
- 该系统可适应在数字化工作中广泛使用.
结论:
- 开发的系统显著促进了自然历史博物馆标本的数字化和出版.
- 这项技术可以在全球范围内应用,以改善文档和信息的可用性.
- 实现高效的数据处理,以提高科学可访问性.
更多相关视频
11:14Rapid High-throughput Species Identification of Botanical Material Using Direct Analysis in Real Time High Resolution Mass Spectrometry
Published on: October 2, 2016
11.6K
08:55Author Spotlight: Harnessing DNA Barcode Technology to Enhance the Efficiency of Medicinal Plant Identification
Published on: November 1, 2024
1.5K
