结合自动化方法,生产高质量的草本馆数字记录
Robert P Guralnick1, Raphael LaFrance1, Julie M Allen2
1Florida Museum of Natural History University of Florida Gainesville Florida USA.
Applications in plant sciences
|February 5, 2025
概括
数字化自然历史收藏是缓慢的. 结合基于规则和大型语言模型方法的整体方法可以显著减少将草原样本标签数据提取到达尔文核心领域的错误.
科学领域:
- 生物多样性信息学 生物多样性信息学
- 数据科学数据科学数据科学
- 数字策划数字策划
背景情况:
- 数字化自然历史收藏对研究和管理至关重要.
- 将样品标签转换为数字数据是一个重要的瓶.
- 像达尔文核心这样的标准化数据格式对于互操作性至关重要.
研究的目的:
- 评估用于提取草原样本标签数据的自动化方法.
- 为了比较基于规则和大型语言模型 (LLM) 的方法.
- 开发一种改进的准确数据提取方法.
主要方法:
- 开发并比较基于规则的方法与ChatGPT4 (LLM).
- 使用光学字符识别 (OCR) 转录标签量化遗漏和佣金错误.
- 创建了一个整体方法,结合了个别方法的优势.
主要成果:
- 聊天GPT4产生非达尔文核心合规的字段;基于规则的方法有高佣金错误.
- 整体方法显著减少了整体信息提取错误.
- 自动化方法显示出加速数字化的潜力.
结论:
- 综合方法对于从复杂的标签中提取高质量的数字数据是有价值的.
- 自动化方法,与人类验证,可以加快草本实验室样本的数字化.
- 这些方法可能适用于其他自然历史收藏类型.


