自动生成有关矿太阳能设备制造细节的数据库
Agnes Valencia1, Fei Liu1, Xiangyang Zhang1
1Department of Mechanical Engineering, City University of Hong Kong, Tat Chee Avenue, Hong Kong, China.
Scientific data
|February 14, 2025
概括
自然语言处理 (NLP) 自动从出版物中提取矿太阳能电池数据,克服手动收集的挑战. 这确保了可持续的数据编译,以推进矿太阳能设备研究.
科学领域:
- 材料科学 材料科学 材料科学
- 可再生能源可再生能源是可再生能源.
- 计算化学计算化学
背景情况:
- 矿太阳能设备发展迅速,导致出版物激增.
- 一个于2022年启动的项目旨在手动编译已公布的设备数据.
- 手动数据收集在社区参与和项目可持续性方面面临挑战.
研究的目的:
- 提出和实施自然语言处理 (NLP) 算法,用于自动提取矿太阳能设备属性.
- 克服手动数据收集的局限性,并确保矿设备数据库的可持续性.
- 从科学文献中创建矿太阳能设备的全面数据集.
主要方法:
- 利用自然语言处理 (NLP) 算法从期刊文章中提取设备信息.
- 开发了识别和提取30个关键属性的方法,用于每个矿太阳能装置.
- 汇编了来自3164篇期刊文章的大量数据.
主要成果:
- 从3164篇期刊文章中成功提取了矿太阳能设备的30个属性.
- 在自动化数据提取过程中实现了0.899的平均准确性.
- 创建了一个公开可用的数据集和源代码,用于矿太阳能设备研究.
结论:
- NLP为编译矿太阳能设备数据提供了可持续和高效的解决方案.
- 自动数据提取显著提高了科学数据聚合的可扩展性.
- 公开发布的数据集和代码将加速矿太阳能技术的研发.


