标准化自由文本数据,以免疫皮数据库中的两个字段为例
Sebastian Duesing1, Jason Bennett2, James A Overton3
1Center for Vaccine Innovation, La Jolla Institute for Immunology, La Jolla, CA, 92037, USA. sduesing@lji.org.
Journal of biomedical semantics
|March 23, 2025
概括
本研究介绍了一种工具来规范非结构化生物医学文本数据,提高其用于自动化分析和数据查询的可用性. 规范化过程显著减少了数据的差异,提高了可搜索性,并使其与正式的本体学相集成.
科学领域:
- 生物医学信息学 生物医学信息学
- 数据科学数据科学数据科学
- 自然语言处理自然语言处理.
背景情况:
- 由于提取挑战,非结构化的生物医学自由文本未得到充分利用.
- 数据规范化是使用结构化词汇和本体学的关键.
- 本研究的重点是从免疫表皮层数据库 (IEDB) 中对"年龄"和"数据位置"字段进行规范化.
研究的目的:
- 提出一个可适应的工具,用于规范化自由文本生物医学数据.
- 评估该工具在IEDB内的特定领域的应用.
- 展示规范化如何提高数据的可查性和可用性.
主要方法:
- 开发了一个三步规范化过程:字符,单词和短语的规范化.
- 创建了使用开发的工具应用的可通用规则.
- 在IEDB中将该工具应用于4095个不同的"年龄"值和251,810个"数据位置"值.
主要成果:
- 规范化工具在两个数据集的所有阶段都实现了高输出有效性.
- 字符规范化产生了>99.97%的有效性;单词规范化>98.06%;短语规范化>83.81%.
- 具体来说",年龄"数据在句子规范化后达到83.81%的有效性,而"数据位置"数据达到97.95%.
结论:
- 成功开发了一种可通用的方法来规范自由文本数据库字段.
- 规则创建的一次性努力可以应用于持续的数据策划.
- 标准化显著减少了数据变异,改善了搜索功能和本体学链接.


