确定和评估影响使用Usagi注释性能的数据元素名称的特征
Rowdy de Groot1, Daniel P Püttmann1, Lucas M Fleuren2
1Amsterdam UMC Location University of Amsterdam, Department of Medical Informatics, Amsterdam, the Netherlands.
International journal of medical informatics
|September 13, 2023
概括
像Usagi这样的自动注释工具显示出标准化医院数据的潜力,但性能不同. 较短的数据元素名称提高了准确性,尽管整体可靠性仍然是临床数据整合的关注点.
科学领域:
- 医疗信息学 医疗信息学
- 数据科学数据科学数据科学
- 临床数据管理 临床数据管理
背景情况:
- 医院产生大量数据,通常以专有格式,阻碍互操作性.
- 将数据元素手动注释到标准化标识符是劳动密集型的.
- 自动化工具可能会简化数据注释过程.
研究的目的:
- 评估影响自动数据元素注释质量的因素.
- 为了评估Usagi OHDSI注释工具的性能.
- 识别影响注释准确性的数据元素的特征.
主要方法:
- 使用了来自荷兰COVID-19 ICU数据仓库的数据元素名称.
- 雇佣了Usagi,一个OHDSI注释工具,用于自动注释.
- 使用后勤回归来分析名称长度,字数,匹配得分和医院来源对注释质量的影响,与黄金标准进行比较.
主要成果:
- 乌萨吉在30.5%的数据元素名称和5.5%的同义名称中实现了正确的注释.
- 比赛的得分是正确注释的最强有力的预测因素.
- 根据医院的来源,注释准确性有很大差异,更短,更简单的名称产生更好的结果.
结论:
- 乌萨吉在数据元素名称上的表现比同义名称更好.
- 建议使用较短的数据元素名称和同义名称来优化自动注释.
- 乌萨吉目前的性能不足以完全依赖临床数据标准化.


