应用人工智能来支持对异质流行病学数据集的分类
Julia Sasse1, Guillaume Fabre2, Isabel Fortier2
1ZB MED - Information Centre for Life Sciences, Cologne, Germany, https://ror.org/0259fwx54.
一个人工智能工具通过自动分类研究变量来增强健康数据的重复使用. 这提高了数据的可查和互操作性,加快了研究,减少了策展人的工作量.
科学领域:
- 医疗信息学 医疗信息学
- 数据科学数据科学数据科学
- 生物医学研究生物医学研究
背景情况:
- 可查找,可访问,可互操作和可重复使用 (FAIR) 数据在研究中的重要性日益增加.
- NFDI4Health旨在改善卫生数据的可查性,可重复使用性和可互操作性,用于流行病学,临床和公共卫生研究.
- 现有的平台,如德国中央健康研究中心和梅尔斯特罗姆目录,使用标准化分类来重复使用数据.
研究的目的:
- 提出一种人工智能解决方案,用于对健康研究变量进行自动分类和注释.
- 将这种AI解决方案集成到NFDI4Health元数据注释工作台中.
- 通过加速和改进的变量分类来增强数据的可查和重复使用.
主要方法:
- 开发基于BioBERT的文本分类器,用于自动分类和注释.
- 将AI模型集成到NFDI4Health元数据注释工作台服务中.
- 使用加权F1得分对模型性能进行评估.
主要成果:
- 基于BioBERT的文本分类器获得了超过92%的加权F1分数.
- 人工智能解决方案证明了更好的注释性能,特别是对于非专家用户.
- 观察到研究变量的加快分类,提高了数据的可查性和重用性.
结论:
- 人工智能解决方案显著加快了研究变量的分类,提高了数据的可查和重用.
- 预计人工智能方法的进一步发展将减少策展工作量.
- 人工智能工具促进创建语义注释,可互操作的数据目录,推进健康研究中的FAIR数据原则.
更多相关视频
07:35Selecting Multiple Biomarker Subsets with Similarly Effective Binary Classification Performances
Published on: October 11, 2018
08:51Application of Unsupervised Multi-Omic Factor Analysis to Uncover Patterns of Variation and Molecular Processes Linked to Cardiovascular Disease
Published on: September 20, 2024
相关概念视频
Classification of Illness
An illness is a response to a disease in which the person's level of functioning is changed compared with a previous level. The general classification of illness includes acute and chronic.
Acute illness is severe and...
Introduction to Epidemiology
Causality in Epidemiology
Bias in Epidemiological Studies
Statistical Methods for Analyzing Epidemiological Data
Statistical Software for Data Analysis and Clinical Trials
