Related Experiment Video
Updated: May 2, 2026

08:01
A Web Tool for Generating High Quality Machine-readable Biological Pathways
Published on: February 8, 2017
17.8K
The Data Distillery: A Graph Framework for Semantic Integration and Querying of Biomedical Data.
Taha Mohseni Ahooyi1, Benjamin Stear1, J Alan Simmons2
1Department of Biomedical and Health Informatics, The Children's Hospital of Philadelphia, Philadelphia PA USA.
Biorxiv : the Preprint Server for Biology
|August 20, 2025
Summary
The Data Distillery Knowledge Graph (DDKG) unifies diverse biomedical data for translational research. It enables advanced querying across clinical and experimental datasets, facilitating discoveries in areas like variant analysis and biomarker identification.
Area of Science:
- Biomedical Informatics
- Translational Bioinformatics
- Data Science
Background:
- Biomedical data is often siloed across different domains, hindering integrated analysis.
- Translational research requires linking clinical and experimental data for comprehensive insights.
- Existing data integration frameworks may lack the flexibility for diverse biomedical ontologies.
Purpose of the Study:
- To develop a semantic integration framework for querying heterogeneous biomedical data.
- To support translational research by connecting clinical and experimental datasets.
- To create a unified graph model for the NIH Common Fund Data Ecosystem.
Main Methods:
- Utilized a property graph architecture based on UBKG infrastructure.
- Integrated clinical standards (ICD-10, SNOMED, DrugBank) via UMLS.
- Incorporated genomics and basic science data using ontologies (HPO, GENCODE, Ensembl, STRING, ClinVar).
- Implemented ontology-based ingestion, identifier normalization, and graph-native querying.
Main Results:
- Demonstrated the Data Distillery Knowledge Graph (DDKG) utility across eight informatics use cases.
- Successfully linked diverse datasets including clinical records and experimental results.
- Enabled complex queries for regulatory variant analysis, tissue-specific expression, and biomarker discovery.
- Showcased modularity and extensibility for incorporating new data and schemas.
Conclusions:
- The DDKG provides a robust solution for semantic integration and querying of biomedical data.
- It significantly enhances capabilities for translational research and data-driven discovery.
- The framework is accessible via public interface, API, and downloadable builds.
More Related Videos
Related Concept Videos
Data: Types and Distribution
2.2K
In biostatistics, data are the observations collected for analysis. There are two main types: parametric and non-parametric. Parametric data, which include continuous (e.g., weight) and discrete numerical data (e.g., number of tablets), assume a particular distribution pattern, often the normal distribution. Non-parametric data do not adhere to a specific distribution and typically comprise nominal (e.g., gender) and ordinal categorical data (e.g., pain scale ratings).
Distributions in...
Distributions in...
2.2K
Statistical Software for Data Analysis and Clinical Trials
1.7K
Statistical software is pivotal in data analysis and clinical trials by providing tools to analyze data, draw conclusions, and make predictions. These software packages range from simple data management applications to complex analytical platforms, supporting various statistical tests, models, and simulation techniques. Their significance lies in their ability to handle vast amounts of data with precision and efficiency, enabling researchers to validate hypotheses, identify trends, and make...
1.7K

