CDEMapper:通过大型语言模型增强国家卫生研究院共同数据元素的使用
Yan Wang1, Jimin Huang1, Huan He1
1Department of Biomedical Informatics and Data Science, School of Medicine, Yale University, New Haven, CT 06510, United States.
概括
本研究介绍了CDEMapper,这是一个大型语言模型 (LLM) 驱动的工具,可以将本地数据元素映射到国家卫生研究院 (NIH) 常用数据元素 (CDE). 通过简化CDE对齐,CDEMapper提高了数据标准化和研究可重复性.
科学领域:
- 生物医学信息学 生物医学信息学
- 数据科学数据科学数据科学
- 卫生研究 卫生研究 卫生研究
背景情况:
- 共同数据元素 (CDE) 对于标准化数据收集和跨研究的共享至关重要.
- 由于各种各样的数据元素,在实施CDE方面存在挑战.
- 提高数据互操作性和研究可重复性是关键目标.
研究的目的:
- 开发一个新的共同数据元素 (CDE) 绘图工具,以弥合当地数据元素和国家卫生研究院 (NIH) CDEs之间的差距.
- 利用大型语言模型 (LLM) 进行高效准确的CDE映射.
- 加强健康研究中的数据互操作性.
主要方法:
- 开发了CDEMapper,这是一个LLM驱动的工具,包含CDE索引/嵌入模块,CDE建议 (将Elasticsearch/BM25与GPT结合起来),以及人类审查.
- 索引和嵌入NIH CDEs用于语义搜索.
- 评估工具的准确性和可用性与手工方法相比.
主要成果:
- CDEMapper为CDE映射提供了一个公开可用的,直观的界面.
- 通过LLM增强的方法 (BM25与GPT嵌入和排名器) 显示出卓越的性能.
- 可用性测试证实了该工具的有效性和效率.
结论:
- 大型语言模型 (LLM) 显示了协助CDE映射的巨大潜力.
- 该工具有助于研究人员识别本地数据和NIH CDEs之间的差距.
- 促进CDE的可重复使用性,并加强研究中的数据标准化.


