在医疗保健数据库研究中,用于可扩展特征工程和超高维混调整的自然语言处理
Richard Wyss1, Jie Yang1, Sebastian Schneeweiss1
1Division of Pharmacoepidemiology and Pharmacoeconomics, Department of Medicine, Brigham and Women's Hospital, Harvard Medical School, Boston, MA, USA.
通过使用电子健康记录 (EHR) 的自然语言处理 (NLP) 功能来补充医疗保健索赔数据,可以改善数据库研究中代理混调整的共变量平衡.
科学领域:
- 医疗信息学 医疗信息学
- 生物统计学 生物统计学
- 计算流行病学计算流行病学
背景情况:
- 医疗保健数据库研究经常因未测量的因素而陷入混乱.
- 目前用于高维代理调整的方法不使用自由文本电子健康记录 (EHR) 注释.
- 自然语言处理 (NLP) 可以从非结构化的EHR数据中提取结构化的特征.
研究的目的:
- 评估将NLP产生的特征纳入高维代理调整中的影响.
- 评估补充索赔数据与来自EHR的NLP特征是否增强了混控制.
主要方法:
- 将Medicare索赔与EHR数据联系起来,形成三个药物比较队列.
- 应用NLP技术从自由文本EHR笔记中生成特征.
- 使用LASSO回归来进行倾向得分模型,适合索赔单独和索赔+NLP特征集.
主要成果:
- 包括NLP特征与索赔数据一起,改善了整体共变量平衡 (标准化差异<0.1).
- 对NLP特征的调整在三项研究中的两项中将影响估计转移到预期的方向.
- 对估计的治疗效果的影响有所不同,在一项研究中没有变化.
结论:
- 通过使用NLP功能来补充行政索赔,可以增强超高维的代理混调整.
- 这种方法在捕获相关的混信息方面提供了适度的改进.
- 在医疗保健数据库研究中,NLP集成显示了加强因果推理的前景.
更多相关视频
09:20Cloud-Based Phrase Mining and Analysis of User-Defined Phrase-Category Association in Biomedical Publications
Published on: February 23, 2019
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
相关概念视频
Strategies for Assessing and Addressing Confounding
Confounding can be addressed at both the design phase of a study and through analytical methods after data...
Confounding in Epidemiological Studies
Issues And Trends In Healthcare Delivery System
Cost Containment
Payment for healthcare services has historically promoted adoption of costly and often unnecessary or inefficient...
Improving Translational Accuracy
