使用大型语言模型对儿科败血症队列的上下文表型化
Aditya Nagori1,2, Ayush Gautam1,3, Matthew O Wiens4,5,6
1Department of Surgery, Duke university school of medicine, Durham NC, USA.
AMIA ... Annual Symposium proceedings. AMIA Symposium
|February 23, 2026
概括
大型语言模型 (LLM) 为个性化护理提供先进的患者子组集群,在来自低收入国家的复杂儿科败血症数据上表现优于传统方法. 通过LLM集群,可以发现不同的患者个人资料,以便更好地做出决策.
科学领域:
- 计算生物学是一种计算生物学.
- 医疗信息学医学信息学
- 医疗保健中的人工智能
背景情况:
- 个性化护理和资源优化需要有效的患者子组集群.
- 传统方法面临着高维度,异构的医疗数据和缺乏上下文理解的挑战.
- 来自低收入国家的儿科败血症数据集对分析提出了独特的挑战.
研究的目的:
- 评估基于大型语言模型 (LLM) 的集群与儿科败血症患者子组的经典方法相比.
- 评估不同LLM嵌入模型和集群目标的性能.
- 确定LLM聚类在资源有限的环境中用于上下文表型的潜力.
主要方法:
- 患者记录被序列化为文本,并使用LLM嵌入式 (LLAMA 3.1 8B,DeepSeek-R1-Distill-Llama-8B,Stella-En-400M-V5) 与K-means进行集群.
- 经典方法 (K-Medoids) 应用于缩小维度的混合数据 (UMAP,FAMD).
- 使用Silhouette分数和在儿科败血症数据集 (2686条记录) 上的统计测试来评估聚类质量.
主要成果:
- 斯特拉-En-400M-V5获得了最高的轮得分 (0.86).
- LLAMA 3.1 8B以集群目标确定了基于营养,临床和社会经济状况的不同患者子组.
- 基于LLM的方法通过捕捉更丰富的背景,在经典技术上表现出更高的性能.
结论:
- 基于LLM的集群有效地捕获上下文信息,并优于异质医疗数据的经典方法.
- 在资源有限的环境中,LLM集群对上下文表型和改进决策具有重大潜力.
- 这种方法可以通过识别细微的患者子组来增强个性化护理策略.


