小児敗血症コホートのコンテキスト的表現型分類における大規模言語モデルの活用
Aditya Nagori1,2, Ayush Gautam1,3, Matthew O Wiens4,5,6
1Department of Surgery, Duke university school of medicine, Durham NC, USA.
AMIA ... Annual Symposium proceedings. AMIA Symposium
|February 23, 2026
まとめ
大規模言語モデル(LLM)は、低所得国の小児敗血症データにおいて、従来の И методыを上回る高度な患者サブグループクラスタリングを提供し、個別化医療を促進する。LLMクラスタリングは、より良い意思決定のために明確な患者プロファイルを明らかにする。
科学分野:
- 計算生物学
- 医療情報学
- 医療における人工知能
背景:
- 個別化医療とリソース最適化には、効果的な患者サブグループクラスタリングが必要です。
- 従来の手法は、高次元で異種なヘルスケアデータに対処する際に課題があり、コンテキストの理解が不足しています。
- 低所得国の小児敗血症データセットは、分析において特有の課題を提示します。
研究 の 目的:
- 古典的な手法と比較して、小児敗血症患者サブグループのLLMベースクラスタリングを評価すること。
- 異なるLLM埋め込みモデルとクラスタリング目的のパフォーマンスを評価すること。
- リソースが限られた環境でのコンテキスト的表現型分類におけるLLMクラスタリングの可能性を判断すること。
主な方法:
- 患者記録をテキストにシリアライズし、K-meansを用いたLLM埋め込み(LLAMA 3.1 8B、DeepSeek-R1-Distill-Llama-8B、Stella-En-400M-V5)を使用してクラスタリングしました。
- UMAP、FAMDを用いた次元削減混合データに古典的手法(K-Medoids)を適用しました。
- クラスタリング品質を、小児敗血症データセット(2,686件の記録)のシルエットスコアと統計的検定を用いて評価しました。
主要な成果:
- Stella-En-400M-V5が最高のシルエットスコア(0.86)を達成しました。
- クラスタリング目的を備えたLLAMA 3.1 8Bは、栄養、臨床、社会経済的プロファイルに基づいた明確な患者サブグループを特定しました。
- LLMベースの手法は、より豊かなコンテキストを捉えることで、古典的な手法よりも優れたパフォーマンスを示しました。
結論:
- LLMベースのクラスタリングは、コンテキスト情報を効果的に捉え、異種ヘルスケアデータに対して古典的な手法を上回ります。
- LLMクラスタリングは、リソースが限られた環境でのコンテキスト的表現型分類と意思決定の改善に大きな可能性を秘めています。
- このアプローチは、微妙な患者サブグループを特定することにより、個別化医療戦略を強化できます。


