大規模言語モデルを救急科再診予測因子として評価する
Emma Chen1, Luyang Luo2, Fatma Gunturkun3
1Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA2Harvard John A. Paulson School Of Engineering And Applied Sciences, Cambridge, MA, USA, yingchen@g.harvard.edu.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|February 27, 2026
まとめ
大規模言語モデル(LLM)は臨床予測において可能性を示していますが、実際の救急科(ED)再診タスクには苦労しています。現在のLLMは、高度な手法を用いても、従来のモデルを上回ることはできず、臨床予測における限界を浮き彫りにしています。
科学分野:
- 医療における人工知能
- 臨床情報学
- ヘルスケアのための機械学習
背景:
- 大規模言語モデル(LLM)は、臨床推論および質問応答の能力を示しています。
- 患者の転帰の予測など、実際の臨床予測タスクに対するLLMの有効性は、ほとんど調査されていません。
- 救急部(ED)の再診を予測することは、患者ケアとリソース配分を最適化するために重要です。
研究 の 目的:
- 30日以内の救急部(ED)再診を予測する上での大規模言語モデル(LLM)のパフォーマンスを評価すること。
- 直接予測および埋め込みベースのアプローチを含む、さまざまなLLMモデリングパラダイムを比較すること。
- 包括的な臨床データを使用した従来の機械学習モデルのLLMパフォーマンスをベンチマークすること。
主な方法:
- スタンフォード大学の138,010件の成人ED受診を含む大規模な研究。
- 2つのLLMアプローチが評価されました。自然言語出力による直接予測と埋め込みベースの方法(LLM2Vec)。
- 検索拡張が直接予測に適用されました。
- LLM由来の埋め込みが下流モデリングに使用されました。
主要な成果:
- 埋め込みベースのLLMアプローチ(LLM2Vec F1=0.4505)は、直接予測法(Claude 3.7 F1=0.4160、検索拡張付き)を上回りました。
- 広範なデータにアクセスできるにもかかわらず、すべてのLLMアプローチ(F1=0.3022-0.4505)は、構造化データのみを使用した従来のLightGBMモデル(F1=0.4614)を下回りました。
- 17,488件の予測の分析により、LLMの推論の失敗には、過去の情報を過大評価すること、保護因子を無視すること、リスク回避などが含まれることが示唆されました。
結論:
- 現在の世代のLLMは、ED再診予測のような臨床予測タスクにおいて基本的な限界を示しています。
- 埋め込みベースのLLM方法は有望ですが、まだ従来のモデルを上回っていません。
- 臨床アプリケーションにおけるLLMの体系的な推論の失敗に対処するためには、さらなる研究が必要です。


