電子医療記録から精神疾患のフェノタイプ抽出のための大規模な言語モデル
Clara Frydman-Gani1, Alejandro Arias2, Maria Perez Vallejo3
1Center for Neurobehavioral Genetics, Semel Institute for Neuroscience and Human Behavior, David Geffen School of Medicine, University of California Los Angeles, Los Angeles, USA.
微調整された大型言語モデル (LLM) は,臨床ノートからの精神病現象の検出を大幅に改善しました. 新しいモデル"ミストラル・スモール・サイク"は スペイン語の文章の表型を正確に識別し 精密精神医学の研究を進めています
科学分野:
- 精神科
- コンピュータ言語学
- バイオ情報学
背景:
- 電子医療記録 (EHR) による正確な臨床フェノタイプ化は,精神医学の研究において極めて重要です.
- フリーテキストの臨床ノートから 症状レベルの情報を抽出することは 挑戦的ですが 必須です
研究 の 目的:
- スペイン語の臨床テキストから109の精神病現象を検出するための11のオープンソースの生成型大言語モデル (LLM) のパフォーマンスを評価する.
- 伝統的な自然言語処理 (tNLP) 方法と比較する.
- 精神科のフェノタイプ化のための精巧なLLMを開発し,検証する.
主な方法:
- コロンビアの精神科クリニックから EHRのノートで11の生成型LLMをテストした.
- ゼロショット,少数のショット,そして微調整の設定でLLMを評価した.
- LLMのパフォーマンスをtNLPの方法と比較し,外部データで精密調整されたモデルを検証した.
主要な成果:
- ベースLLMのパフォーマンスは低から中等であったが,微調整によりパフォーマンスは著しく改善された (マクロF1は0.2-0.74から0.75-0.86).
- いくつかの精密調整されたLLMは,tNLPメソッドを上回り,100種類のフェノタイプを確実に検出しました (F1>0.8).
- 合成データセットにより"ミストラル・スモール・サイク" (マクロF1=0.79) が作成され,外部データにもよく一般化されました.
結論:
- ドメイン特有の微調整は,精神科のフェノタイプ化のためのLLMの能力を高めます.
- Mistral-small-psychは,スペイン語で正確な大規模な精神病学的な表型化のための貴重なツールを提供します.
- この研究は,EHRデータ利用の改善を通じて,グローバルな精密精神医学の進歩を支援します.
さらに関連する動画
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
関連する概念動画
Statistical Methods for Analyzing Epidemiological Data
Statistical Software for Data Analysis and Clinical Trials
Behavioral Genetics and Its Designs
The primary methodologies used in behavior genetics include family studies, twin studies, and adoption studies, each providing unique...
