合成MRI脳スキャンの報告から特性を抽出するために,大きな言語モデルで生成されたプロンプトを使用する:横断的な研究
John J Hanna1,2,3, Christopher S Evans2,4, Christopher R Dennis2
1Department of Internal Medicine, ECU Brody School of Medicine, Greenville, North Carolina, United States.
Methods of information in medicine
|February 19, 2026
まとめ
大型言語モデル (LLM) は,MRI脳レポートから特性を抽出する見込みを示しています. GPT-4のような新しいモデルはうまく動作し,LLMはこのタスクのために効果的なプロンプトを生成することもできます.
科学分野:
- 医療情報工学 医療情報工学
- 医療における人工知能
背景:
- 医療報告書から自動化された特徴抽出は,臨床,運用,研究目的において極めて重要です.
- 大型言語モデル (LLM) は,臨床テキストから特徴抽出とカテゴリ割り当てを自動化する可能性を秘めています.
研究 の 目的:
- 臨床医が設計したプロンプトとLLMが生成したプロンプトを使用して,MRI脳スキャンレポートからの特徴抽出の精度を比較する.
- 合成MRIレポートから事前に定義された特徴を抽出する5つのOpenAI LLMのパフォーマンスを評価する.
主な方法:
- 5つのOpenAI LLMは,合成MRI脳レポートから9つのバイナリ特性を抽出する能力についてテストされました.
- 2つのプロンプトタイプが使用されました:臨床医によるエンジニアリングとLLMによる生成です. パフォーマンスは,リコール,精度,精度,F1スコアを使用して評価されました.
主要な成果:
- すべてのモデルとプロンプトにおいて,平均リコール0.956,精度0.9347,精度0.982,F1スコア0.9431.7の平均リコール0.956,精度0.9347の平均リコール0.956の平均リコール0.9347の平均リコール0.956の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.9347の平均リコール0.
- GPT-3.5-turboは,LLMで生成されたプロンプトでより良いパフォーマンスを示したが,GPT-4モデルはプロンプトタイプに関係なく,一貫して他のモデルを上回った.
結論:
- LLMはMRI脳レポートから正確な特徴抽出の有意な可能性を示しており,GPT-4のような新しいモデルは堅実なパフォーマンスを示しています.
- LLMとプロンプトエンジニアリング戦略の選択は,医療画像レポートからの自動機能抽出の有効性に大きな影響を与えます.


