大型言語モデルによるインテリジェントヘッド&ネック CTA レポート品質検出
Liping Tian1,2, Yao Lu1,2, Xiaolu Fei3
1Department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University, Beijing, 100053, China.
Journal of imaging informatics in medicine
|August 27, 2025
まとめ
GPT-4のような大型言語モデル (LLM) は,頭頸部CT血管図 (CTA) 報告の誤差を正確に検出でき,放射線の品質管理の効率を大幅に改善します.
科学分野:
- 放射線科
- 人工知能
- 医療情報学
背景:
- 放射線報告の品質管理は患者の安全と効果的な診断に不可欠です.
- 放射線報告のエラー検出を自動化することで,効率と正確性が向上します.
- 大型言語モデル (LLM) は,医学テキストの分析に希望を示しています.
研究 の 目的:
- GPT-4,ERNIE Bot,SparkDeskが,頭頸部CT血管図 (CTA) の報告における一般的なエラーを特定する際のパフォーマンスを評価する.
- 中国の放射線報告の品質管理プロセスをサポートするLLMの可能性を評価する.
- レポートの品質評価のための手動のレビューとLLMの効率と正確さを比較する.
主な方法:
- 2つのデータセットから15,000の頭と首のCTAレポートを集めました.
- 6つの一般的なエラータイプを特定し,LLMベースの検出方法を開発しました.
- レポートの品質は,5ポイントのリッカースケールと統計テスト (ウィルコクソンランクサム,フリードマン,ICC,ANOVA) を使用して評価されます.
- 正確さ,精度,リコール,F1スコアを使用してモデルのパフォーマンスを評価します.
主要な成果:
- LLMはデータセット2の6つの一般的なエラーの検出精度を95%以上達成しました.
- 初期報告と比較して最終報告では誤り検出率が低かった.
- GPT-4はマニュアルスコア (ICC=0. 517) と適度な一致性を示したが,ERNIE BotとSparkDeskはわずかに低い一致性を示した.
- LLMは人間の審査員よりも報告を大幅に速く評価しました.
結論:
- LLMは,ヘッドとネック CTA レポートのエラータイプを効果的に識別し,レポートの品質を区別することができます.
- これらのモデルは,品質管理の審査の効率を大幅に改善します.
- LLMは,放射線報告の品質保証を強化するために,実質的な研究と実用的な価値を持っています.


