AIは放射線科医のようなレポートを書けるか?大規模言語モデル生成の腰椎MRIレポートの盲検評価
Moreno Zanardo1, Domenico Albano2,3, Valentina Molinari4
1Radiology Unit, IRCCS Policlinico San Donato, San Donato Milanese, Italy.
European radiology experimental
|February 23, 2026
まとめ
放射線科医が作成した腰椎MRIレポートは、大規模言語モデル(LLM)によって生成されたレポートと比較して、品質と構造が優れている。しかし、AIによって生成されたレポートの一部は人間が作成したものと区別がつかず、LLMがレポート作成の効率化に役立つ可能性を示唆している。
科学分野:
- 放射線学; 人工知能; 医療情報学
背景:
- 大規模言語モデル(LLM)は、ますます医療レポートの生成能力を高めています。; LLMによって生成された腰椎MRIレポートの臨床的有用性と品質を、放射線科医が作成したレポートと比較して評価する必要があります。; AIによって生成されたレポートと人間が作成したレポートの識別可能性を評価することは、臨床実践への統合を理解するために不可欠です。
研究 の 目的:
- LLMによって生成された腰椎MRIレポートの品質と臨床的有用性を、放射線科医が作成したレポートと比較すること。; 医療専門家がAIによって生成されたレポートと人間が作成した腰椎MRIレポートを区別できるかどうかを判断すること。; 放射線診断レポートの効率と診断信頼性の向上におけるLLMの潜在的な役割を評価すること。
主な方法:
- 125件の匿名化された腰椎MRIレポート(人間作成104件、LLM生成21件)を使用したレトロスペクティブ研究。; 5名の医療専門家が、臨床的関連性、明瞭性、完全性、診断精度、および理解しやすさについて5段階のリッカート尺度を使用して、レポートを盲検評価しました。; 評価者は、レポートをAI生成または人間生成として分類し、正答率で精度を測定しました。
主要な成果:
- 人間が作成したレポートは、評価されたすべての領域で有意に高い中央値スコアを受けました(p < 0.001)。; 画像技術の説明においては、有意な差は観察されませんでした(p > 0.175)。; AIによって生成されたレポートの識別精度は評価者によって異なり、専門医の放射線科医は88.0%の精度を達成しました。
結論:
- 放射線科医が作成した腰椎MRIレポートは、現在のLLMによって生成されたレポートと比較して、品質と構造が優れていることを示しています。; 一部のLLMによって生成されたレポートは、特に非専門家読者にとって、人間が作成したレポートと区別がつかないものでした。; LLMは、構造化されたレポート作成において放射線科医を支援し、ワークフロー効率を高め、監督下で診断信頼性を維持する可能性を示しています。


