前立腺がんにおける大規模言語モデルを用いた医師のリスクコミュニケーション評価
Guillermo Lopez-Garcia1, Dongfang Xu2, Michael Luu3
1Department of Computational Biomedicine, Cedars-Sinai Medical Center, Los Angeles, CA, USA, Guillermo.LopezGarcia@cshs.org.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|February 27, 2026
まとめ
大規模言語モデル(LLM)は、前立腺がんケアにおける医師のリスクコミュニケーションを自動的に評価できるようになりました。このAI主導のアプローチは、患者と医師の議論を評価するためのスケーラブルなソリューションを提供します。
科学分野:
- 腫瘍学
- 医療情報学
- 人工知能
背景:
- 効果的なリスクコミュニケーションは、前立腺がん治療における共有意思決定にとって重要です。
- 現在、医師のコミュニケーションを手動で評価することは時間がかかり、スケーラブルではありません。
- この評価を自動化することで、患者と医師の相互作用の質を向上させることができます。
研究 の 目的:
- 大規模言語モデル(LLM)を用いたリスクコミュニケーションの質を自動評価するフレームワークを開発・評価すること。
- 前立腺がんの共有意思決定に関連する主要概念の医師のコミュニケーションを評価する上でのLLMのパフォーマンスを評価すること。
- 腫瘍学における医師と患者のコミュニケーションを分析するためのスケーラブルな方法を確立すること。
主な方法:
- 予後、余命、勃起不全、尿失禁、尿路症状の5つの主要概念に関する医師のコミュニケーションを評価するためのルーブリックベースのフレームワークが開発されました。
- 20回の臨床訪問のトランスクリプトがアノテーションされ、リスクコミュニケーションの質に基づいて487文が0から5のスケールでスコアリングされました。
- このタスクは多クラス分類問題としてモデル化され、ルーブリックベースおよび連鎖思考(CoT)プロンプティング(少数ショット学習を含む)を用いたファインチューニングされたトランスフォーマーベースラインとGPT-4oを評価しました。
主要な成果:
- 最もパフォーマンスの高いアプローチは、ルーブリックベースのCoTプロンプティングと少数ショット学習を組み合わせたものでした。
- この手法は、異なるコミュニケーションドメイン全体で85.0%から92.0%のマイクロ平均F1スコアを達成しました。
- AI主導のアプローチは、教師ありベースラインを上回り、人間のアノテーション間の一致に匹敵しました。
結論:
- LLMは、前立腺がんの診察における医師のリスクコミュニケーションを評価するためのスケーラブルで正確な方法を提供します。
- このAI主導のフレームワークは、コミュニケーションに関する客観的なフィードバックを提供することにより、共有意思決定の質を向上させることができます。
- この調査結果は、医療における医師と患者のコミュニケーションを評価するためのAIの広範な応用を支持するものです。


