AI作成患者ポータルメッセージのための検索拡張ガードレール:エラー分類法の構築と大規模評価
Wenyuan Chen1, Fateme Nateghi Haredasht2, Kameron C Black3
1Stanford Center for Biomedical Informatics Research, Stanford, CA, USA, wenyuanc@stanford.edu.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|February 27, 2026
まとめ
患者メッセージのLLM応答の評価は非常に重要です。新しい検索拡張エラーチェック(RAEC)パイプラインは、臨床エラー検出の精度と一貫性を向上させます。
科学分野:
- ヘルスインフォマティクス
- 医用人工知能
- 臨床自然言語処理
背景:
- 電子カルテ(EHR)ポータルを介した非同期患者-臨床医メッセージングは、臨床医のワークロードを増加させます。
- 大規模言語モデル(LLM)はメッセージ応答の支援に有望ですが、潜在的な不正確さのため、堅牢な評価が必要です。
- 既存の評価方法では、臨床コミュニケーションのニュアンスを十分に捉えられない可能性があります。
研究 の 目的:
- LLM生成患者メッセージ応答の評価のための臨床的根拠に基づくエラーオントロジーを導入すること。
- LLM応答評価の質を向上させるための検索拡張エラーチェック(RAEC)パイプラインを開発すること。
- 2段階プロンプトアーキテクチャを使用して、スケーラブルで解釈可能なエラー検出システムを実装すること。
主な方法:
- 帰納的コーディングと専門家裁定を通じて、5つのドメイン、59のコードからなるエラーオントロジーを開発しました。
- 判断を改善するために、意味的に類似した過去のメッセージ応答ペアを利用するRAECパイプラインを作成しました。
- 1,500件以上の患者メッセージに対して、階層的なエラー検出のためにDSPyを使用した2段階プロンプトアーキテクチャを採用しました。
主要な成果:
- RAECパイプラインは、特に臨床的完全性とワークフローの適切性において、エラー識別の改善を示しました。
- コンテキスト拡張評価は、ベースライン評価と比較して優れた一貫性(一致率=50% vs 33%)を示しました。
- 人間の検証では、コンテキスト拡張ラベル(0.500 vs 0.256)のパフォーマンスメトリック(F1スコア)が大幅に高くなりました。
結論:
- 提案された臨床的根拠に基づくエラーオントロジーとRAECパイプラインは、患者メッセージングのための効果的なAIガードレールを提供します。
- 検索拡張は、LLM応答評価の精度と信頼性を大幅に向上させます。
- このアプローチは、臨床コミュニケーションワークフローにおけるLLMの安全かつスケーラブルな展開をサポートします。


