ディスクレートセマンティック・エントロピーを用いた放射線学視覚言語モデルにおける幻覚フィルタリング
Patrick Wienholt1,2, Sophie Caselitz3,4, Robert Siepmann3,4
1Lab for Artificial Intelligence in Medicine, Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen, Aachen, Germany. pwienholt@ukaachen.de.
European radiology
|February 20, 2026
まとめ
ディスクリート・セマンティック・エントロピー (DSE) は,視覚言語モデル (VLMs) のために,幻覚に弱い質問を効果的に検出します. この方法は,放射線画像分析の精度を大幅に改善し,臨床アプリケーションのVLM信頼性を高めます.
科学分野:
- 人工知能 (AI) とは,人工知能 (AI) のことです.
- メディカルイマージング (医学イメージング)
- 自然言語処理 (Natural Language Processing) とは,自然言語処理で処理される言語のことです.
背景:
- ブラックボックス・ビジョン・ランゲージ・モデル (VLM) は,放射線画像分析のためにますます使用されています.
- 幻覚,または不正確な情報の生成は,臨床環境におけるVLMの信頼性にとって重要な課題となっています.
- 現在,VLMの幻覚を検出する方法は,特にブラックボックスシナリオでは限られています.
研究 の 目的:
- VLMsで幻覚を引き起こす可能性のある問題を特定する際の дискретセマンティックエントロピー (DSE) の有効性を評価する.
- DSEベースのフィルタリングが,放射線画像ベースの視覚的な質問応答 (VQA) でVLMの精度を向上させることができるかどうかを判断する.
主な方法:
- 2つの公開データセット (VQA-Med 2019と診断放射線学データセット) を利用したレトロスペクティブ研究です.
- GPT-4oおよびGPT-4.1モデルは,セマンティックレスポンスクラスターから計算されたDSEを使用して,質問に答えました.
- DSE > 0.3.3 の質問をフィルタリングする前に,そして後に精度が評価されました.
主要な成果:
- GPT-4oのベースライン精度は51.7%で,GPT-4.1のベースライン精度は54.8%でした.
- DSEフィルタリング (DSE > 0.3) の後,GPT-4oの精度が76.3%,GPT-4.1.1の精度が63.8%に増加した.
- ボンフェロニ補正後でも,データセット全体で精度上昇は統計的に有意であった.
結論:
- DSEは,意味論的不一致を定量化することによって,ブラックボックスVLMの幻覚を確実に検出します.
- この方法は,放射線学的VQAにおける診断応答の精度を大幅に高めます.
- DSEは,臨床VLMアプリケーションの安全性と信頼性を向上させるための実用的なフィルタリング戦略を提供します.


