MedFusionT5:跨模态注意力提高语义质量,减少牙科AI中的幻觉
Hamida Abdaoui1, Sabri Barbaria1, Ismail Dergaa2
1Laboratory of Biophysics and Medical Technologies, Higher Institute of Medical Technologies of Tunis (ISTMT), University of Tunis El Manar, Tunis, Tunisia.
International dental journal
|March 2, 2026
概括
MedFusionT5 增强了使用单向交叉模式对齐的自动牙科报告生成,显著提高了报告质量,并减少了人工智能产生的幻觉,以便可靠的临床使用.
科学领域:
- 人工智能在牙科中的应用
- 医学成像分析 医学成像分析
- 自然语言生成自然语言生成
背景情况:
- 自动牙科报告生成与多式联络融合作斗争,导致语义质量差和AI幻觉.
- 使用简单连接或双向注意力的现有方法无法在牙科成像中捕捉复杂的视觉文本关系.
研究的目的:
- 开发MedFusionT5,一个新的单向交叉模式对齐框架,用于高级牙科报告生成.
- 通过最大限度地减少人工智能产生的幻觉来提高临床报告质量并确保事实一致性.
主要方法:
- 实现了一个视觉转换器 (ViT) 用于视觉特征提取和Bio_ClinicalBERT用于文本编码.
- 引入了一个单向的多头注意力对齐模块,用于选择性地图的文本到视觉补丁.
- 使用T5基解码器生成报告,对700张牙科全景放射图进行评估.
主要成果:
- 在诸如CIDEr (122%的增长与共同注意力相比) 和BLEU-4 (0.865) 等指标上,MedFusionT5显著超过了基线方法.
- 达到2.42%的最低幻觉率,与注意力相比减少了39%.
- 在准确度 (0.982) 和回忆 (0.923) 之间取得了最佳平衡,在报告长度之间保持一致的质量.
结论:
- 通过单向交叉模式对齐,MedFusionT5通过单向交叉模式对齐来实现自动化牙科报告生成的最新技术.
- 单向关注被确定为可信的医疗AI的最佳策略,确保临床部署的准确性和可靠性.

