基准XAI:对多模式生物医学数据的后期可解释人工智能方法进行全面的基准测试
Jacqueline Michelle Metsch1, Anne-Christin Hauschild2
1Institute for Medical Informatics, University Medical Center Göttingen, Germany.
Computers in biology and medicine
|April 16, 2025
概括
在医学应用中,对可解释的人工智能 (AI) 方法的基准测试至关重要. BenchXAI评估了各种生物医学数据中的15种AI可解释性技术,确定了可靠的医疗AI的高性能方法.
科学领域:
- 生物医学数据分析
- 医学中的人工智能
- 可解释的人工智能 (XAI)
背景情况:
- 数字化和人工智能为医学提供了预测建模的机会.
- 深度学习模型很出色,但却面临着"黑子"的问题,阻碍了信任.
- 现有的可解释AI (XAI) 方法通常以单个数据类型进行评估,从而限制了跨模式的适用性.
研究的目的:
- 开发和引入BenchXAI,这是一个用于评估XAI方法在生物医学上下文的新型基准测试包.
- 评估15种XAI方法在各种生物医学数据模式中的稳定性,适用性和局限性.
- 为统计评估和XAI方法性能和稳定性的可视化提供一个框架.
主要方法:
- 开发BenchXAI,一个全面的XAI方法评估包.
- 将BenchXAI应用于三个常见的生物医学任务:临床,成像/信号和生物分子数据.
- 实施新的样本智能规范化,用于后期XAI方法,以实现统计分析.
主要成果:
- 四种XAI方法 (集成梯度,DeepLift,DeepLiftShap,GradientShap) 在所有评估的生物医学任务中表现出强的表现.
- 某些XAI方法 (解卷,引导逆向传播,LRP-α1-β0) 在特定任务上显示出局限性.
- 基准测试揭示了XAI方法之间的性能差异,取决于数据模式和任务.
结论:
- BenchXAI为医学中比较和验证XAI方法提供了一个至关重要的资源.
- 该研究强调了对于可靠的医疗AI而言,需要对模式有意识的XAI评估.
- 研究结果支持在生物医学领域越来越需要可解释的人工智能,尤其是在欧盟人工智能法案等新兴法规的情况下.


