为医学视觉问题答案优化多式模式:对VQA-RAD和SLAKE-VQA上的LoRA和AdaLoRA进行比较研究
Zahra Rezaei1, Sara Safi Samghabadi1, Yaser Mike Banad1
1School of Electrical and Computer Engineering, University of Oklahoma, Norman, OK, USA, 73019.
Computers in biology and medicine
|December 14, 2025
概括
像LoRA和AdaLoRA这样的参数有效微调 (PEFT) 技术显著提高了医疗视觉问题答案 (Med-VQA) 的AI. 这些方法优化了用于临床的多式模式模型,提高了医疗图像分析的准确性和效率.
科学领域:
- 人工智能在医学中的应用
- 医学图像分析 医学图像分析
- 人工智能中的计算效率
背景情况:
- 医疗视觉问答 (Med-VQA) 系统解释临床图像以帮助诊断.
- 资源有限的环境需要高效的AI模型用于临床部署.
- 领先的多式联运模型需要针对专业的Med-VQA任务进行优化.
研究的目的:
- 评估参数效率微调 (PEFT) 技术,以优化 Med-VQA.中多式模式的模型.
- 评估低级调整 (LoRA) 和适应性低级调整 (AdaLoRA) 的计算效率和准确性的有效性.
- 建立AI模型在临床应用中的性能基准.
主要方法:
- 选择和预处理的VQA-RAD和SLAKE-VQA数据集.
- 使用LoRA和AdaLoRA精细调整的多式联络模型 (Idefics3-8B-Llama3,idefics2-8b,LLaVA-1.5-7b,Qwen2-VL-7B-Instruct,Llama-3.2-11B-Vision-Instruct) 已经使用了LoRA和AdaLoRA.
- 优化的超参数和严格评估的模型性能.
主要成果:
- 使用AdaLoRA,Idefics3-8B-Llama3在VQA-RAD上获得了90%的准确性,使用LoRA则达到86%.
- 在使用LoRA的SLAKE-VQA上,idefics3-8B-Llama3和idefics2-8b的准确率达到93%.
- PEFT技术显示出显著的计算效率和高精度.
结论:
- 洛拉和AdaLoRA对于优化Med-VQA模型是有效的,提高了临床可行性.
- 优化的模型在基准数据集上表现出强的性能,适合临床应用.
- 这项研究为将高效的人工智能集成到医疗图像分析和决策支持中提供了见解.
相关概念视频
Improving Translational Accuracy
3.5K
3.5K
Improving Translational Accuracy
14.0K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.0K
