MedPTQ:在3D医疗图像细分中实现真正的培训后量化,这是一个实用的管道
Chongyu Qu1, Ritchie Zhao2, Ye Yu2
1Vanderbilt University, Department of Electrical and Computer Engineering, Nashville, Tennessee, United States.
Journal of medical imaging (Bellingham, Wash.)
|February 19, 2026
概括
MedPTQ能够为3D医疗成像AI模型实现真正的8位 (INT8) 量子化,显著减少模型大小和GPU上的推断时间. 这一进步允许在资源有限的医疗应用中高效地部署深度学习,而不会牺牲准确性.
科学领域:
- 医学成像人工智能 医学成像人工智能
- 深度学习优化优化
- 计算效率 计算效率 计算效率
背景情况:
- 量子化深度神经网络减少了计算需求,这对于医学成像至关重要.
- 现有的方法经常模拟量子化,未能减少模型大小或改善现实世界的速度.
- 现代GPU上的真实3D低位量子化在很大程度上仍未被探索.
研究的目的:
- 介绍MedPTQ,一个开源管道,用于真正的培训后量化.
- 实现真正的8位 (INT8) 推断,用于最先进的3D医疗细分模型.
- 在资源有限的医学成像设置中实现AI的高效部署.
主要方法:
- 使用TensorRT对未标记的数据集进行重量和激活的模拟量化.
- 在GPU上使用TensorRT引擎将模拟量子化转换为真实INT8量子化.
- 适用于各种3D医疗细分模型,包括U-Net,SwinUNETR和nnU-Net.
主要成果:
- 在GPU上,MedPTQ实现了真正的INT8量子化,将模型大小降低至3.83×,延迟降低至2.74×.
- 与全精度 (FP32) 模型相比,它保持了几乎相同的子相似系数 (mDSC) 性能.
- 在7个模型和3个不同的数据集中证明了有效性.
结论:
- MedPTQ为3D人工智能医学成像细分模型提供真实INT8推断.
- 减少模型大小,计算需求和GPU的延迟,而不会影响精度.
- 在各种AI架构,数据集和成像模式中显示出强大的概括性.


