代币散散化用于更快的医疗图像细分.
Lei Zhou1, Huidong Liu1,2, Joseph Bae3
1Department of Computer Science, Stony Brook University, NY, USA.
概括
这项研究引入了一个新的管道,用于在密集的预测任务中使用稀疏的代币,例如医疗图像细分. 提出的方法显著加速训练和推理,同时保持细分精度.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 医疗成像医学成像
背景情况:
- 视觉变压器 (ViT) 中的令牌散散化加速了分类,但其应用于密集的预测任务,如细分,仍然未被探索.
- 目前用于令牌修剪和掩面图像建模 (MIM) 的现有方法不足以进行细分,导致训练效率低下和功能恢复不佳.
研究的目的:
- 开发一种有效的方法来执行密集的预测,特别是细分,使用视觉转换器的稀疏令牌.
- 引入一条新的管道,以解决在细分任务中稀少使用代币的挑战.
主要方法:
- 一个三阶段的管道:稀疏编码,令牌完成和密集解码 (SCD).
- 软顶K令牌修剪 (STP) 通过预测令牌重要性和采样具有近似梯度的topK令牌来实现高效的稀疏编码.
- 多层令牌组合 (MTA) 通过整合稀疏的输出和中间令牌来实现强大的令牌完成.
主要成果:
- 拟议的SCD管道与STP和MTA在培训和推理吞吐量方面显著超过基线 (分别高达120%和60.6%).
- 尽管使用稀疏的代币,但这些方法保持了高的细分质量.
- 经验证据表明,对现有的分类分散技术的天真应用对于细分是失败的.
结论:
- 通过STP和MTA增强的SCD管道,可以使用Vision Transformers中的稀疏令牌进行高效和准确的细分.
- 这种方法提供了一个可行的解决方案,可以在不影响性能的情况下加速密集的预测任务.


