Video Experimental Relacionado
Updated: Sep 10, 2025

A Swin Transformer-Based Model for Thyroid Nodule Detection in Ultrasound Images
Published on: April 21, 2023
El modelado de canales enmascarados permite a los transformadores de visión aprender una mejor semántica
Jiayi Chen1, Yanbiao Ma2, Wei Dai1
1School of Telecommunications Engineering, Xidian University, Xi'an 710071, China.
El modelado de canal enmascarado (MCM) mejora los transformadores de visión mediante la reconstrucción de las características del canal, mejorando la comprensión semántica. Este nuevo enfoque supera a los métodos existentes en varias tareas visuales posteriores.
Área de la Ciencia:
- Visión por computadora
- Aprendizaje automático
- Inteligencia artificial
Sus antecedentes:
- Los transformadores de visión (ViTs) se destacan en el modelado del contexto espacial.
- El Modelado de Imágenes enmascaradas (MIM) es una técnica de pre-entrenamiento común para los ViTs, centrada en la reconstrucción espacial.
- Los métodos MIM existentes a menudo descuidan la continuidad semántica en la dimensión del canal.
Objetivo del estudio:
- Para introducir un nuevo paradigma de pre-entrenamiento, el Modelado de Canales enmascarados (MCM).
- Mejorar el aprendizaje de la representación visual centrándose en la continuidad semántica del canal.
- Mejorar la comprensión de las características de la imagen desde una perspectiva de canal.
Principales métodos:
- Proponer un paradigma de entrenamiento previo para el modelado de canales enmascarados (MCM).
- Reconstruir las características de los canales enmascarados utilizando información contextual de los canales sin enmascarar.
- Utilizando las características del codificador de imágenes CLIP como objetivos de reconstrucción avanzados para atributos semánticos mejorados.
Principales resultados:
- MCM mejora significativamente el rendimiento en las tareas posteriores.
- Eficacia demostrada y superioridad sobre los métodos existentes.
- Comprensión mejorada del modelo de imágenes a través de la continuidad semántica del canal.
Conclusiones:
- MCM es una estrategia de pre-entrenamiento eficaz para los Transformadores de la Visión.
- Centrarse en la continuidad semántica del canal ofrece una nueva dirección para MIM.
- El método propuesto muestra un gran potencial para avanzar en el aprendizaje de la representación visual.
Videos de Conceptos Relacionados
Types Of Transformers
If the ratio of the number of turns in the secondary winding to that of the primary winding is greater than one, then the transformer is said to be a step-up transformer. In a step-up transformer, the voltage at the secondary winding is greater than the voltage applied at the primary winding.
However, if this ratio is less than one, the transformer is said to be a step-down...
Transformers with Off-Nominal Turns Ratios
Observational Learning
Modeling and Similitude
Vision
Masking and Demasking Agents
There are many masking agents, such as cyanide, fluoride, triethanolamine, thiourea, and 2,3-bis(sulfanyl)propan-1-ol (formerly 2,3-dimercapto-1-propanol), with the masking agent chosen based on...

