Video Experimental Relacionado
Updated: Sep 9, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Detección de muestras de puerta trasera basada en la consistencia de la discrepancia de perturbación en modelos de
Zuquan Peng1, Jianming Fu1, Lixin Zou1
1Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, Wuhan, 430000, Hubei, China.
Introducimos un nuevo método de detección de muestras de puerta trasera, la Evaluación de Consistencia de Discrepancia de Perturbación (NETE), que identifica datos maliciosos en modelos previamente entrenados sin necesidad de muestras envenenadas o recursos extensos. NETE detecta efectivamente los ataques de puerta trasera tanto en las fases de entrenamiento como de inferencia.
Área de la Ciencia:
- Inteligencia artificial
- Seguridad del aprendizaje automático
Sus antecedentes:
- Los modelos pre-entrenados son vulnerables a los ataques de la puerta trasera de los datos no verificados.
- Los métodos de detección existentes a menudo no son prácticos debido a los requisitos de recursos o acceso.
Objetivo del estudio:
- Desarrollar un método práctico y eficaz de detección de muestras de puerta trasera.
- Permitir la detección tanto en las fases previas como posteriores a la formación.
Principales métodos:
- Proponer una evaluación de la coherencia de las discrepancias de perturbación (NETE).
- Utilice modelos previamente entrenados y una estrategia de relleno de máscara para las perturbaciones.
- Medir las discrepancias de probabilidad de registro utilizando la curvatura para evaluar la consistencia.
Principales resultados:
- NETE aprovecha el fenómeno de que la discrepancia de perturbación cambia menos para las muestras de puerta trasera que para las muestras limpias.
- El método supera las técnicas de detección de caja negra de disparo cero existentes.
- Eficacia demostrada contra cuatro ataques típicos de puerta trasera y cinco tipos de ataques de puerta trasera de modelos de lenguaje grandes.
Conclusiones:
- NETE ofrece una solución práctica para la detección de muestras de puerta trasera.
- El método es efectivo en varios tipos de ataques y fases de modelo.
- Mejora la seguridad de los modelos pre-entrenados contra el envenenamiento de datos.
Más Videos Relacionados
Videos de Conceptos Relacionados
Survival Tree
Building a Survival Tree
Constructing a...
Difference from Background: Limit of Detection
The LOD indicates the presence or absence...
Improving Translational Accuracy
Detection of Gross Error: The Q Test
Mismatch Repair
¹H NMR: Interpreting Distorted and Overlapping Signals
As Δν decreases and the signals move closer, the doublets appear increasingly distorted. The intensities of the inner lines increase at the cost of those of the outer lines as the signals are...

