Video Experimental Relacionado
Updated: Feb 13, 2026

A Standardized Obstacle Course for Assessment of Visual Function in Ultra Low Vision and Artificial Vision
Published on: February 11, 2014
Un modelo unificado de lenguaje de visión para la detección de defectos entre productos en la fabricación de guantes
Yusen Zhao1,2, Liang Tian3,4, Yonggang Wang3,4
1Institute of Applied Mathematics, Hebei Academy of Sciences, Shijiazhuang, Hebei, China.
Un nuevo modelo multimodal de lenguaje grande (MLLM) ofrece detección de defectos unificada para el control de calidad industrial. Este marco escalable reemplaza múltiples modelos especializados, mejorando la eficiencia y reduciendo los costos en la inspección de fabricación.
Área de la Ciencia:
- La inteligencia artificial es la inteligencia artificial.
- Aprendizaje automático Aprendizaje automático.
- Visión por ordenador Visión por ordenador Visión por ordenador Visión por ordenador Visión por ordenador
Sus antecedentes:
- El control de calidad industrial se basa en la detección automatizada de anomalías.
- Los modelos actuales de aprendizaje profundo enfrentan problemas de escalabilidad debido a un enfoque de "un modelo por tarea", lo que aumenta los costos y la complejidad.
- Se necesita un marco unificado para manejar de manera eficiente diversos entornos de fabricación y líneas de productos.
Objetivo del estudio:
- Proponer un marco unificado de detección de defectos utilizando un Modelo Multimodal de Gran Lenguaje (MLLM).
- Para abordar las limitaciones de los modelos convencionales de aprendizaje profundo de una sola tarea en el control de calidad industrial.
- Demostrar la escalabilidad y la rentabilidad de un solo MLLM para la detección de defectos de múltiples productos.
Principales métodos:
- Desarrolló un marco unificado de detección de defectos basado en un Modelo Multimodal de Gran Lenguaje (MLLM).
- Empleó una estrategia de ajuste fino en dos etapas: ajuste fino supervisado (SFT) para el conocimiento del dominio y ajuste fino de refuerzo (RFT) para el razonamiento visual.
- Utilizó una función de recompensa verificable multifacética para optimizar la localización, clasificación y estructura de salida durante RFT.
Principales resultados:
- El MLLM mejorado con RFT logró una precisión promedio promedio (mAP) de 0.63 en un conjunto de datos de fabricación de guantes, comparable a una línea de base YOLO especializada (0.62).
- Un MLLM único y unificado entrenado en datos de productos mixtos mantuvo un rendimiento competitivo (mAP 0.61), manejando diferentes productos y defectos a través de instrucciones de lenguaje natural.
- Demostró la capacidad del MLLM para adaptarse dinámicamente a diversos productos y tipos de defectos.
Conclusiones:
- Un solo MLLM flexible puede reemplazar eficazmente múltiples modelos rígidos y especializados en la inspección industrial compleja.
- El marco MLLM propuesto ofrece una solución escalable y rentable para sistemas inteligentes de control de calidad.
- Este enfoque allana el camino para una inspección de fabricación automatizada más adaptable y eficiente.
Más Videos Relacionados
05:47Simulation of a Scaled Assembly Process with Collaboration of a Robotic Arm and Monitoring through a Vision System for Quality Control
Published on: August 29, 2025
06:16Involving Individuals with Developmental Language Disorder and Their Parents/Carers in Research Priority Setting
Published on: June 6, 2020
Videos de Conceptos Relacionados
Cross Product
The magnitude of the cross product is obtained by multiplying the magnitude of both the vectors and the sine of the angle between them. This means that a larger angle between the vectors will lead to a greater magnitude of the cross product.
Vector Product (Cross Product)
Consider the cross product of two vectors. Imagine rotating the first vector about...
Vision
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Crossing Over
The homologous pairs of sister chromosomes—one from the maternal and one from the paternal genome—then begin to align alongside each other lengthwise, matching corresponding DNA positions in a process...
Color Vision