Video Experimental Relacionado
Updated: Sep 9, 2025

Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
mL-BFGS: Un L-BFGS basado en el impulso para la optimización de redes neuronales distribuidas a gran escala
Yue Niu1, Zalan Fabian1, Sunwoo Lee2
1Department of Electrical and Computer Engineering, University of Southern California.
Presentamos mL-BFGS, un algoritmo basado en el impulso que mejora los métodos cuasi-Newton para el entrenamiento de redes neuronales profundas. Este método estabiliza la convergencia y acelera el entrenamiento para modelos distribuidos a gran escala.
Área de la Ciencia:
- Aprendizaje automático
- Algoritmos de optimización
- Las redes neuronales profundas
Sus antecedentes:
- Los métodos cuasi-Newton, incluido el L-BFGS, enfrentan desafíos en el entrenamiento de redes neuronales profundas a gran escala debido a los costos computacionales y la inestabilidad en entornos estocásticos.
- Las adaptaciones existentes de L-BFGS para el entrenamiento estocástico a menudo introducen gastos generales significativos, negando los beneficios de la convergencia.
Objetivo del estudio:
- Proponer mL-BFGS, un algoritmo L-BFGS ligero basado en el impulso diseñado para una optimización eficiente de redes neuronales profundas distribuidas a gran escala.
- Mejorar la estabilidad y reducir la carga computacional de los métodos cuasi-Newton en el aprendizaje profundo.
Principales métodos:
- Desarrollado mL-BFGS, incorporando un esquema de impulso en la actualización L-BFGS para mitigar el ruido estocástico en las aproximaciones de Hesse.
- Implementación de la aproximación de Hessian en mL-BFGS para distribuir los costos computacionales y de memoria entre los nodos para el entrenamiento a gran escala.
- Proporcionó un análisis teórico de convergencia para mL-BFGS en escenarios de optimización estocástica.
Principales resultados:
- mL-BFGS demostró convergencia estabilizada durante la optimización estocástica mediante la reducción del ruido en las aproximaciones de Hessian.
- La aproximación de Hessian en bloques permitió un escalamiento eficiente de la computación y la memoria para el entrenamiento distribuido.
- Los resultados empíricos en modelos neuronales de referencia mostraron una aceleración significativa en cuanto a iteración y reloj de pared en comparación con los métodos de referencia como SGD y Adam.
Conclusiones:
- mL-BFGS ofrece un enfoque prometedor para aprovechar los métodos cuasi-Newton en el entrenamiento de redes neuronales profundas a gran escala.
- El algoritmo propuesto equilibra efectivamente la eficiencia computacional con la estabilidad de convergencia, superando a los métodos existentes.
Videos de Conceptos Relacionados
Distributed Loads: Problem Solving
Mechanistic Models: Compartment Models in Algorithms for Numerical Problem Solving
In individual population analyses, different algorithms are employed, such as Cauchy's method, which uses a...
Maxwell-Boltzmann Distribution: Problem Solving
This distribution function f(v) is defined by saying that the expected number N (v1,v2) of particles with speeds between v1 and v2 is given by
Distributed Loads
For example, consider a bookshelf filled with books stacked vertically adjacent to each other. The weight of the books is evenly distributed over the length of the shelf. As a result, the pressure at different locations on the surface of the...
Multimachine Stability
In analyzing the system, the nodal equations represent the relationship between bus voltages, machine voltages, and machine currents. The nodal equation is given by:
Linear Momentum in Control Volume

