Video Experimental Relacionado
Updated: Feb 24, 2026

Integrating Visual Psychophysical Assays within a Y-Maze to Isolate the Role that Visual Features Play in Navigational Decisions
Published on: May 2, 2019
Estrategia de exploración adaptativa en el aprendizaje por refuerzo basado en valores Q y cognición ambiental
Tenglong Yang1, Jingbao Hou2, Peiyi Zhang3
1National-local Joint Engineering Laboratory of Marine Mineral Resources Exploration Equipment and Safety Technology, Hunan University of Science and Technology, Xiangtan, 411201, Hunan, China; College of Mechanical and Electrical Engineering, Hunan University of Science and Technology, Xiangtan, 411201, Hunan, China.
Este estudio presenta Var, una estrategia de exploración adaptativa para el aprendizaje por refuerzo que equilibra la exploración y la explotación. Var mejora el rendimiento del aprendizaje y reduce las acciones catastróficas en diversos entornos.
Área de la Ciencia:
- La inteligencia artificial es inteligencia artificial.
- Aprendizaje automático Aprendizaje automático.
- Aprendizaje por Refuerzo Aprendizaje por Refuerzo
Sus antecedentes:
- El aprendizaje por refuerzo (RL) sobresale en la toma de decisiones secuenciales, pero tiene problemas con el equilibrio exploración-explotación.
- Los métodos existentes a menudo utilizan señales únicas, lo que lleva a una exploración ineficiente y soluciones subóptimas.
Objetivo del estudio:
- Desarrollar una estrategia de exploración adaptativa para el aprendizaje por refuerzo.
- Mejorar la eficiencia y el rendimiento del aprendizaje al abordar las limitaciones de las técnicas de exploración actuales.
Principales métodos:
- Proponer Var, una estrategia de exploración adaptativa que utiliza los valores Q y la cognición ambiental (diferencia de valor Q y bonificación de novedad).
- Integrar Var en el aprendizaje Q (Var-QL) y las redes Q profundas (Var-DQN).
- Introducir LRU-Var-QL para grandes entornos discretos tabulares, incorporando una caché de Lo Menos Usado Recientemente (LRU).
Principales resultados:
- Var fomenta la exploración amplia y profunda inicialmente, pasando a la explotación.
- LRU-Var-QL demostró una reducción de las acciones catastróficas en FrozenLake-v1.
- Var-QL y Var-DQN lograron mayores rendimientos acumulados y un aprendizaje más rápido en los juegos de Atari en comparación con las líneas de base.
Conclusiones:
- La estrategia Var propuesta mejora la exploración del aprendizaje por refuerzo.
- Los métodos basados en var muestran mejoras significativas en la velocidad de aprendizaje y el rendimiento en diversos entornos.
Videos de Conceptos Relacionados
Cognitive Learning
E. C. Tolman's theory of purposive behavior emphasizes that much behavior is goal-directed. He argued that to understand behavior, we must look at the entire sequence of actions leading to a goal. For instance, high school students study hard, not just due to past reinforcement but also to achieve the goal of getting into a good college.
Tolman introduced the idea that behavior is influenced by...
Decision Making: P-value Method
First, a specific claim about the population parameter is proposed. The claim is based on the research question and is stated in a simple form. Further, an opposing statement to the claim is also stated. These statements can act as null and alternative hypotheses: a null hypothesis would be a neutral statement while the alternative hypothesis can...
Avoidance Learning and Learned Helplessness
Avoidance learning occurs when an organism learns that a specific behavior can prevent an unpleasant outcome. For example, a student who receives a bad grade may start studying harder to avoid future poor grades. This behavior persists even when the negative outcome is no longer present. Avoidance learning is powerful because it maintains behavior in the absence of the...
Observational Learning
Environmental Influences on Intelligence
Reinforcement
Positive reinforcement occurs when a behavior is followed by the presentation of a rewarding stimulus, increasing the frequency of that behavior. For example:

