Video Experimental Relacionado
Updated: Feb 20, 2026

Combining Computer Game-Based Behavioural Experiments With High-Density EEG and Infrared Gaze Tracking
Published on: December 16, 2010
Dominar el juego de Go sin conocimiento humano
David Silver1, Julian Schrittwieser1, Karen Simonyan1
1DeepMind, 5 New Street Square, London EC4A 3TW, UK.
Un nuevo algoritmo de inteligencia artificial, AlphaGo Zero, aprende únicamente a través del aprendizaje por refuerzo sin datos humanos. Logró un rendimiento sobrehumano en el juego de Go entrenando con sus propios datos de juego.
Área de la Ciencia:
- Inteligencia artificial
- Aprendizaje por refuerzo
- Teoría de juegos
Sus antecedentes:
- Un objetivo clave en la inteligencia artificial (IA) es crear algoritmos capaces de lograr una competencia sobrehumana en dominios complejos.
- Los sistemas de IA anteriores, como AlphaGo, utilizaban el aprendizaje supervisado de datos de expertos humanos y el aprendizaje de refuerzo del autojuego.
- Sin embargo, estos sistemas todavía dependían del conocimiento y la guía humanos.
Objetivo del estudio:
- Desarrollar un algoritmo de IA que aprenda exclusivamente a través del aprendizaje por refuerzo, sin ningún dato humano o experiencia en el dominio.
- Demostrar que una IA puede convertirse en su propio maestro, mejorando su rendimiento de forma iterativa a través del autojuego.
- Para lograr un rendimiento sobrehumano en el juego de Go utilizando un nuevo enfoque de IA autodidacta.
Principales métodos:
- El estudio presenta un algoritmo, AlphaGo Zero, basado únicamente en el aprendizaje por refuerzo.
- Una red neuronal está entrenada para predecir las propias selecciones de movimiento de AlphaGo Zero y los resultados del juego.
- Esta red neuronal mejora el algoritmo de búsqueda de árboles, lo que lleva a una mejor selección de movimientos y un autojuego más fuerte en iteraciones posteriores.
Principales resultados:
- AlphaGo Zero aprendió completamente desde cero, sin datos humanos, orientación o conocimiento de dominio más allá de las reglas del juego.
- El algoritmo logró un rendimiento sobrehumano en el juego de Go.
- AlphaGo Zero derrotó al anterior campeón por una puntuación de 100-0.
Conclusiones:
- El aprendizaje por refuerzo solo, sin datos humanos, es suficiente para que una IA logre un rendimiento sobrehumano en dominios desafiantes.
- El autojuego y la auto-mejora iterativa son mecanismos poderosos para el aprendizaje y el desarrollo de la IA.
- AlphaGo Zero representa un avance significativo en la IA, demostrando un nuevo paradigma para el entrenamiento de algoritmos.
Videos de Conceptos Relacionados
Observational Learning
Understanding Deception
Purposive Learning
High-Level and Low-Level Awareness
Avoidance Learning and Learned Helplessness
Avoidance learning occurs when an organism learns that a specific behavior can prevent an unpleasant outcome. For example, a student who receives a bad grade may start studying harder to avoid future poor grades. This behavior persists even when the negative outcome is no longer present. Avoidance learning is powerful because it maintains behavior in the absence of the...
Machines: Problem Solving II

