Video Experimental Relacionado
Updated: Nov 24, 2025

Analyzing Mitochondrial Morphology Through Simulation Supervised Learning
Published on: March 3, 2023
Dominar Atari, Go, ajedrez y shogi mediante la planificación con un modelo aprendido
Julian Schrittwieser1, Ioannis Antonoglou1,2, Thomas Hubert1
1DeepMind, London, UK.
El algoritmo MuZero combina la búsqueda basada en árboles con un modelo aprendido para lograr un rendimiento sobrehumano en dominios complejos sin conocer la dinámica del entorno. Este avance de inteligencia artificial sobresale en los juegos de Atari y coincide con la mejor IA en Go y ajedrez.
Área de la Ciencia:
- Inteligencia artificial
- Aprendizaje automático
- Aprendizaje por refuerzo
Sus antecedentes:
- Las capacidades de planificación son cruciales para los agentes de inteligencia artificial.
- La planificación basada en árboles sobresale en dominios con simuladores perfectos (por ejemplo, ajedrez, Go).
- Los problemas del mundo real a menudo implican dinámicas ambientales complejas y desconocidas, que obstaculizan los métodos de planificación tradicionales.
Objetivo del estudio:
- Para introducir el algoritmo MuZero, un nuevo enfoque para la planificación de la inteligencia artificial.
- Demostrar la capacidad de MuZero para lograr un alto rendimiento sin conocimiento previo de la dinámica ambiental.
- Evaluar la efectividad de MuZero en diversos y visualmente complejos dominios.
Principales métodos:
- MuZero combina la búsqueda basada en árboles con un modelo aprendido.
- El algoritmo aprende un modelo iterable que predice la política, el valor y la recompensa.
- Este modelo aprendido apoya la planificación en entornos desconocidos.
Principales resultados:
- MuZero logró un rendimiento de vanguardia en 57 juegos de Atari, un dominio donde la planificación basada en modelos históricamente luchó.
- MuZero igualó el rendimiento sobrehumano de AlphaZero en Go, ajedrez y shogi sin conocimiento de las reglas del juego.
- El algoritmo demuestra fuertes capacidades de planificación en entornos visualmente complejos y dinámicos.
Conclusiones:
- El algoritmo MuZero representa un avance significativo en la planificación de la inteligencia artificial.
- El enfoque de modelo aprendido de MuZero supera las limitaciones de la planificación basada en modelos en entornos desconocidos.
- Este método ofrece una nueva herramienta poderosa para desarrollar agentes inteligentes capaces de abordar problemas complejos del mundo real.
Videos de Conceptos Relacionados
Observational Learning
Cognitive Learning
E. C. Tolman's theory of purposive behavior emphasizes that much behavior is goal-directed. He argued that to understand behavior, we must look at the entire sequence of actions leading to a goal. For instance, high school students study hard, not just due to past reinforcement but also to achieve the goal of getting into a good college.
Tolman introduced the idea that behavior is influenced by...
Associative Learning
Classical conditioning, also known...
Mechanistic Models: Compartment Models in Algorithms for Numerical Problem Solving
In individual population analyses, different algorithms are employed, such as Cauchy's method, which uses a...
Machines: Problem Solving II
Machines: Problem Solving I
The toggle clamp system is a machine structure consisting of movable, pin-connected multi-force members that form a stabilized system to transmit forces. The...

