Lección 3 del curso Aprendizaje por Refuerzo Nivel Intermedio.
En la lección anterior vimos todos los detalles de la evaluación de la Política, el primer algoritmo básico de la Programación Dinámica.
Para entender en detalle la manera como funciona este algoritmo, en esta lección haremos un ejemplo paso a paso para ver cómo se actualizan los diferentes valores de los estados al momento de aplicar el algoritmo de forma iterativa:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, para este ejemplo práctico asumiremos un sencillo juego que llamaremos «el tablero bidimensional estocástico».
Este tablero consiste en 16 estados, y el objetivo es que el Agente debe ir del estado 0 al 15, obteniendo una recompensa de 1 solo al llegar al estado 15. Los estados 5, 7, 11, 12 y 15 son terminales y además las acciones ejecutadas por el Agente tienen un comportamiento estocástico con una probabilidad del 33% en la dirección especificada y 66% en las direcciones ortogonales.
Con base en este juego vimos cómo ejecutar el algoritmo de evaluación de la Política, que en esencia actualiza iterativamente los valores de los estados según la ecuación de Bellman hasta que la máxima variación entre iteraciones sea menor a un umbral predefinido, culminando en este caso particular en la iteración 218 con los valores aproximados de los estados.
Así que este ejemplo nos ha permitido entender los cálculos y el procedimiento que lleva a cabo internamente el algoritmo de evaluación de la Política.
Entonces es momento de ir al siguiente paso, el algoritmo de Mejora de la Política que veremos en la próxima lección, y que es un algoritmo que nos permite partir de una política y, como su nombre lo indica, aplicar mejoras para obtener un mejor desempeño del Agente.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio
