Lección 10 del curso Aprendizaje por Refuerzo Nivel Intermedio.
En la lección anterior vimos el algoritmo de predicción con Monte Carlo que en esencia permite evaluar una política a partir de la experiencia, es decir directamente a partir de la interacción entre el Agente y el entorno, sin necesidad de conocer el modelo de dicho entorno.
En esta lección veremos cómo usar estas misma ideas para obtener una política óptima para el Agente. Así que veremos en detalle los métodos de Control con Monte Carlo:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Recordemos que el algoritmo de iteración de la Política en la Programación Dinámica combina iterativamente la evaluación y mejora de la Política para obtener una Política óptima.
En Monte Carlo, este proceso se adapta usando algoritmos de predicción y la función acción-valor, enfrentando el desafío de no conocer el modelo del entorno, lo que requiere un balance dos conceptos importantísimos en el Aprendizaje por Refuerzo: la explotación (usar siempre la mejor acción conocida) y la exploración (probar acciones aleatorias).
El método «ϵ-greedy» maneja este balance al asignar una probabilidad «ϵ» para elegir acciones aleatorias. Y a su vez el control «on-policy» permite mejorar la misma política que se utiliza, mientras que el control «off-policy» separa la política exploratoria de la que se optimiza, buscando al final obtener la mejor política posible.
Así que acabamos de ver los dos principales algoritmos de control con Monte Carlo: “on-policy” y “off-policy”. Cualquiera de estos dos puede ser usado para optimizar la Política, aunque en la práctica los algoritmos “off-policy” son los más usados.
Con estos métodos estamos listos para la práctica 3 del curso, en donde veremos cómo entrenar un agente usando los algoritmos de Monte Carlo y OpenAI Gym.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio
