• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

9 – Predicción con Monte Carlo

Lección 9 del curso Aprendizaje por Refuerzo Nivel Intermedio.

En la lección anterior realizamos la segunda práctica del curso en donde implementamos los diferentes algoritmos de Programación Dinámica usando Open AI Gym y Python.

Como lo vimos en el módulo anterior, para poder hacer uso de los algoritmos de Programación Dinámica se requiere un conocimiento de todos los elementos del Proceso de Decisión de Markov, incluyendo el modelo del entorno. Y esto es una gran limitación, porque en problemas reales la mayoría de las veces desconocemos varios de estos elementos.

Así que en este módulo hablaremos de los Métodos de Monte Carlo, que no requieren el modelo del entorno, pues se trata de algoritmos a través de los cuales el Agente puede aprender a partir de la experiencia, es decir a partir de múltiples interacciones con el entorno.

Y en esta lección específicamente veremos el primer algoritmo de esta familia, la predicción de Monte Carlo, que nos permite evaluar una Política, es decir estimar su correspondiente función estado-valor:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Como lo acabamos de ver, los algoritmos de Programación Dinámica requieren el conocimiento completo del Proceso de Decisión de Markov, incluyendo el espacio de estados, el espacio de acciones, el factor de descuento y el modelo del entorno. Y esta necesidad es una limitación significativa, ya que en la mayoría de los problemas reales no es posible conocer detalladamente el entorno y sus reacciones a las acciones del Agente.

En contraste, los métodos de Monte Carlo abordan este inconveniente utilizando la experiencia del Agente para estimar las funciones valor y mejorar la Política, sin necesitar un conocimiento previo del modelo del entorno.

Así, en Monte Carlo las funciones estado-valor se estiman a partir de múltiples retornos promedio obtenidos de la experiencia del Agente, aplicando este principio tanto para la evaluación de la política como para su mejora y la obtención de la política óptima.

Y precisamente acabamos de ver cómo funciona el algoritmo de Predicción de Monte Carlo, que permite evaluar una Política (es decir obtener una estimación de la función estado-valor).

Entonces en la próxima lección seguiremos profundizando en esta familia de algoritmos y en particular veremos los algoritmos de control con Monte Carlo, que permiten evaluar y mejorar la política de forma iterativa hasta obtener una política óptima.

Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }