Lección 1 del curso Aprendizaje por Refuerzo Nivel Intermedio.
En esta primera lección del curso haremos un repaso de los conceptos esenciales del aprendizaje por refuerzo vistos en el curso anterior: es decir que hablaremos de los elementos de un sistema de aprendizaje por refuerzo, de los procesos de decisión de Markov, del Agente y de las ecuaciones de Bellman.
Luego introduciremos algunos conceptos fundamentales, como los problemas basados en modelos y libres de modelos, así los problemas de predicción y de control. Y al final de la lección veremos un panorama de los algoritmos clásicos de Aprendizaje por Refuerzo que veremos en detalle a lo largo del curso:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Recordemos que el Aprendizaje por Refuerzo implica la interacción continua entre un Agente y su entorno, donde el Agente recibe señales de estado y recompensa y toma acciones basadas en una Política para maximizar el retorno total.
Y también recordemos que los Procesos de Decisión de Markov (MDP) proporcionan una estructura matemática para la formulación de problemas de Aprendizaje por Refuerzo, incluyendo elementos como el espacio de estados, el espacio de acciones, la función de recompensa, la función de transición y el factor de descuento.
Por otra parte, la Política del Agente guía la toma de decisiones para maximizar el retorno y se complementa con funciones valor y las Ecuaciones de Bellman.
Y teniendo en cuenta estos elementos, existen diferentes algoritmos de Aprendizaje por Refuerzo que buscan precisamente entrenar estos Agentes, es decir obtener una Política que les permita interactuar con su entorno de manera óptima.
Y estos algoritmos de Aprendizaje por Refuerzo se pueden dividir en dos grandes categorías: los basados en modelos, que utilizan toda la información del MDP para planificar, y los algoritmos libres de modelos, donde el Agente aprende a través de la interacción con el entorno.
Además, podemos usar enfoques de predicción (que buscan calcular el retorno a partir de una política dada) o de control (cuyo objetivo es encontrar la Política óptima).
Y por último tenemos las tres principales familias de algoritmos clásicos: la Programación Dinámica, los algoritmos Monte Carlo y las Diferencias Temporales, que desarrollaremos en detalle a lo largo de este curso.
Así que con esta introducción ya estamos listos para comenzar a ver en detalle cada una de estas familias. Entonces, en el segundo módulo del curso nos enfocaremos en los algoritmos de Programación Dinámica y en particular en la próxima lección veremos el primero de estos algoritmos de predicción para la evaluación de la Política.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio
