Lección 1 del curso Aprendizaje por Refuerzo Nivel Avanzado.
En esta primera lección comenzaremos entendiendo qué son los algoritmos de Aprendizaje por Refuerzo basados en valores y basados en políticas, lo que nos permitirá introducir y ver algunas de las ventajas de los métodos del Gradiente de la Política y Actor-Crítico que serán el tema central de este curso:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, podemos dividir los diferentes métodos de Aprendizaje por Refuerzo clásico en dos grandes familias: los algoritmos basados en valores y los algoritmos basados en políticas.
Los primeros estiman una función valor de forma directa (bien sea la función estado-valor o la función acción-valor) y luego, a partir de dicha estimación, obtienen la Política pero de forma indirecta. Por otra parte, los algoritmos basados en políticas (como lo son precisamente el método del Gradiente de la Política y el algoritmo REINFORCE que veremos en este curso) estiman la Política del Agente de forma directa.
Y cuando combinamos lo mejor de cada uno de estos dos mundos tenemos los métodos Actor-Crítico (que veremos al final del curso) donde se estima de forma directa la Política (componente Actor) y luego se evalúa dicha política usando métodos basados en valores (componente Crítico).
De hecho, todos los algoritmos que vimos en el curso de Aprendizaje por Refuerzo Nivel Intermedio (como por ejemplo los algoritmos de programación dinámica, Monte Carlo, SARSA y Q-learning) son precisamente algoritmos basados en valores, que tienen limitaciones cuando tenemos espacios de acciones de alta dimensionalidad o que son continuos. En estas situaciones generalmente los métodos del Gradiente de la Política o Actor-Crítico tienden a funcionar mejor.
Así que en este punto ya tenemos un panorama general de lo aprendido hasta el momento y tenemos una visión general de las principales ventajas que tienen los algoritmos basados en políticas comparados con los métodos basados en valores. Entonces, en las dos siguientes lecciones de este primer módulo del curso veremos algunos conceptos esenciales que nos permitirán posteriormente construir toda la teoría alrededor de los métodos del Gradiente de la Política.
Y específicamente, en la próxima lección veremos en detalle cómo funciona el algoritmo del ascenso del gradiente, que es un método de optimización sobre ell cual se construyen precisamente los métodos del Gradiente de la Política.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Avanzado
