Lección 5 del curso Aprendizaje por Refuerzo Nivel Avanzado.
En la lección anterior vimos una introducción general a los algoritmos del Gradiente de la Política y allí definimos de manera formal el objetivo de estos algoritmos.
En esta lección veremos todo el componente matemático que está detrás de estos algoritmos del Gradiente de la Política. Es decir que veremos todos los detalles del procedimiento matemático que nos permitirá obtener las ecuaciones que permiten actualizar los parámetros de la Política usando el algoritmo del ascenso del gradiente.
Y estas ecuaciones serán precisamente la base de la implementación computacional de los diferentes algoritmos del Gradiente de la Política que veremos en las próximas lecciones.
Para entender todo el componente matemático que desarrollaremos en esta lección se sugiere revisar las siguientes lecciones disponibles en el curso de Cálculo para Ciencia de Datos y Machine Learning disponible acá en la Academia Online:
- Funciones más usadas en Ciencia de Datos y Machine Learning
- Reglas de derivación
- La regla de la cadena y la derivada parcial
Comencemos entonces hablando del primer elemento matemático esencial en esta fase, que se conoce como el truco de la derivada del logaritmo:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Bien, en esencia el truco que acabamos de ver simplemente nos permite encontrar una expresión alternativa para el gradiente (o derivada) del retorno esperado (que es la función que queremos optimizar).
Y habiendo obtenido esta expresión equivalente usando el truco de la derivada del logaritmo, ya estamos listos para ver todo el componente matemático detrás de estos algoritmos del Gradiente de la Política:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, con este desarrollo matemático hemos llegado al resultado que nos interesa, que es la ecuación usada en los algoritmos del Gradiente de la Política al momento de actualizar los parámetros (𝜃) de dicha Política.
Esta ecuación matemática es precisamente el punto de partida para las principales implementaciones del método del Gradiente de la Política, como son el algoritmo REINFORCE, el algoritmo REINFORCE con línea de base y los algoritmos Actor-Crítico que veremos en las próximas lecciones.
Así que teniendo claro este componente matemático ya estamos listos para ver en qué consiste cada uno de los algoritmos mencionados anteriormente, comenzando en la próxima lección con el más sencillo de todos: el algoritmo REINFORCE.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Avanzado
