10 lecciones • 6 horas
Curso teórico-práctico donde aprenderás los fundamentos de los algoritmos del Gradiente de la Política, su formulación matemática y su implementación haciendo uso de librerías especializadas en Python.
Al final de este curso habrás aprendido
- Qué son los algoritmos basados en políticas y cómo se diferencian de los basados en valores
- Cómo se formula y aplica el ascenso del gradiente en el aprendizaje de políticas
- A implementar en Python los algoritmos REINFORCE y Actor-Crítico, dos de los principales métodos del Gradiente de la Política usados en el Aprendizaje por Refuerzo
Requisitos
Se sugiere tener experiencia en la programación en Python y haber tomado los cursos Aprendizaje por Refuerzo Nivel Básico y Aprendizaje por Refuerzo Nivel Intermedio disponibles acá en la Academia Online.
Contenido
MÓDULO 1: INTRODUCCIÓN Y CONCEPTOS BÁSICOS
1 – Algoritmos basados en valores y basados en políticas
3 – Parametrización de la Política
MÓDULO 2: ALGORITMOS DEL GRADIENTE DE LA POLÍTICA
4 – Introducción a los algoritmos del Gradiente de la Política
5 – Gradiente de la Política: formulación matemática
7 – El algoritmo REINFORCE con línea de base
8 – REINFORCE con línea de base en Python: el péndulo invertido
9 – El algoritmo Actor-Crítico
10 – Actor-Crítico en Python: el péndulo invertido
