16 lecciones • 6 horas
Curso teórico-práctico en donde aprenderás e implementarás en Python los principales algoritmos clásicos para la solución de problemas de Aprendizaje por Refuerzo.
Al final de este curso habrás aprendido
- Cómo funcionan las tres principales familias de algoritmos clásicos para la solución de problemas de Aprendizaje por Refuerzo: Programación Dinámica, Monte Carlo y Diferencias Temporales
- A usar Python y la librería Gym de OpenAI, una de las herramientas más usadas para la implementación y desarrollo de algoritmos de Aprendizaje por Refuerzo
- A resolver problemas de Aprendizaje por Refuerzo usando Python, la librería Gym y cualquiera de los algoritmos clásicos
Requisitos
Se sugiere haber tomado los cursos Aprendizaje por Refuerzo Nivel Básico, Python Nivel Básico y Python Nivel Intermedio (todos disponibles acá la Academia Online).
Contenido
MÓDULO 1: INTRODUCCIÓN AL CURSO
1 – Introducción a los algoritmos clásicos del Aprendizaje por Refuerzo
MÓDULO 2: ALGORITMOS DE PROGRAMACIÓN DINÁMICA
3 – Evaluación de la Política: ejemplo práctico
4 – Mejora de la Política y ejemplo práctico
5 – Iteración de la Política y ejemplo práctico
7 – Práctica 1: introducción a OpenAI Gym
8 – Práctica 2: programación Dinámica con OpenAI Gym y Python
MÓDULO 3: ALGORITMOS MONTE CARLO
9 – Predicción con Monte Carlo
11 – Práctica 3: Monte Carlo con OpenAI Gym y Python
MÓDULO 4: ALGORITMOS DE DIFERENCIA TEMPORAL
12 – Introducción al aprendizaje por Diferencia Temporal
13 – Predicción con Diferencia Temporal
14 – SARSA: control “on-policy” con Diferencia Temporal
15 – Q-learning: control “off-policy” con Diferencia Temporal
16 – Práctica 4: Diferencia Temporal con OpenAI Gym y Python
