Lección 13 del curso Aprendizaje por Refuerzo Nivel Intermedio.
En la lección anterior vimos una introducción al aprendizaje por Diferencia Temporal y hablamos en detalle de sus semejanzas y ventajas frente a métodos como la Programación Dinámica y Monte Carlo.
En esta lección veremos todos los detalles del algoritmo de predicción con Diferencia Temporal, que permite llevar a cabo la evaluación de una política:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, la predicción con Diferencia Temporal busca evaluar una política estimando la función estado-valor asociada, sin requerir un modelo completo del entorno.
A diferencia de Monte Carlo, este método actualiza la función estado-valor de forma recursiva en cada interacción sin esperar a completar un episodio. Y para evitar que estados frecuentemente visitados se actualicen lentamente, se introduce la tasa de aprendizaje, que controla la importancia de la diferencia entre el «target» y el valor calculado previamente.
Y con esto ya tenemos todos los detalles del algoritmo de predicción con Diferencia Temporal, así que ahora es momento de hablar de los algoritmos de control que nos permiten obtener una política óptima.
Y así como en Monte Carlo, en este caso tendremos dos enfoques: el control «on-policy» y el control «off-policy». Entonces en la próxima lección veremos el algoritmo de control SARSA, un algoritmo «on-policy» que usa la Diferencia Temporal para obtener una política óptima.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio
