Lección 13 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior hablamos del horizonte en un problema de Aprendizaje por Refuerzo, y vimos que nuestro tablero bidimensional tiene un horizonte indefinido: no existe un límite de jugadas a realizar, pero tarde o temprano la interacción culminará, bien sea porque el Agente llegó a la meta o porque terminó atrapado en un hueco.
Y tal como lo analizamos en la lección anterior, existen diferentes trayectorias que permitirán al Agente llegar a la meta, aunque algunas requerirán más movidas que otras. Y lo que nos interesa es que precisamente este Agente aprenda a llegar a la meta en el menor número de movidas posible.
Así que en esta lección vamos a introducir el concepto del descuento, que permitirá que más adelante el Agente “aprenda” a llegar a la meta de forma óptima:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Acabamos de ver que para que un agente aprenda a llegar a la meta lo más pronto posible, se introduce el concepto de descuento. Sin el descuento, el agente recibiría la misma recompensa al final de su trayecto sin importar la ruta tomada, lo que no incentiva la rapidez.
Entonces lo que hace el descuento es ajustar el valor de las recompensas en función del tiempo, dándoles menos peso cuanto más tarde se obtengan.
Así que con este concepto del descuento ya hemos completado nuestro ejemplo del tablero bidimensional y hemos agregado todos los elementos que hacen parte del Proceso de Decisión de Markov: los estados, las acciones, la función de transición, la recompensa y además de esto el horizonte y el descuento.
Con todos estos elementos ya podemos caracterizar por completo prácticamente cualquier problema de Aprendizaje por Refuerzo y estamos listos entonces para entrar al último módulo del curso, donde veremos una introducción a los diferentes algoritmos que existen para el entrenamiento del agente.
Entonces, en la próxima lección hablaremos en detalle de cuál es precisamente el objetivo del Agente.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
