Lección 14 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior hablamos del descuento en un Problema de Aprendizaje por Refuerzo, y con ello culminamos todo lo relacionado con los Procesos de Decisión de Markov.
Así que ya sabemos qué es y cómo formular el Proceso de Decisión de Markov para diferentes problemas de Aprendizaje por Refuerzo y en este último módulo del curso nos enfocaremos en el elemento encargado de la toma de decisiones: el Agente.
En particular hablaremos de los tres elementos fundamentales que conforman el agente y culminaremos con las ecuaciones de Bellman, que serán el punto de partida de los algoritmos para el entrenamiento del Agente que veremos en el próximo curso.
Y en esta lección específicamente tomaremos lo aprendido hasta el momento para reformular el objetivo del agente en un problema de Aprendizaje por Refuerzo:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, ya tenemos una definición más precisa del objetivo del Agente en un problema de Aprendizaje por Refuerzo, que consiste en elegir una serie de acciones que maximice el retorno.
Pero esta secuencia de acciones generalmente no es trivial, porque recordemos que usualmente tendremos un componente estocástico en nuestro Proceso de Decisión de Markov.
La Política, que será el tema de la próxima lección, es precisamente como el “plan maestro” que permitirá al agente tomar decisiones dentro de este proceso estocástico.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
