Lección 15 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior vimos que el objetivo del Agente es que aprenda a tomar decisiones buscando obtener el mayor retorno posible. Pero este problema se complica cuando agregamos un componente estocástico, como ocurre en la mayor parte de las aplicaciones reales.
En esta lección hablaremos de la Política, que permite al agente tomar decisiones en todos los posibles escenarios y que es a la vez uno de los tres elementos fundamentales del Agente:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, en el Aprendizaje por Refuerzo la interacción entre el Agente y el entorno se basa en el principio de que que el agente recibe recompensas y estados del entorno y decide cuáles acciones tomar a partir de ellos.
Y un elemento clave dentro del Agente es precisamente la Política, que es una función que mapea estados a acciones (es decir toma un estado a la entrada y genera como salida una acción).
En esencia esta Política, para el caso de entornos estocásticos, representa la probabilidad de realizar una acción específica en un estado dado. Así que lo que buscan los algoritmos de Aprendizaje por Refuerzo es entrenar al agente para encontrar la Política óptima a medida que este interactúa con su entorno.
En resumen la Política es como el cerebro del Agente encargado de la toma de decisiones. Pero como vimos, esta Política usa únicamente el estado para predecir la acción a ejecutar, pero no nos permite cuantificar si el nuevo estado o la acción tomada son buenos o si hay mejores opciones.
Así que en la próxima lección hablaremos de la función estado-valor, el segundo elemento fundamental el agente y que será una herramienta que permitirá cuantificar el valor de un estado.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
