Lección 4 del curso Aprendizaje por Refuerzo Nivel Intermedio.
En la lección anterior vimos un ejemplo práctico del algoritmo de evaluación de la Política, que en últimas permite de forma iterativa obtener el valor de cada estado en nuestro problema de Aprendizaje por Refuerzo.
La limitación de este algoritmo de evaluación de la Política es que, como su nombre lo indica, sólo nos permite cuantificar qué tan buena o mala es una Política, pero no nos permite hacer cambios a la misma.
Sin embargo, el objetivo final es encontrar la mejor Política para el Agente, así que debemos ir un escalón más allá.
Así que en esta lección veremos cómo usar la función acción-valor (de la cual hablamos en detalle en el curso Aprendizaje por Refuerzo Nivel Básico) junto con el algoritmo de evaluación de la Política, para introducir mejoras a una política en particular:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, una alternativa para encontrar la mejor política posible consiste en evaluar múltiples políticas y elegir la mejor, pero esto sería ineficiente y no resulta viable en la práctica, cuando en problemas reales tenemos múltiples estados y múltiples acciones por cada estado.
La función acción-valor (o función Q) surge como una alternativa a este inconveniente, pues permite mejorar la Política al evaluar la bondad de tomar una acción desde un estado específico. Así, para mejorar una Política, primero se realiza su evaluación con el algoritmo de evaluación de la Política visto en la lección anterior y luego se calcula la función Q para cada acción en cada estado, y finalmente se selecciona la mejor acción basada en la función Q, lo que da como resultado precisamente una Política mejorada.
Así que en este punto ya hemos ido un paso más allá de la evaluación de la Política: hemos usado la función acción-valor para, en cada estado, determinar la mejor acción posible y de esta forma mejorar la Política.
Pero la pregunta es: ¿será que podemos seguir repitiendo este proceso de evaluación y mejora una y otra vez para cada vez tener una mejor Política hasta llegar a aquella que sea óptima? Pues la respuesta es sí, y este será precisamente el algoritmo de iteración de la Política del cual hablaremos en la próxima lección.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio
