Lección 17 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior vimos el segundo elemento fundamental del Agente, la función estado-valor que le permite cuantificar la bondad de un estado.
En esta lección veremos otra alternativa, la función acción-valor, el tercer elemento esencial del Agente y que como veremos permite determinar el valor de tomar una acción partiendo de un estado en particular:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, la función acción-valor, o «función Q», se utiliza para determinar cuál acción es mejor en un estado específico.
En últimas esta función cuantifica las acciones calculando el retorno esperado al tomar una acción específica en un estado dado y siguiendo la política establecida. Así, permite comparar y decidir cuál acción es más beneficiosa, proporcionando una medida del rendimiento esperado basado en las decisiones del Agente.
Así que con lo que acabamos de ver ya tenemos definidos los tres elementos que constituyen un agente en un problema de Aprendizaje por Refuerzo: la Política, la función estado-valor y la función acción-valor.
En la siguiente lección, que será la última del curso, hablaremos de las ecuaciones de Bellman, que se derivan de las ecuaciones de las funciones estado-valor y acción-valor y que son la base de todos los algoritmos clásicos para la solución de problemas de Aprendizaje por Refuerzo que veremos en los próximos cursos.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
