Lección 12 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior, cuando hablamos de la función de transición y la recompensa de nuestro tablero bidimensional, terminamos de construir el Proceso de Decisión de Markov de este juego, pero no incluimos de forma explícita un elemento importantísimo: el tiempo.
Y el tiempo resulta fundamental, porque por ejemplo en nuestro juego del tablero bidimensional nos interesa que el agente aprenda a llegar a la meta en el menor tiempo posible, es decir usando la menor cantidad de movidas posible.
Así que en esta lección introduciremos explícitamente la variable tiempo en nuestro Proceso de Decisión de Markov, a través de un concepto muy importante que se conoce como el horizonte:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Acabamos de ver que el horizonte es esencialmente la duración de la interacción de un agente con su entorno.
Y dependiendo de esta duración, los problemas pueden clasificarse en tres tipos: de horizonte finito, infinito e indefinido. Los problemas de horizonte finito tienen un número fijo de pasos o una duración limitada en el tiempo; los problemas de horizonte infinito implican un número infinito de pasos o una duración interminable y los problemas de horizonte indefinido son una subclase de los problemas de horizonte infinito, donde la cantidad de pasos es desconocida de antemano y puede variar.
Así que con este concepto del horizonte ya hemos incluido la variable tiempo en nuestro Proceso de Decisión de Markov. Entonces en la siguiente lección vamos a combinar esta idea del horizonte con el concepto del descuento, que nos permitirá introducir un criterio de toma de decisiones de manera óptima por parte del Agente.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
