Lección 6 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior vimos una introducción a los Procesos de Decisión de Markov y vimos que básicamente era una representación matemática correspondiente al conjunto de los elementos que componen nuestro problema de aprendizaje por refuerzo.
En esta lección comenzaremos a profundizar en la construcción de diferentes tipos de Procesos de Decisión de Markov, y en este caso particular iniciaremos con un ejemplo muy sencillo: un agente que se desplaza en una grilla o tablero unidimensional.
Veamos entonces los detalles de este primer ejemplo:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Bien, acabamos de construir nuestro primer Proceso de Decisión de Markov. En este problema en particular pudimos ver que la tabla correspondiente a la función de transición, así como el grafo, contienen toda la información sobre los componentes de nuestro problema así como todas las posibles transiciones de estado que pueden existir.
Sin embargo en este caso asumimos un comportamiento totalmente determinístico, pues recordemos que cada acción ejecutada tenía un 100% de probabilidad de ocurrencia.
Así que en la siguiente lección analizaremos una versión modificada de este ejemplo, en donde veremos cómo construir el Proceso de Decisión de Markov de un tablero unidimensional estocástico.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
