Lección 8 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior vimos cómo construir el Proceso de Decisión de Markov de un entorno sencillo: un tablero unidimensional estocástico.
En esta lección vamos a comenzar a ver un ejemplo más elaborado: un pequeño juego con un tablero pero esta vez bidimensional y también estocástico. En particular veremos los detalles de este entorno y las reglas del juego:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, acabamos de ver que en este escenario del tablero bidimensional estocástico, el juego se desarrolla en un tablero de 4 filas y 4 columnas con un total de 16 casillas. El objetivo sigue siendo que el Agente vaya del inicio (casilla 1) a la meta (casilla 15), evitando caer en casillas de «hueco».
Así que es necesario introducir cuatro acciones posibles para el Agente: arriba, abajo, izquierda y derecha. Además, hay más «huecos» en el tablero (cuatro en total).
Al igual que en el ejemplo anterior, vimos que las acciones del Agente tienen un componente aleatorio. Cuando el agente decide moverse en una dirección, lo hará con una probabilidad del 33.3%, mientras que el resto de la probabilidad (66.6%) se distribuirá equitativamente entre las direcciones ortogonales.
Por tratarse de una interacción entorno-agente más compleja, en las siguientes lecciones desglosaremos cada uno de los elementos que harán parte de este Proceso de Decisión de Markov.
Así que en la próxima lección hablaremos inicialmente de los estados y de un concepto muy importante en la construcción de este proceso: la propiedad de Markov.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
