Lección 10 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior vimos en detalle los estados de nuestro tablero bidimensional estocástico, y hablamos también de un concepto muy importante como lo era la Propiedad de Markov.
En esta lección continuaremos construyendo el Proceso de Decisión de Markov para este juego, y en particular hablaremos de las acciones y de cómo el espacio de acciones puede tener diferentes características dependiendo del problema que vayamos a resolver:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Acabamos de ver las acciones disponibles en este juego: los movimientos arriba, abajo, izquierda y derecha.
Con esto tenemos un espacio de acciones finito y discreto con una sola variable por cada acción. En situaciones reales, como por ejemplo un vehículo autónomo, las acciones pueden ser continuas e infinitas, con múltiples variables por acción, como girar, frenar y acelerar, o incluso con un número variable de acciones por estado, como cambiar de carril. Esto implica que los espacios de acciones pueden variar en su naturaleza, lo que influirá en los métodos de entrenamiento de los agentes.
Así que en este punto ya hemos repasado las acciones que tendremos a disposición en nuestro juego. Entonces en la siguiente lección veremos el componente estocástico de este tablero bidimensional, pues precisamente construiremos la función de transición y las recompensas para este juego.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
