Lección 7 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior vimos paso a paso cómo construir un Proceso de Decisión de Markov para un simple tablero unidimensional. En este caso añadiremos un elemento que en problemas reales casi siempre estará presente: el componente de aleatoriedad.
El término “estocástico” se usa para indicar que nuestro problema tiene un componente de aleatoriedad. Así que en esta lección veremos cómo construir un Proceso de Decisión de Markov para un tablero unidimensional, como el de la lección anterior, pero estocástico:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, al igual que con el tablero no estocástico de la lección anterior, en este caso seguimos asumiendo un tablero de tres estados y dos acciones posibles: izquierda y derecha.
Sin embargo, se introdujo un elemento estocástico en la función de transición. Mientras que antes las transiciones eran determinísticas, ahora vamos a suponer que en el 80% de los casos el agente se mueve en la dirección deseada y en el 20% restante se mueve en la dirección opuesta. Esta incertidumbre simula situaciones reales donde las acciones pueden no tener el resultado esperado en todo momento.
Y con estas condiciones vimos cómo construir nuestro segundo Proceso de Decisión de Markov, incluyendo funciones de transición estocásticas que simulan un comportamiento mucho más cercano a lo que ocurre en la realidad.
A partir de la siguiente lección comenzaremos a construir un proceso más complejo, en donde tendremos a disposición más estados y más acciones, usando precisamente un tablero bidimensional estocástico.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
