• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

3 – Parametrización de la Política

Lección 3 del curso Aprendizaje por Refuerzo Nivel Avanzado.

En la lección anterior vimos qué es y cómo funciona el algoritmo del ascenso del gradiente, que será una de las bases sobre la cual se construyen los algoritmos del Gradiente de la Política que veremos en detalle en el segundo módulo de este curso.

En esta lección veremos otro concepto que también resulta esencial para entender posteriormente los métodos del Gradiente de la Política: la parametrización de la Política.

Así que partiremos de un sencillo ejemplo que nos permitirá entender qué es dicha parametrización de la política y por qué resulta útil frente a métodos alternos como el cálculo indirecto de la política a partir de funciones valor (y de los cuales hemos hablado en detalle en el curso de Aprendizaje por Refuerzo Nivel Intermedio):

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Muy bien. Acabamos de plantear un sencillo ejemplo de un entorno discreto: un simple tablero de juego con tres estados y en donde el Agente puede ejecutar una de dos posibles acciones.

Y en este sencillo ejemplo comenzamos planteando una Política en formato tabular. Posteriormente representamos esta Política pero de una forma equivalente, a través de una función matemática (que en el caso particular de este ejemplo era la función sigmoidal).

Pero el elemento clave en esta representación matemática fue el uso de un conjunto de parámetros (𝞱) que, dependiendo de su valor, nos permiten obtener diferentes tipos de Políticas, algunas mejores que otras.

Sin embargo, más allá de los valores particulares de 𝞱 en el ejemplo que acabamos de analizar, lo importante es tener claro este concepto de lo que es una Política parametrizada que en esencia es una función de probabilidad que indicará la probabilidad de ejecutar cada acción dado un estado en particular y que depende de un conjunto de parámetros ajustables (𝞱).

Y lo clave acá es que dichos parámetros ajustables (𝞱) no se escogen de manera arbitraria sino que, como lo veremos en el segundo módulo, se calcularán de forma automática (con el fin de encontrar su valor óptimo) usando los métodos del Gradiente de la Política.

Así que en este punto ya tenemos claro qué es una Política parametrizada y ya estamos listos ahora sí para comenzar a ver todos los detalles de los algoritmos del Gradiente de la Política, que será precisamente el tema del segundo módulo de este curso.

Y en particular, en la próxima lección, comenzaremos viendo una introducción matemática formal a estos algoritmos del Gradiente de la Política.

Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Avanzado

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }