• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

2 – Evaluación de la Política

Lección 2 del curso Aprendizaje por Refuerzo Nivel Intermedio.

En la lección anterior vimos una introducción a los Algoritmos Clásicos del Aprendizaje por Refuerzo, y allí hablamos de las tres grandes familias: la Programación Dinámica, los algoritmos Monte Carlo y los de Diferencias Temporales.

En esta lección comenzaremos a hablar de la primera familia de algoritmos clásicos: la Programación Dinámica, y nos enfocaremos específicamente en el primer algoritmo básico de esta familia: la evaluación de la Política (o también llamada evaluación iterativa de la Política):

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Muy bien, acabamos de ver que la Programación Dinámica, desarrollada por Richard Bellman en los años 50, divide problemas complejos en sub-problemas más simples, utilizando un enfoque recursivo.

Estos algoritmos de Programación Dinámica funcionan partiendo del supuesto de que se conocen todos los elementos del Proceso de Decisión de Markov. De hecho, en este curso veremos en detalle cómo funcionan los cuatro algoritmos principales de Programación Dinámica: la evaluación, la mejora y la iteración de la Política así como la iteración de valores.

De hecho, la idea de la evaluación de la Política (el primero de estos algoritmos y el tema central de esta lección) consiste en cuantificar la efectividad de una política específica resolviendo iterativamente la ecuación de Bellman para cada estado, lo cual es crucial para determinar la mejor política en un entorno dado.

Así que ya tenemos el primer algoritmo de Programación Dinámica que permite de forma iterativa aproximar la función estado-valor para de esta manera cuantificar o evaluar una política.

Entonces, para comprender en su totalidad el funcionamiento del algoritmo, en la próxima lección veremos paso a paso un ejemplo práctico de este algoritmo de evaluación de la Política.

Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }