• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

6 – Iteración de valores

Lección 6 del curso Aprendizaje por Refuerzo Nivel Intermedio.

En el algoritmo de la iteración de la Política que vimos en la lección anterior, logramos ver cómo obtener una política óptima repitiendo de forma iterativa los algoritmos de evaluación de la Política y mejora de la Política.

En esta lección veremos una manera alternativa de obtener una Política óptima, que en lugar de partir de la secuencia de evaluación y Mejora, como lo hace el algoritmo de iteración de la Política, lo hace directamente a partir de las funciones estado-valor y acción-valor.

Veamos entonces cómo funciona este algoritmo de la iteración de valores:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Muy bien, hasta este punto hemos estudiado tres algoritmos clave de la Programación Dinámica: la evaluación de la Política, que estima la función estado-valor para luego evaluar la Política del agente; la Mejora de la Política, que usa la función acción-valor para optimizar las acciones por estado; y la Iteración de la Política, que alterna entre evaluación y mejora para obtener una política óptima.

Pues resulta que el algoritmo de iteración de valores que acabamos de ver combina simultáneamente la evaluación y mejora de la Política en un único proceso iterativo, actualizando valores y mejorando la política hasta que el algoritmo converge. Y este enfoque unificado permite llegar a un resultado equivalente (la política óptima) pero de una manera más eficiente.

Y con este algoritmo de iteración de valores ya hemos visto los principales algoritmos que hacen parte de esta familia de la Programación Dinámica.

Así que ya estamos listos para comenzar con el componente práctico del curso. Entonces en la próxima lección veremos una introducción práctica a OpenAI Gym, una librería de Python que facilita la implementación de Algoritmos de Aprendizaje por Refuerzo.

Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }