• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

12 – Introducción al aprendizaje por Diferencia Temporal

Lección 12 del curso Aprendizaje por Refuerzo Nivel Intermedio.

En la lección anterior implementamos de forma práctica varios algoritmos de Monte Carlo con ayuda de OpenAI Gym y Python, y con esto logramos entrenar un Agente capaz de jugar el popular juego de Blackjack.

En este tercer y último módulo del curso veremos una familia de algoritmos que combina elementos tanto de la Programación Dinámica como de los métodos de Monte Carlo: los algoritmos de Diferencia Temporal.

Como veremos, esta familia ha marcado un hito importante en el Aprendizaje por Refuerzo y se ha convertido en la precursora de algoritmos más sofisticados que se usan actualmente y que veremos en próximos cursos.

En esta lección comenzaremos viendo entonces con introducción a estos algoritmos de Diferencia Temporal:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Como vimos en los módulos anteriores, la Programación Dinámica y los métodos de Monte Carlo son dos formas equivalentes de resolver problemas de Aprendizaje por Refuerzo, y cada uno hace uso de algoritmos que nos permiten evaluar y optimizar la Política del Agente.

En el caso de la Programación Dinámica se requiere conocimiento completo del modelo y además este conjunto de métodos hace uso del «bootstrapping» para iterativamente calcular las funciones valor. En cambio, los Métodos de Monte Carlo no necesitan modelos y estiman las funciones valor a partir de interacciones episódicas.

Pues resulta que los métodos de Diferencia Temporal combinan elementos de las dos técnicas anteriores: por un lado utilizan el «bootstrapping» y son libres de modelos, pero adicionalmente no necesitan episodios completos para actualizar las funciones valor, ya que realizan las actualizaciones en cada interacción, proporcionando estimaciones precisas de forma iterativa.

Así que ya tenemos una idea general del principio de funcionamiento de los algoritmos de Diferencia Temporal, que toman ideas tanto de la Programación Dinámica como de los Métodos de Monte Carlo para poder evaluar y mejorar una política.

Y con estas ideas ya estamos listos para ver el primer algoritmo de Diferencia Temporal. Entonces en la próxima lección veremos cómo evaluar una política usando lo que se conoce como la predicción con Diferencia Temporal.

Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }