• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

15 – Q-learning: control “off-policy” con Diferencia Temporal

Lección 15 del curso Aprendizaje por Refuerzo Nivel Intermedio.

En la lección anterior hablamos del algoritmo SARSA para el control “on-policy” usando Diferencia Temporal y vimos que en esencia permite obtener una política óptima a partir de la estimación de la función acción-valor usando un enfoque incremental.

En esta lección hablaremos del algoritmo Q-learning, uno de los principales algoritmos del Aprendizaje por Refuerzo Clásico y que permite estimar una política óptima pero usando un enfoque off-policy:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Bien, acabamos de ver que el algoritmo Q-learning tiene como objetivo obtener una política óptima sin necesidad de una política inicial, lo que lo convierte en un algoritmo de control off-policy.

En Q-learning, se actualiza la función acción-valor tomando siempre la mejor acción disponible en cada momento, a diferencia de SARSA, que sigue la política definida. Este enfoque implica que, durante cada iteración del algoritmo, se genera un episodio basado en la función acción-valor actual, se elige una acción usando una estrategia ϵ-greedy, y se actualiza la función acción-valor de manera incremental considerando la mejor acción y solo un instante de tiempo, deteniéndose al llegar a un estado terminal.

Así que ya tenemos claros todos los detalles de funcionamiento del algoritmo Q-learning que, como lo mencionamos, es uno de los principales algoritmos en el Aprendizaje por Refuerzo clásico.

Así que con todo lo visto en esta sección ya estamos listos para entrar a la última lección del curso, en donde veremos cómo aplicar de forma práctica estos conceptos de Aprendizaje por Diferencia Temporal junto con OpenAI Gym y Python para entrenar un agente de Aprendizaje por Refuerzo.

Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Intermedio

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }