Lección 3 del curso Aprendizaje por Refuerzo Nivel Básico.
En la lección anterior vimos varios ejemplos reales de aplicación del Aprendizaje por Refuerzo, en áreas como los videojuegos, la salud y la robótica.
En esta lección ampliaremos este panorama revisando cuál ha sido la historia y evolución del Aprendizaje por Refuerzo, así como sus principales hitos en poco más de setenta años de desarrollos:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Acabamos de ver que el Aprendizaje por Refuerzo tiene una rica historia que se remonta al siglo XIX con Alexander Bain y Edward Thorndike, quienes establecieron las bases conceptuales del aprendizaje por prueba y error.
Otros personajes como Ivan Pavlov y Claude Shannon contribuyeron con experimentos y desarrollos que influenciaron el campo, mientras que la programación dinámica (propuesta por Richard Bellman) y el algoritmo Q-learning (desarrollado por Watkins y Dayan) marcaron hitos importantes en la evolución del Aprendizaje por Refuerzo.
Eventos más recientes, como el desarrollo de TD-Gammon por IBM en 1992 y los avances en Deep Reinforcement Learning en la década de 2010, han llevado este campo a nuevos niveles de sofisticación y aplicación práctica.
Así que ya hemos visto algunos de los hitos más importantes en la historia del Aprendizaje por Refuerzo, incluyendo las bases teóricas y algunos de los principales algoritmos de los cuales hablaremos más adelante en este y en los próximos cursos.
Entonces es momento de comenzar a formalizar varios conceptos de la teoría básica del Aprendizaje por Refuerzo. Así que en la próxima lección veremos en detalle cuáles son los componentes de un sistema de Aprendizaje por Refuerzo.
Todas las lecciones del curso Aprendizaje por Refuerzo Nivel Básico
