Lección 4 del módulo “Redes Recurrentes y LSTM” del curso Fundamentos de Deep Learning con Python.
En la lección anterior vimos en detalle la arquitectura de una Red Neuronal Recurrente, y vimos además cómo el estado oculto (equivalente a la “memoria” de la Red) es el elemento que permite el procesamiento de secuencias.
Para lograr una total comprensión de esta arquitectura, en esta lección veremos un ejemplo paso a paso del funcionamiento de una Red Recurrente partiendo de una situación en el campo del modelado del lenguaje.
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Bien, acabamos de ver un ejemplo hipotético en el cual queremos crear un modelo de lenguaje capaz de predecir la siguiente palabra en una secuencia de texto.
Y con esto vimos los detalles paso a paso del funcionamiento de una Red Recurrente. En esencia cada palabra se representa numéricamente utilizando la codificación one-hot y la Red toma como entrada esta representación y genera dos salidas: la predicción y el estado oculto.
Luego, la palabra de entrada y el estado oculto previo se transforman mediante los parámetros del modelo y una función de activación no lineal, produciendo el estado oculto actual. Y este estado oculto se utiliza luego para generar la siguiente predicción y el proceso se repite una y otra vez hasta generar la totalidad de la secuencia.
Y con este ejemplo ya tenemos un panorama mucho más detallado de cómo funciona internamente una Red Neuronal Recurrente.
Así que en la próxima lección veremos cómo realizar el entrenamiento a través de lo que se conoce como el algoritmo de backpropagation a través del tiempo.
Todas las lecciones del curso Fundamentos de Deep Learning con Python.
