Lección 7 del módulo “Redes Transformer” del curso Fundamentos de Deep Learning con Python.
En la lección anterior vimos uno de los principales elementos de la Red Transformer: el bloque atencional de la codificación, capaz de cuantificar la relación a diferentes niveles entre los elementos de la secuencia.
En esta lección veremos cómo usar bloques residuales y de normalización en la etapa de salida de cada codificador para mejorar de esta forma el entrenamiento de la red.
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Bien, y con la etapa de salida ya hemos visto en detalle todos los elementos que conforman el bloque de codificación de una Red Transformer. Esta etapa se encarga esencialmente de extraer y, como su nombre lo indica, codificar matricialmente la información más importante de la secuencia a traducir.
Así que en las siguientes lecciones nos enfocaremos en la etapa de decodificación, encargada de generar el texto traducido al lenguaje destino en la Red Transformer original.
En particular, en la próxima lección veremos el principio de funcionamiento de esta etapa de decodificación.
Todas las lecciones del curso Fundamentos de Deep Learning con Python
