Lección 1 del módulo “Redes Transformer” del curso Fundamentos de Deep Learning con Python.
En la última lección del módulo anterior vimos las ventajas y limitaciones de las Redes Recurrentes y de las Redes LSTM.
Pues precisamente las Redes Transformer fueron creadas con el fin de solventar varias de estas limitaciones al momento de procesar secuencias. Así que en esta lección veremos un panorama general de las Redes Transformer, enfocándonos principalmente en sus ventajas frente a las Redes Recurrentes y LSTM.
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Bien, acabamos de ver algunas características de las Redes Transformer y lo que las diferencia de las Redes Recurrentes y LSTM.
Las Redes Transformer, propuestas en 2017 por investigadores de Google liderados por Ashish Vaswani, superan a las Redes Recurrentes y LSTM en varias áreas. Por ejemplo, las Redes Transformer permiten el procesamiento paralelo de secuencias, mejorando el aprovechamiento del hardware y permitiendo el uso de sets de entrenamiento más grandes. Además, eliminan el problema de los gradientes que se desvanecen, proporcionando una memoria de largo plazo superior.
Así que para tener un panorama aún más completo del potencial de esta nueva arquitectura, en la próxima lección veremos algunas de las principales aplicaciones de estas Redes Transformer.
Todas las lecciones del curso Fundamentos de Deep Learning con Python
