Lección 11 del módulo “Redes Transformer” del curso Fundamentos de Deep Learning con Python.
En la lección anterior vimos el principio de funcionamiento del bloque atencional de la decodificación, que permite a la Red Transformer combinar la información de la secuencia original con la del idioma destino para generar las traducciones.
En esta lección veremos cómo la etapa de salida del decodificador en una Red Transformer permite generar la secuencia de salida en un formato entendible por parte del ser humano, que en el caso de la arquitectura original corresponde al texto traducido al idioma destino.
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, la etapa de salida de la Red Transformer convierte las predicciones codificadas en vectores de 512 elementos en palabras interpretables.
Primero, una capa lineal proyecta estos vectores a un tamaño equivalente al vocabulario del idioma destino y luego, una capa softmax transforma estos vectores en probabilidades, donde la posición con la mayor probabilidad corresponde a la palabra generada en el idioma destino.
Así que en este punto ya tenemos todos los elementos que conforman la Red Transformer y ya estamos listos para iniciar el componente práctico de esta última parte del curso.
Así que en las próximas lecciones veremos precisamente cómo usar la Red Transformer para resolver diferentes problemas asociados al procesamiento de secuencias.
En particular, en la próxima lección veremos la primera práctica, en donde usaremos esta arquitectura para resolver un problema de traducción de texto de un idioma a otro: el Machine Translation usando Redes Transformer.
Todas las lecciones del curso Fundamentos de Deep Learning con Python
