Lección 15 del módulo “Redes Transformer” del curso Fundamentos de Deep Learning con Python.
En la lección anterior vimos el impresionante desempeño que tenía BERT en una tarea de pregunta-respuesta.
En esta lección hablaremos de GPT, una arquitectura derivada también de las Redes Transformer y que busca resolver problemas similares a los de BERT, en las áreas de Procesamiento y Comprensión del Lenguaje Natural.
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
GPT, que significa Generative Pre-training (o pre-entrenamiento generativo), es un modelo pre-entrenado para la generación de texto y desarrollado por la empresa OpenAI.
A la fecha de publicación de esta lección la última versión de GPT es la 3 (GPT-3), lanzado en julio de 2020, y que posee más de 175.000 millones de parámetros y ha sido entrenado con 45 TB de datos.
En últimas este modelo generativo intenta emular la forma como el ser humano interpreta el lenguaje y luego aprende a resolver tareas específicas del lenguaje natural requiriendo muy pocos ejemplos de entrenamiento, usando en esencia un enfoque de fuerza bruta.
Con lo que acabamos de ver estamos listos para la tercera práctica de esta sección del curso. Entonces en la próxima lección veremos cómo usar GPT-2 para la generación de texto.
Todas las lecciones del curso Fundamentos de Deep Learning con Python
