Lección 6 del curso Introducción a la Visión por Computador con Deep Learning.
En la lección anterior vimos cómo hacer uso de U-Net, una Red Convolucional pre-entrenada capaz de realizar segmentación de imágenes. En ese caso particular vimos cómo segmentar una imagen de resonancia magnética del cerebro para realizar la detección de posibles tumores.
En esta lección comenzaremos a ver un conjunto de modelos capaces de combinar el procesamiento de imágenes con el análisis del lenguaje natural y que recientemente han permitido comenzar a desarrollar un nuevo conjunto de aplicaciones de la Visión por Computador.
Estos modelos se conocen como modelos multimodales. Así que en esta lección veremos cómo usar la librería Transformers de Hugging Face para implementar una tarea de pregunta-respuesta sobre imágenes y una tarea de descripción de imágenes haciendo uso de estos modelos pre-entrenados:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, acabamos de ver cómo usar dos variantes del modelo BLIP, un modelo multimodal pre-entrenado y disponible en Hugging Face, para implementar tareas de pregunta-respuesta y descripción de imágenes.
En la tarea de pregunta-respuesta sobre imágenes lo que hacemos es presentar al modelo una imagen y una pregunta en formato texto. El modelo, basado en Redes Transformer, obtiene una representación vectorial de estos dos elementos y la lleva al bloque de decodificación que genera a la salida un texto con la respuesta a la pregunta y que guarda relación directa con la imagen presentada a la entrada.
Por otra parte, en la tarea de descripción simplemente le presentamos al modelo la imagen y a la salida el modelo genera una secuencia de texto que contiene la descripción de dicha imagen.
Y este sencillo ejemplo práctico nos permite entender el potencial que tiene el uso de las Redes Transformer en tareas que permiten combinar diferentes modalidades como son el procesamiento de imágenes y de texto de manera simultánea.
En la siguiente lección veremos otra aplicación que también combina estas dos modalidades (texto e imágenes) pero de una manera ligeramente diferente. Así que veremos cómo usar un modelo pre-entrenado capaz de generar imágenes a partir de un texto de entrada introducido por el usuario.
Todas las lecciones del curso Introducción a la Visión por Computador con Deep Learning
