Lección 4 del curso Clasificación de Imágenes con Deep Learning.
En la lección anterior vimos las principales características de las Redes Convolucionales que hacen que sea una de las arquitecturas de clasificación de imágenes más usadas en la actualidad.
En esta lección daremos un repaso al Vision Transformer, una arquitectura basada en las Redes Transformer y que es también una de las más usadas en la actualidad al momento de abordar problemas de clasificación de imágenes:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En esencia el Vision Transformer usa un principio de procesamiento de las imágenes similar al que vimos en la lección anterior cuando hablamos de las Redes Convolucionales. En particular:
- Consta de un primer bloque extractor de características conformado por un codificador de una Red Transformer convencional. Este bloque aprende durante el entrenamiento a extraer características relevantes de las imágenes a clasificar y a codificar dichas características en un «embedding» (un arreglo de valores numéricos).
- Y posteriormente este «embedding» se lleva a una cabecera de clasificación que es simplemente una pequeña Red Neuronal (o capa «fully connected») que durante el entrenamiento aprende a predecir una categoría a partir del «embedding» de entrada.
Y una de las claves de este Vision Transformer es la manera como las imágenes de entrada son representadas como una secuencia, para lo cual se subdividen en pequeños recuadros (o «patches») que luego son aplanados y codificados posicionalmente al momento de ingresar al bloque codificador.
Así que con esto ya hemos completado este primer módulo del curso en donde hemos visto los conceptos fundamentales que nos permitirán entender, en las próximas lecciones, cómo implementar, entrenar, validar y poner a prueba diferentes modelos de clasificación de imágenes basados en Redes Convolucionales y en Redes Transformer.
Entonces, en el segundo módulo del curso veremos de forma práctica los principales enfoques de clasificación de imágenes que se pueden implementar haciendo uso de las Redes Convolucionales. Y específicamente en la próxima lección veremos el enfoque más simple de todos: la clasificación de imágenes con Redes Convolucionales pre-entrenadas.
Todas las lecciones del curso Clasificación de Imágenes con Deep Learning
