• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

9 – Clasificación con el Vision Transformer pre-entrenado

Lección 9 del curso Clasificación de Imágenes con Deep Learning.

En la lección anterior vimos qué es y cómo usar la técnica de «image augmentation» para de manera artificial introducir transformaciones a las imágenes durante el entrenamiento o afinación de una Red Convolucional, con el fin de mejorar su desempeño.

En este tercer y último módulo del curso veremos cómo usar las Redes Transformer, y en particular el Vision Transformer para abordar tareas de clasificación de imágenes.

Y específicamente en esta lección veremos cómo usar un Vision Transformer pre-entrenado para clasificar imágenes, para lo cual haremos uso de la librería «transformers» de HuggingFace:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Como acabamos de ver, el uso del Vision Transformer como clasificador de imágenes (sin implementar ningún proceso de entrenamiento o afinación) es realmente muy simple. Basta con cargar el modelo pre-entrenado, pre-procesar las imágenes a clasificar y posteriormente post-procesar las predicciones.

Así que el enfoque es prácticamente el mismo que vimos en la lección 5 cuando realizamos la clasificación de imágenes con Redes Convolucionales pre-entrenadas, sólo que en este caso estamos usando un modelo basado en Redes Transformer.

Sin embargo, a pesar de lo simple que resulta esta implementación su uso en problemas reales tiene varios inconvenientes:

  • En primer lugar, el Vision Transformer es un modelo generalmente muchísimo más grande que una Red Convolucional (casi 87 millones de parámetros vs. entre 5 y 15 millones para una Red Convolucional). Esto hace que para poder usar el Vision Transformer se requieran altas capacidades de cómputo.
  • Al igual que con las Redes Convolucionales pre-entrenadas, en este caso también se requiere que el modelo haya sido entrenado con imágenes similares a las que queremos clasificar

Si esta última condición no se cumple será necesario afinar el modelo para de esta forma especializarlo en las imágenes de nuestro set de datos para así mejorar su desempeño. Así que en la última lección del curso hablaremos precisamente la afinación del Vision Transformer.

Todas las lecciones del curso Clasificación de Imágenes con Deep Learning

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }