Lección 3 del curso Introducción a la Visión por Computador con Deep Learning.
En la lección anterior entendimos qué es una imagen digital, el insumo principal de cualquier proyecto de Visión por Computador, y qué tipos de imágenes digitales podemos tener convencionalmente en nuestros proyectos.
Así que en este punto ya estamos listos para comenzar a ver de forma práctica ejemplos de implementación de diferentes tareas de Visión por Computador con ayuda de Python y haciendo uso de modelos pre-entrenados.
En particular, en esta lección veremos cómo usar una Red Convolucional pre-entrenada para implementar una tarea de clasificación de imágenes. Así que veremos cómo usar PyTorch y el modelo VGG16 para realizar el pre-procesamiento de imágenes y para predecir la distribución de probabilidades generadas por el clasificador:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien acabamos de ver un ejemplo práctico de uso de un modelo pre-entrenado para realizar una tarea de clasificación de imágenes.
Y aunque el código implementado dependerá de las librerías y los modelos que utilicemos, en la práctica siempre tendremos que llevar a cabo los siguientes pasos:
- Lectura de la imagen (o imágenes)
- Pre-procesamiento de la(s) imágene(s) para garantizar que tendrán las características requeridas por el modelo. Usualmente este pre-procesamiento implica el redimensionamiento de la imagen así como la estandarización de los pixeles
- Generación de las predicciones hechas por el modelo (las cuales generalmente estarán en formato de «logits»)
- Post-procesamiento de las predicciones para extraer la distribución de probabilidad asociada a las categorías o la categoría predicha por el modelo
Así que con lo visto en esta lección ya tenemos una primera aproximación a lo que usualmente tendremos que implementar si queremos hacer uso de un modelo pre-entrenado para realizar clasificación de imágenes.
En la próxima lección seguiremos una lógica similar y veremos en detalle cómo hacer uso de un modelo pre-entrenado (basado en Redes Transformer) para realizar detección de objetos en imágenes.
Todas las lecciones del curso Introducción a la Visión por Computador con Deep Learning
