Lección 4 del curso Introducción a la Visión por Computador con Deep Learning.
En la lección anterior vimos cómo usar la librería PyTorch y una Red Convolucional pre-entrenada para implementar una tarea de clasificación de imágenes, tal vez la tarea más simple en la Visión por Computador.
En esta lección veremos cómo usar una DETR, una Red Transformer pre-entrenada, así como la librería Transformers de Python para implementar una tarea de detección de objetos. En particular veremos cómo realizar el pre-procesamiento de la imagen, cómo cargar el modelo pre-entrenado y generar predicciones y cómo visualizar los resultados de la detección de objetos:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, acabamos de ver cómo usar la librería Transformers de Hugging Face para usar el Detection Transformer (o DETR) para una tarea de detección de objetos.
En este caso la cantidad de código requerida es mucho menor a la usada en la lección anterior (cuando implementamos un clasificador de imágenes con ayuda de PyTorch). Sin embargo, las fases para implementar esta aplicación son las mismas que vimos en dicha lección: lectura de la imagen, pre-procesamiento, carga del modelo pre-entrenado, generación de predicciones y post-procesamiento.
Además, vimos cómo tomar las predicciones generadas por este modelo detector de objetos (probabilidades asociadas a cada objeto y coordenadas de los bounding boxes) para dibujar los objetos detectados sobre la imagen original.
En este caso, también es importante tener en cuenta que podremos ajustar la sensibilidad en la detección de objetos aplicando un umbral a las probabilidades predichas.
Así que habiendo visto en detalle cómo usar un modelo pre-entrenado para realizar detección de objetos en imágenes, en la próxima lección veremos cómo usar un enfoque similar pero para abordar una tarea de segmentación de imágenes.
Todas las lecciones del curso Introducción a la Visión por Computador con Deep Learning
