Lección 8 del curso Introducción a la Visión por Computador con Deep Learning.
En la lección anterior vimos cómo usar un modelo multimodal de la familia Stable Diffusion para generar imágenes a partir de texto, usando la librería transformers de Hugging Face.
En esta penúltima lección del curso veremos cómo usar un modelo pre-entrenado para implementar una tarea de estimación de pose, que consiste en detectar y localizar las partes del cuerpo (como cabeza, brazos, piernas, etc.) de una persona en una imagen o video, para determinar su posición y orientación en el espacio.
En particular veremos cómo usar la librería Mediapipe de Google para de forma muy simple realizar esta detección de pose en una imagen y luego dibujar los puntos detectados sobre la imagen original:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, la estimación de pose permite detectar de forma automática varios puntos de interés (también llamados «keypoints» o «landmarks») en una imagen que contenga el cuerpo de una persona.
Y por cada punto de interés el modelo predice las coordenadas junto con la probabilidad de que el punto esté fuera de la escena o esté oculto debido a la superposición de otras partes del cuerpo.
En el caso de «Mediapipe» vimos que las fases de pre-procesamiento y detección están encapsuladas en las funciones de la librería, lo que facilita la implementación de un detector de pose pues tan sólo se requieren tres líneas de código. Además, la librería incluye funciones de post-procesamiento que permiten de manera muy sencilla dibujar los «landmarks» detectados sobre la imagen original.
Teniendo claro en qué consiste esta tarea de detección de pose, en la próxima lección, que será la última del curso, veremos cómo abordar otra de las aplicaciones más comunes en la Visión por Computador: el reconocimiento óptico de caracteres (u OCR por sus siglas en Inglés).
Todas las lecciones del curso Introducción a la Visión por Computador con Deep Learning
