• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

7 – Generación de imágenes

Lección 7 del curso Introducción a la Visión por Computador con Deep Learning.

En la lección anterior vimos el principio de funcionamiento de los modelos multimodales, que permiten implementar diferentes tipos de aplicaciones de Visión por Computador usando lenguaje natural, como por ejemplo la descripción de imágenes o las tareas pregunta-respuesta sobre imágenes.

En esta lección veremos otro tipo de modelos capaces de combinar tareas de Visión por Computador con el lenguaje natural: los modelos de generación de imágenes. Así que vamos a entender la idea básica de la familia de modelos Stable Diffusion, que son la base de buena parte de los modelos de generación de imágenes a partir de texto que existen en la actualidad. Y de igual forma veremos dos ejemplos de uso de este tipo de modelos para generar imágenes a partir de texto o a partir de una combinación de texto e imágenes a la entrada del modelo:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Como acabamos de ver, los modelos de la familia Stable Diffusion son un conjunto de modelos de Inteligencia Artificial generativa capaces de crear nuevas imágenes a partir de descripciones de texto (o combinaciones de texto con, por ejemplo, otras imágenes presentadas al modelo).

Y la idea básica es que en principio estos modelos son entrenados para remover el ruido en imágenes de forma gradual. Y durante la fase de inferencia, esta remoción de ruido es guiada por un «prompt» de texto que permite que el modelo, después de un proceso iterativo, genere una imagen no existente previamente y que coincide con la descripción introducida por el usuario.

Además, vimos cómo usar los pipelines de Hugging Face para de forma muy simple hacer uso de modelos Stable Diffusion pre-entrenados para tareas de generación de imágenes a partir de texto o a partir de una combinación de un «prompt» y una imagen a la entrada.

Así que teniendo claro el principio de funcionamiento de estos modelos generativos y después de haber visto cómo usarlos con ayuda de Hugging Face, en la siguiente lección veremos de forma práctica cómo implementar otra tarea muy común en la Visión por Computador: la detección o estimación de pose.

Todas las lecciones del curso Introducción a la Visión por Computador con Deep Learning

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }