Lección 9 del curso Introducción a la Visión por Computador con Deep Learning.
En la lección anterior vimos cómo usar la librería «Mediapipe» de Google para usar un modelo pre-entrenado capaz de realizar una tarea de detección de pose, que consiste en la detección automática de puntos de interés en el cuerpo de una persona a partir de una imagen o un video.
En esta última lección del curso veremos cómo usar dos modelos pre-entrenados (uno basado en Redes Convolucionales y LSTM y otro basado en Redes Transformer) para abordar un problema muy común en la Visión por Computador: el reconocimiento óptico de caracteres (u OCR por sus siglas en Inglés: Optical Character Recognition).
La idea básica del OCR es simple: presentar al modelo una imagen de entrada la cual contiene texto y lograr que el modelo entregue a la salida el texto presente en dicha imagen. Y para lograr esto usaremos dos modelos:
- EasyOCR, un modelo basado en redes convolucionales y LSTM que permite detectar el texto presente en una imagen
- nouget small, un modelo multimodal basado en Redes Transformer que permite no sólo detectar el texto presente en una imagen sino generar un texto de salida en formato enriquecido (como por ejemplo MarkDown)
Veamos entonces estos dos ejemplos prácticos de extracción de texto a partir de imágenes:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien acabamos de ver dos ejemplos prácticos de extracción de texto en imágenes usando modelos pre-entrenados.
En el caso del primer modelo (EasyOCR), la extracción de texto entrega tanto los «bounding boxes» como el texto encontrado en cada región de la imagen, pero tiene la desventaja de que este texto es entregado «en bruto» (es decir sin ningún formato en particular).
Por otra parte, el segundo modelo (nouget small) es mucho más sofisticado pues permite no sólo extraer el texto sino también ponerlo en un formato que preserva la estructura del texto presente en la imagen de entrada.
En últimas, ningún modelo es mejor que el otro y la decisión acerca de la arquitectura a usar dependerá de las características particulares del problema que estemos resolviendo.
Así que con esto hemos llegado al final de este curso, ¡te felicito por haber llegado hasta este punto!
A lo largo de este curso hemos visto de forma conceptual y práctica una primera aproximación a las principales aplicaciones de la Visión por Computador, pasando por tareas relativamente simples como la clasificación y la detección de objetos, hasta llegar a tareas más complejas como la generación de imágenes o la extracción de texto en imágenes.
Con esto ya tenemos un panorama de las principales aplicaciones de Visión por Computador que se pueden desarrollar en la actualidad haciendo uso de arquitecturas de Deep Learning y la idea es que en los próximos cursos de esta especialización comencemos a abordar una a una, y de forma detallada, estas tareas que nos permitirán adquirir las habilidades necesarias para comenzar a resolver problemas en este campo de la Inteligencia Artificial.
Como siempre, te invito a que me contactes a través de la Intranet para que me compartas los comentarios sobre este curso o para que me sugieras los próximos cursos que quisieras que formen parte de esta especialización en Visión por Computador con Deep Learning.
¡Así que te envío un saludo y te invito a tomar el siguiente curso en esta especialización: Clasificación de Imágenes con Deep Learning!
Todas las lecciones del curso Introducción a la Visión por Computador con Deep Learning
