Lección 13 del módulo “Redes Convolucionales” del curso Fundamentos de Deep Learning con Python.
En la práctica anterior vimos cómo implementar un clasificador de imágenes usando LeNet y la librería Keras y vimos el impresionante desempeño de LeNet en esta tarea de clasificación.
Con el paso de los años, se han desarrollado variantes de LeNet que han alcanzado un desempeño aún más impresionante en el campo de la visión por computador, comparable incluso con el desempeño alcanzado por el ser humano en este tipo de tareas.
Así que en esta lección hablaremos en detalle de dos de estas arquitecturas: AlexNet y VGGNet.
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Acabamos de ver la evolución que ha tenido el desempeño de las Redes Convolucionales en los últimos años, lo que se ve reflejado en la reducción de la tasa de error en competencias como el reto ImageNet, que clasifica imágenes en 10,000 categorías usando 1.2 millones de imágenes de entrenamiento y 50,000 de validación. El error top-5, que mide si la categoría correcta está entre las primeras cinco predicciones, era del 26% antes de 2012.
Con AlexNet y VGGNet, de las cuales acabamos de hablar en detalle en esta lección, este error se redujo al 17% y 8%, respectivamente, acercándose al 5% de error humano. AlexNet, desarrollada en 2012, utilizó más datos y capas que LeNet, mientras que VGGNet, desarrollada en 2014, introdujo el uso de «bloques» de capas con patrones repetitivos y múltiples capas con pequeños filtros de 3×3, resultando más efectivas que capas con filtros grandes.
Estas dos arquitecturas que acabamos de ver dieron comienzo a una revolución en el área de la visión artificial a través del Deep Learning.
Los creadores de estas redes lograron demostrar que una red lo suficientemente profunda, y entrenada con una elevada cantidad de datos, era capaz de aprender a clasificar automáticamente imágenes con una tasa de error muy baja y cercana al desempeño alcanzado por el ser humano.
Así que ya estamos listos para la segunda práctica de este módulo, que será el tema de la próxima lección, y donde veremos cómo realizar lo que se conoce como transferencia de aprendizaje usando VGG-16.
Todas las lecciones del curso Fundamentos de Deep Learning con Python.
