Lección 9 del curso Introducción a la Ciencia de Datos.
En la lección anterior vimos las diferentes alternativas para el almacenamiento de los datos que van desde las más simples como el uso de archivos sofisticados hasta las más complejas como los lagos de datos (o data lakes).
Pero en la práctica los datos no tienen un comportamiento ideal pues pueden estar incompletos o tener valores inadecuados o puede haber otros factores que nos impidan comenzar a realizar el análisis.
El pre-procesamiento nos permite manejar este tipo de situaciones y preparar los datos para que puedan ser posteriormente analizados. Así que en esta lección hablaremos en detalle de las diferentes técnicas de pre-procesamiento convencionalmente utilizadas:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Bien, como acabamos de ver la limpieza de datos es una fase crucial en el ciclo de vida de un proyecto en Ciencia de Datos, y comúnmente es la fase más demandante en términos de tiempo dentro del pre-procesamiento.
Esta limpieza implica, entre otras, el manejo de datos faltantes y de valores extremos y aunque algunos de estos pasos pueden automatizarse, muchos requieren intervención manual.
Además, el pre-procesamiento incluye la integración de datos, que consiste en combinar información de diferentes fuentes, así como la reducción de datos para eliminar datos irrelevantes o encontrar una representación adecuada de los mismos.
Así que ya hemos visto de forma general algunas de las técnicas más comunes de pre-procesamiento de los datos, aunque el abanico de técnicas es mucho más amplio pues cada proyecto tendrá sus particularidades y además podemos incluso tener datos no estructurados que generalmente requieren técnicas de pre-procesamiento mucho más sofisticadas.
Así que para entender mejor estas técnicas usadas comúnmente, en la próxima lección desarrollaremos un ejemplo práctico de pre-procesamiento de datos.
Todas las lecciones del curso Introducción a la Ciencia de Datos
