• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

8 – Imputación con interpolación

Lección 8 del curso Series de Tiempo: Pre-procesamiento.

En la lección anterior hablamos de la imputación multivariada, la técnica más robusta para el manejo de datos faltantes en Series de Tiempo.

En esta lección veremos una última técnica de imputación conocida como la interpolación que, a pesar de no ser tan robusta en comparación con la imputación multivariada, también puede ser usada en muchas situaciones.

En particular comenzaremos viendo qué es la interpolación y luego cómo implementar esta técnica haciendo uso del método “interpolate” de la librería Pandas.

Al final veremos las ventajas y limitaciones de este método y las situaciones en las que resulta adecuado usarlo:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Bien acabamos de ver cómo realizar la imputación por interpolación usando diferentes técnicas (imputación por vecinos más cercanos, imputación lineal, polinomial y usando splines).

En general la interpolación polinomial o con splines, con polinomios de grado 2 o mayores, tiende a generar artefactos que no coinciden con el comportamiento de la Serie de Tiempo.

Además, cuando tenemos bloques con pocos datos faltantes consecutivos, la interpolación lineal o por vecinos más cercanos tiende a funcionar mejor. Sin embargo, hay que tener en cuenta que la interpolación por vecinos más cercanos es sensible a valores extremos.

Así que podemos decir que cuando tenemos bloques con pocos datos faltantes consecutivos, y sin valores extremos, se sugiere usar métodos de interpolación lineal o vecinos más cercanos, o los métodos de llenado hacia adelante o hacia atrás vistos anteriormente.

Sin embargo, cuando tenemos bloques con muchos datos faltantes consecutivos se sugieren métodos más robustos como el uso de modelos de regresión (Machine Learning) o el método MICE vistos en la lección anterior.

Así que con esto hemos culminado este segundo módulo del curso. En el tercer módulo nos enfocaremos en las principales técnicas de detección de valores extremos (u “outliers”) en Series de Tiempo.

Y específicamente en la próxima lección veremos la técnica más simple: la detección de “outliers” usando inspección visual.

Todas las lecciones del curso Series de Tiempo: Preprocesamiento

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }