Lección 10 del curso Regresión Lineal.
En la lección anterior vimos cómo implementar el método de selección del mejor conjunto de variables predictoras para un modelo de Regresión Lineal.
Y allí vimos que una de las limitaciones de este método es que el número de posibles combinaciones de covariables a evaluar puede resultar elevado, lo que hace que en ocasiones se requieran tiempos de cómputo prolongados.
Así que en esta lección veremos cómo funcionan los métodos de selección de covariables por pasos (hacia adelante y hacia atrás) que no requiren evaluar todas las posibles combinaciones de predictores al momento de construir un modelo de Regresión Lineal y que, por tanto, requieren menos tiempo de cómputo:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, en la selección por pasos podemos implementar cualquiera de estos dos métodos:
- La selección hacia adelante, donde comenzamos con un modelo con 0 variables predictoras y progresivamente vamos añadiendo únicamente aquellas covariables que mejoren el desempeño del modelo
- Y la selección hacia atrás, donde comenzamos con un modelo con todas las variables predictoras y progresivamente vamos eliminando únicamente aquellas covariables que mejoren el desempeño del modelo
En últimas, los dos enfoques son equivalentes y lo ideal es que al final, independientemente del método elegido, contemos con un conjunto de covariables que generen el mejor desempeño posible así como el menor sobre-ajuste.
En comparación con la selección del mejor conjunto de variables predictoras, visto en la lección anterior, en el caso de la selección por pasos generalmente tendremos que probar con muchas menos combinaciones y por tanto el tiempo de cómputo será mucho menor.
Sin embargo, la desventaja de estos métodos es que al final no necesariamente tendremos el mejor conjunto de covariables posible (pues realmente estos métodos no prueban todas las combinaciones existentes).
Así que la elección entre la selección del mejor conjunto de variables predictoras o la selección por pasos dependerá del tamaño del set de datos que estemos usando así como de las capacidades de cómputo que tengamos a la mano.
En las próximas dos lecciones, las últimas de este curso, veremos un par de alternativas a estos métodos de selección de covariables que, en general, son menos costosas computacionalmente. Estas técnicas se conocen como métodos de regularización.
Y en particular, en la próxima lección hablaremos en detalle del primero de estos métodos: la Regresión Ridge.
Todas las lecciones del curso Regresión Lineal
