Lección 6 del curso Regresión Logística.
En la lección anterior vimos qué es la Regresión Logística Múltiple y cómo implementar este tipo de modelos con ayuda de Python y las librerías Scikit-Learn y statsmodels.
Pero una de las preguntas que surge cuando implementamos este tipo de modelos es: ¿cómo podemos usar únicamente aquellas variables de entrada más relevantes al momento de hacer las predicciones? La respuesta está en técnicas de selección de variables y en la regularización.
Así que en esta lección veremos cómo usar la selección de covariables y especialmente las técnicas de regularización (Lasso, Ridge y Elastic Net) en un modelo de Regresión Logística Múltiple con el fin de mejorar las predicciones hechas por el modelo, haciendo que las covariables más relevantes tengan un mayor impacto en esas predicciones.
Comencemos entonces viendo cómo realizar la selección de covariables:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, la selección del mejor conjunto de covariables para un modelo de Regresión Logística sigue la misma lógica que vimos en el curso de Regresión Lineal cuando implementamos la selección de las mejores covariables.
En esencia debemos probar todas las combinaciones de covariables posibles y en cada caso almacenar el desempeño del modelo con el set de validación. Y posteriormente seleccionamos aquella combinación de covariables cuyo correspondiente modelo alcance el mejor desempeño.
Sin embargo, esta técnica puede tener limitaciones computacionales pues si tenemos una gran cantidad de datos de entrenamiento o un número elevado de covariables el tiempo de cómputo puede ser elevado.
En este caso se sugiere usar técnicas de regularización como la regresión Ridge o la regresión Lasso (que vimos en detalle en el curso de Regresión Lineal). Incluso podemos usar una combinación de estas dos técnicas implementando lo que se conoce como la Regresión Elastic Net. Así que veamos cómo implementar estas técnicas de regularización de forma práctica para un modelo de Regresión Logística:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, las técnicas de regularización Ridge, Lasso y Elastic Net permiten controlar de forma automática el efecto que cada covariable tiene en las predicciones generadas por el modelo, lo cual tiene como resultado una mejora en su desempeño.
Y la implementación de estas técnicas en Scikit-Learn es realmente muy sencilla: basta con ajustar el argumento «penalty» al momento de crear la instancia del modelo.
Así que con todo lo visto hasta este punto a lo largo del curso, hemos aprendido a implementar y evaluar modelos de Regresión Logística que aceptan una o múltiples variables de entrada y que permiten clasificar el dato en una de dos posibles categorías.
Sin embargo, en la práctica muchas veces tendremos que enfrentarnos a problemas de clasificación donde tendremos tres o más categorías. Así que en la próxima lección, la última de este curso, veremos qué son y cómo se implementan los modelos de Regresión Logística Multinomial (o Multiclase) que precisamente permiten clasificar datos en tres o más categorías.
Todas las lecciones del curso Regresión Logística
