Lección 4 del curso XGBoost.
En la lección anterior vimos el funcionamiento detallado del algoritmo Gradient Boosting para el caso de la clasificación.
Y esto, junto con la regresión con Gradient Boosting que vimos en la lección 2, nos permite tener ya todas las bases necesarias para entender cómo funcionan los algoritmos y modelos XGBoost, la parte central de este curso.
Así que en esta lección veremos en detalle el principio de funcionamiento de los modelos XGBoost para llevar a cabo tareas de regresión.
Comencemos entonces viendo entendiendo las limitaciones del Gradient Boosting, con lo cual podremos entender precisamente de dónde surgen los modelos XGBoost:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En esencia los modelos de potenciación del gradiente son propensos a presentar sobre-ajuste (u «overfitting»). Y los modelos XGBoost (o «Extreme Gradient Boosting») surgen precisamente como una solución a este problema.
Aunque el principio de funcionamiento de los algoritmos y modelos XGBoost es similar al de los modelos Gradient Boosting, en el caso de XGBoost se incorporan estrategias como la regularización, el sub-muestreo de características y los criterios de parada que, de forma conjunta, permiten reducir el «overfitting» y a su vez mejorar el desempeño.
Teniendo claro este principio de funcionamiento, veamos ahora sí en detalle un ejemplo numérico que nos permitirá entender cómo funciona el algoritmo XGBoost para el caso de la regresión:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver el algoritmo XGBoost comparte varios elementos vistos anteriormente para el caso de la potenciación del gradiente. Sin embargo, una de las principales diferencias radica en la manera como se construye cada uno de los árboles que harán parte del modelo final.
Sin embargo, en este punto aún no hemos hablado de los nuevos hiper-parámetros incorporados en XGBoost (𝛾 y λ), así que veamos en detalle el papel que estos dos componentes juegan en la regularización de este tipo de modelos:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En esencia, los hiper-parámetros 𝛾 y λ permiten reducir la complejidad de cada uno de los árboles construidos y, por tanto, permiten crear un modelo XGBoost que, en términos generales, tendrá menor «overfitting» en comparación con un modelo de potenciación del gradiente.
Así que con esto ya tenemos claros todos los detalles del funcionamiento del algoritmo de entrenamiento de estos modelos XGBoost para el caso de la regresión. En la próxima lección usaremos un enfoque similar para entender cómo funcionan los modelos XGBoost para una tarea de clasificación.
Todas las lecciones del curso XGBoost
