Lección 5 del curso XGBoost.
En la lección anterior vimos todos los detalles del algoritmo de regresión con XGBoost. Así que en esta lección veremos los principales componentes matemáticos y un ejemplo numérico que nos permitirá entender cómo funciona el algoritmo de entrenamiento de un modelo XGBoost para clasificación:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
La lógica de funcionamiento del algoritmo de entrenamiento para un modelo de clasificación XGBoost es muy similar a la que vimos en la lección anterior para el caso de la regresión.
Es decir que lo que se hace es entrenar de forma secuencial múltiples árboles con el objetivo de minimizar la pérdida, que en este caso corresponde a la función log-loss. Además de esto, y al igual que ocurría con la regresión, el algoritmo de entrenamiento XGBoost incorpora un conjunto de hiper-parámetros así como la opción de entrenar cada árbol con una fracción de las características seleccionada aleatoriamente.
Lo anterior, combinado con la opción de detener de forma temprana el entrenamiento, permite que este tipo de modelos tengan menor sobre-ajuste (u «overfitting») que los modelos de Gradient Boosting para clasificación.
Así que con todo lo visto en este primer módulo del curso ya tenemos todos los elementos conceptuales que nos permiten entender en detalle el funcionamiento de los modelos XGBoost para realizar tareas de regresión y clasificación.
Entonces, en el segundo módulo del curso veremos cómo poner en práctica todos estos conceptos haciendo uso de la librería XGBoost. Y específicamente, en la próxima lección veremos un ejemplo práctico de clasificación con XGBoost en Python.
Todas las lecciones del curso XGBoost
