Lección 3 del curso XGBoost.
En la lección anterior vimos todos los detalles de los modelos y algoritmos de Regresión con Gradient Boosting.
En esta lección veremos un ejemplo numérico de funcionamiento así como el componente matemático detrás de los modelos de clasificación con Gradient Boosting.
Así que comencemos viendo un ejemplo numérico del algoritmo de entrenamiento para este tipo de modelos:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, la lógica de funcionamiento de este algoritmo de potenciación del gradiente para el caso de la clasificación es muy similar a la que vimos en la lección anterior para el caso de la regresión.
La idea básica consiste en realizar una estimación inicial y posteriormente refinarla de forma iterativa, para lo cual se entrenar de forma secuencial múltiples árboles de decisión que intentan predecir los errores cometidos por los árboles anteriores.
La diferencia clave entre este algoritmo de clasificación y el de regresión visto anteriormente radica en que para la clasificación debemos realizar transformaciones entre el espacio «log-odds» y el espacio de probabilidades para de esta forma poder actualizar correctamente las predicciones.
Teniendo claro este principio de funcionamiento, veamos a continuación los componentes matemáticos más importantes de este tipo de modelos:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver la principal diferencia entre el algoritmo de clasificación y la regresión con Gradient Boosting radica en la función de pérdida. En el caso de la clasificación esta pérdida se conoce como «log-loss» que matemáticamente hace uso del logaritmo natural y que es además una función continua y derivable.
Así que con lo visto en estas dos últimas lecciones ya tenemos todos los elementos que nos permiten entender en detalle cómo funcionan estos algoritmos y modelos de potenciación del gradiente al momento de resolver problemas de regresión y clasificación.
Y por tanto ya estamos listos para comenzar a ver todos los detalles relacionados con los modelos XGBoost. Entonces, en la siguiente lección veremos cómo funcionan los modelos XGBoost para llevar a cabo tareas de regresión.
Todas las lecciones del curso XGBoost
