Lección 3 del curso LightGBM.
En la lección anterior vimos en qué consiste el crecimiento de árboles por hojas en LightGBM, la primera mejora de este algoritmo con respecto a XGBoost y que permite subdividir sólo aquellas hojas que incrementen de manera significativa el desempeño del modelo.
En esta lección veremos la segunda mejora implementada por el algoritmo LightGBM orientada a mejorar el entrenamiento del modelo en comparación con XGBoost. Hablaremos entonces de las particiones basadas en histogramas:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Así que, como acabamos de ver, en las particiones basadas por histogramas LightGBM no evalúa todos los posibles umbrales de partición (como sí lo hace XGBoost).
En su lugar, LightGBM agrupa la variable a procesar en diferentes «bins» y evalúa únicamente los umbrales en los límites entre «bins» consecutivos. Esto redunda en una reducción significativa en la cantidad de cálculos que se tienen que hacer al momento de construir los árboles que hacen parte del modelo.
Así que teniendo clara esta estrategia de optimización, en la próxima lección hablaremos de la tercera mejora incorporada por LightGBM frente a XGBoost: el muestreo unilateral basado en gradientes (GOSS).
Todas las lecciones del curso LightGBM
