Lección 5 del curso LightGBM.
En la lección anterior vimos en qué consiste el método de muestreo unilateral basado en gradientes (o GOSS por sus siglas en Inglés), que en LightGBM permite entrenar cada árbol sólo con aquellos datos más problemáticos (los que generan más errores) y con una pequeña porción de los datos menos problemáticos.
En esta lección veremos en qué consiste el agrupamiento de características exclusivas (o EFB por sus siglas en Inglés), otra de las estrategias usada por el algoritmo LightGBM para reducir los tiempos de entrenamiento de este tipo de modelos:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, el agrupamiento de características exclusivas permite combinar en una sola variable (o columna del dataset) múltiples variables (es decir múltiples columnas) siempre y cuando éstas sean mutuamente excluyentes. Y al combinar múltiples variables en una única columna, el número de particiones que se deben evaluar al analizar dichas variables es mucho menor en LightGBM en comparación con lo que ocurre con XGBoost (que no implementa este tipo de técnica).
Así que, teniendo claro el principio de funcionamiento de esta cuarta estrategia de optimización del procesamiento usada por LightGBM, en la próxima lección nos enfocaremos en la última estrategia usada por este algoritmo para reducir la cantidad de operaciones requeridas para entrenar un modelo. Entonces veremos en detalle en qué consiste la búsqueda de particiones categóricas.
Todas las lecciones del curso LightGBM
