Lección 6 del curso Bosques Aleatorios.
En la lección anterior vimos cómo validar un Bosque Aleatorio usando las muestras «out-of-bag», así que con esto ya estamos listos para poner en práctica todo lo aprendido para resolver problemas de Machine Learning usando este tipo de modelos.
Así que en esta lección veremos cómo crear, entrenar, validar y poner a prueba un Bosque Aleatorio para realizar una tarea de clasificación, usando Python y la librería Scikit-Learn.
En particular, construiremos un Bosque de clasificación capaz de predecir si a una persona se le otorgará o no un crédito con base en información asociada a su perfil (edad, género, nivel educativo y nivel de ingresos entre otros ).
Así que veamos cómo resolver este problema:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien. En este ejercicio práctico acabamos de ver lo sencillo que resulta crear, entrenar, validar y poner a prueba un Bosque Aleatorio de clasificación usando el módulo «RandomForestClassifier» de la librería Scikit-Learn.
En esencia, después de pre-procesar el set de datos lo que debemos hacer es crear una instancia del módulo «RandomForestClassifier» y luego usar el método «fit()» para entrenar el modelo.
Y lo clave en este proceso es que al crear la instancia debemos usar el parámetro «oob_score = True» para que durante el entrenamiento se almacenen las muestras «out-of-bag» (OOB) de cada árbol que posteriormente nos permitirán validar el desempeño del modelo.
Y tras entrenar el Bosque evaluamos el desempeño obteniendo una exactitud de prácticamente el 90% tanto con las muestras OOB como con el set de prueba. Y acá vale la pena resaltar que el Bosque que entrenamos tenía los hiper-parámetros definidos por defecto por Scikit-Learn, lo cual nos permite concluir que el desempeño es bastante bueno y que el modelo no presenta ningún sobre-ajuste (contrario a lo que ocurría cuando usábamos árboles de clasificación).
Y al final, para generar predicciones sobre datos nuevos basta con usar el método «predict» asociado al Bosque ya entrenado.
Así que con esto ya hemos visto cómo resolver un problema de clasificación usando este primer tipo de Bosques Aleatorios.
En la siguiente lección veremos un ejemplo similar pero enfocado en una tarea de regresión. Así que veremos cómo resolver un problema de regresión usando Bosques Aleatorios en Python.
Todas las lecciones del curso Bosques Aleatorios
