• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

8 – Árboles de regresión en Scikit-Learn

Lección 8 del curso Árboles de Decisión.

En la lección anterior vimos cómo generar predicciones con un árbol de regresión entrenado y con esto ya hemos visto en detalle todos los conceptos que nos permiten entender qué es un árbol de regresión, cómo entrenar un árbol de regresión con el algoritmo CART y cómo generar posteriormente predicciones.

Así que para cerrar este segundo módulo del curso únicamente nos resta poner en práctica todo lo aprendido para resolver un problema de regresión.

Entonces, en esta lección veremos cómo usar Scikit-Learn para crear, entrenar, validar y poner a prueba un árbol de regresión para un problema de predicción del valor del alquiler de un inmueble.

Y en esta primera parte veremos en detalle el problema a resolver, haremos la lectura y exploración inicial del set de datos e implementaremos las fases necesarias para su pre-procesamiento antes de construir y entrenar el árbol de regresión:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Así que el objetivo de esta práctica es entrenar, validar y poner a prueba un árbol de regresión capaz de predecir el precio de renta de una propiedad con base en características como el número de habitaciones, el número de baños y su área entre otros.

Después de leer y realizar la exploración del set de datos vimos cómo implementar algunas fases de pre-procesamiento que nos permitieron eliminar las columnas irrelevantes, transformar la columna precios para obtener su representación numérica y codificar las columnas o variables categóricas usando la codificación «one-hot». Y después de todo esto creamos los sets de entrenamiento/validación y de prueba.

Con esto ya estamos listos para construir el modelo haciendo uso de Scikit-Learn para posteriormente validarlo y ponerlo a prueba. Veamos entonces esta segunda parte de la práctica:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Acabamos de ver que la lógica para la creación y entrenamiento de un árbol de regresión es exactamente la misma que usamos en el caso de los árboles de clasificación.

En particular, después de importar el módulo «DecisionTreeRegressor» de Scikit-Learn, debemos crear una instancia de dicha clase y luego usar el método «fit» para realizar el entrenamiento del árbol.

De igual forma, podemos añadir parámetros como la profundidad máxima («max_depth») para controlar el tamaño del árbol a generar.

Y una vez creado el árbol podemos validarlo haciendo uso del método k-fold cross-validation (o validación cruzada de k-iteraciones) con lo cual pudimos tener una idea del desempeño del modelo en términos de la raíz cuadrada del error cuadrático medio (o RMSE por sus siglas en Inglés).

Tras esta validación podemos nuevamente entrenar el modelo con la totalidad del set de entrenamiento/validación y ponerlo a prueba generando predicciones sobre el set de prueba usando el método «predict()».

Y finalmente, podemos usar de nuevo el RMSE para medir el desempeño del modelo al momento de generar predicciones usando tanto el set de entrenamiento como el set de validación. Y esta última etapa nos permitió ver que el modelo tiene algo de «overfitting» o sobre-ajuste, así que la idea es entender posibles alternativas que nos permitan mejorar este desempeño con el set de prueba para así reducir este sobreajuste.

Así que en el siguiente módulo nos enfocaremos precisamente en dos de las técnicas más usadas para este propósito: la poda del árbol y el ajuste de hiperparámetros.

Y específicamente en la siguiente lección nos enfocaremos en el primer método. Así que veremos qué es y cómo realizar la poda de un árbol de decisión.

Todas las lecciones del curso Árboles de Decisión

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }