Lección 6 del curso SQL Nivel Avanzado.
En la lección anterior vimos cómo usar SQL para realizar el análisis univariado de variables tanto numéricas como categóricas.
En esta lección veremos cómo usar varias de las herramientas aprendida en este y en cursos anteriores para realizar el análisis bivariado (es decir por pares de variables) y multivariado (es decir, 3 o más varibles) como parte de este análisis exploratorio de datos.
Comencemos viendo cómo realizar el análisis bivariado entre pares de variables numéricas:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En este caso hemos hecho uso de la función CORR() de SQL, que nos permite calcular el índice de correlación entre dos variables numéricas.
Y este análisis nos ha permitido ver que existe una correlación positiva (cercana a 0.8) entre el salario y los puntos obtenidos en cada partido por cada jugador, lo que definitivamente nos indica que esta variable es un factor asociado a salarios más altos.
Veamos ahora cómo usar SQL para realizar la comparación entre una variable numérica y una variable categórica:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En este segundo ejemplo hemos generado agrupaciones con GROUP BY en SQL para comparar la variable “position” (una variable categórica) con la variable “salary_m” para determinar, por cada posición, el salario promedio de los jugadores.
Y esto nos ha permitido ver que la posición PG-SG (point guard – shooting guard) es la que, con gran diferencia, diferencia tiene un salario promedio más alto (21.5 millones de dólares) en comparación con todas las demás posiciones.
Veamos ahora cómo usar esta misma herramienta (GROUP BY) pero para realizar el análisis multivariado (es decir, para comparar de manera simultánea tres o más variables):
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En este caso, hemos añadido las variables puntos por juego y edad a la consulta anterior para determinar si existía alguna relación entre la posición de los jugadores y el salario.
De nuevo hemos comprobado que la posición PG-SG es la que tiene un mayor salario y que esto está asociado directamente con el promedio de puntos por partido (que es de 16.1 para estos jugadores) y que además los jugadores más “veteranos” son también los mejor pagados.
Así que acabamos de ver cómo usar varias de las herramientas que nos proporciona SQL para realizar el análisis exploratorio de datos, aunque es importante tener en cuenta que SQL no nos permite directamente incluir un elemento esencial en este análisis: la visualización de nuestros datos. Así que en el último módulo del curso veremos cómo combinar el poder de SQL con el lenguaje de programación Python para añadir este componente esencial al momento de realizar el Análisis Exploratorio de Datos.
Y con esto hemos completado este segundo módulo del curso. En el siguiente módulo veremos cómo usar SQL para crear sets de datos útiles al momento de crear y entrenar modelos de Machine Learning.
Y en particular, en la próxima lección, veremos cómo usar SQL para crear un set para la clasificación de datos.
Todas las lecciones del curso SQL Nivel Avanzado
