Lección 6 del curso Estadística Inferencial No Paramétrica.
En la lección anterior vimos en detalle qué es la prueba de Kruskal-Wallis. Y además vimos cómo usar Python para aplicar esta prueba a un set de datos al momento de comparar de manera simultánea tres o más agrupaciones.
Sin embargo, una limitación de dicha prueba es que sólo nos indica si los grupos son iguales o diferentes desde el punto de vista estadístico, pero no nos indica posibles diferentes entre pares de esos grupos.
Así que en esta lección veremos en qué consiste la prueba de Dunn, una prueba posterior (o «post-hoc») a la prueba de Kruskal-Wallis y que nos permite identificar diferencias entre pares de grupos.
Comencemos entendiendo la lógica de esta prueba:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En esencia la prueba de Dunn aplica la prueba z sobre los rangos asociados a cada par de agrupaciones analizadas, posteriormente calcula el valor p y realiza su corrección usando el método de Bonferroni o el de Benjamini-Hochberg.
Así que teniendo claro cómo funciona esta prueba, veamos su implementación práctica en Python con ayuda de la librería «scikit-posthocs»:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, aplicar esta prueba post-hoc de Dunn a un set de datos resulta muy simple cuando hacemos uso de la librería «scikit-posthocs»: en primer lugar usamos la función «posthoc_dunn» y le presentamos el set de datos en formato largo indicando la columna que contiene las agrupaciones así como la variable medida. Además, indicamos la corrección a usar (Bonferroni o Benjamini-Hochberg). Y después de esto obtendremos una tabla con el reporte de los valores p (corregidos) para cada par de variables analizadas.
Así que con lo visto a lo largo de este curso, hasta este punto hemos aprendido a usar diferentes pruebas paramétricas para comparar una agrupación con un valor de referencia (como en la prueba de Wilcoxon de una muestra), a desarrollar tests A/B o comparaciones entre pares de grupos (usando la prueba U de Mann-Whitney), a comparar muestras dependientes (con la prueba de Wilcoxon para muestras pareadas) y a analizar tres o más agrupaciones (usando la prueba de Kruskal-Wallis de la lección anterior).
Sin embargo, todas estas pruebas no paramétricas hacen uso de variables numéricas. Pero en la práctica en un proyecto de Ciencia de Datos muchas veces resultará de interés realizar comparaciones entre variables categóricas. Así que en la próxima lección veremos en detalle las pruebas Chi-cuadrado y Fisher para comparar variables categóricas.
Todas las lecciones del curso Estadística Inferencial No Paramétrica
