• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

2 – Pruebas de normalidad

Lección 2 del curso Estadística Inferencial Paramétrica.

En la lección 1 vimos un breve repaso de los principales conceptos a tener en cuenta cuando hablamos de prueba de hipótesis, los cuales serán fundamentales para lo que resta de este curso.

Y cuando hablemos de las pruebas paramétricas más usadas en Ciencia de Datos y Machine Learning, en los módulos 2, 3 y 4, veremos que existen unos pre-requisitos o condiciones que los datos deben cumplir antes de poder aplicar estas pruebas. Dichas condiciones también se conocen como los «supuestos» y serán el tema de esta y de la próxima lección.

Y específicamente en esta lección hablaremos de las pruebas de normalidad más usadas para determinar si nuestros datos tienen una distribución normal o Gaussiana. En particular, veremos en detalle las principales pruebas gráficas (el histograma y los gráficos cuantil-cuantil o q-q) y las pruebas estadísticas más usadas (Kolmogorov-Smirnov y Shapiro-Wilk). Además, veremos cómo usar Python para implementar de forma práctica todas estas pruebas.

Así que comencemos hablando en detalle de las pruebas gráficas:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Muy bien, acabamos de ver inicialmente un breve repaso de los principales conceptos asociados a la distribución Gaussiana y a la función de distribución acumulada (o CDF) que son la base de varias de las pruebas de normalidad.

Y posteriormente hablamos de las dos principales herramientas gráficas para determinar la normalidad de una distribución: los histogramas y los gráficos cuantil-cuantil (o q-q plots por sus siglas en Inglés).

En esencia estas herramientas nos permiten fácilmente y con muy pocas líneas de código determinar en ciertos casos si nuestros datos no tienen una distribución normal. Sin embargo, en ocasiones esta simple representación gráfica no resulta suficiente para determinar si una distribución es gaussiana.

Así que lo que se sugiere es siempre complementar estas pruebas con las pruebas estadísticas, de las cuales hablaremos a continuación:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Como acabamos de ver, las pruebas de Kolmogorov-Smirnov y la de Shapiro-Wilk son dos de las pruebas estadísticas más usadas al momento de determinar la normalidad de una distribución.

En esencia la prueba Kolmogorov-Smirnov compara, desde el punto de vista estadístico, las CDFs de la distribución normal estandarizada con la de nuestros datos, calcula una estadística asociada (el valor «D») y con base en esto calcula el valor p asociado.

Por otra parte, la prueba Shapiro-Wilk compara los cuantiles de las dos distribuciones, calcula la estadística W y posteriormente el valor p.

Y en ambos casos, si el valor de p es inferior al nivel de significancia establecido (generalmente 0.05) lo que hacemos es rechazar la hipótesis nula (que nos dice que la distribución de nuestros datos es normal) y por tanto nos inclinamos por la hipótesis alternativa (que nos dice que la distribución de nuestros datos NO es normal).

En todo caso, es importante tener en cuenta que por tratarse de pruebas estadísticas siempre tendremos un grado de incertidumbre así que siempre debemos complementarlas con las pruebas gráficas vistas en la primera parte de esta lección para al final tomar una decisión acerca de si nuestros datos tienen o no una distribución normal.

Así que con todo esto ya hemos visto qué son y cómo implementar de forma sencilla en Python las principales pruebas de normalidad que usualmente podremos aplicar a nuestros datos.

Entonces, en la siguiente lección nos enfocaremos en el segundo tipo de pruebas que convencionalmente tendremos que aplicar a nuestros datos antes de aplicar una prueba paramétrica. Así que hablaremos en detalle de las pruebas de homocedasticidad.

Todas las lecciones del curso Estadística Inferencial Paramétrica

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }