La distribución Gaussiana (o Normal) es tal vez la distribución de probabilidad más usada en Ciencia de Datos y tiene muchas aplicaciones que van desde ser un requisito para desarrollar diferentes modelos de Machine Learning hasta su uso para por ejemplo detectar valores extremos, transformar nuestros datos o lo que se conocen como las pruebas de hipótesis.
Así que en este artículo vamos a entender qué es la distribución Gaussiana, cuáles son sus características y por qué resulta importante entender esta distribución en Ciencia de Datos.
Breve repaso: distribución de probabilidad
Para entender qué es la distribución Gaussiana debemos recordar el concepto de distribución de probabilidad.
La idea básica de una distribución de probabilidad es que cuando trabajamos con datos del mundo real estos datos son lo que se conoce como una variable aleatoria.
Una variable aleatoria es aquella que no podemos predecir de forma exacta. Un ejemplo de esto sería por ejemplo la altura de las mujeres en un país determinado: podemos decir que la mayoría de las mujeres tiene una altura que se encuentra dentro de un rango determinado, pero es probable que algunas mujeres ocasionalmente tengan alturas que estén por fuera de dicho rango.
Sin embargo, si recolectamos una gran cantidad de datos de altura de mujeres, podremos tener una idea general de cuáles serán esos rangos de valores y la manera como están distribuidos.
Y cuando hablamos de la forma como la variable aleatoria (por ejemplo las alturas) está distribuida en diferentes rangos de valores, estamos hablando precisamente de una distribución de probabilidad.
Por ejemplo, en la figura de abajo vemos una representación gráfica de esta distribución de alturas. En el eje horizontal de este histograma tendremos los diferentes rangos de alturas (que van desde aproximadamente 140 cm hasta casi 180cm), mientras que en el eje vertical encontraremos la densidad de probabilidad que nos indicará la probabilidad de encontrar mujeres con ciertos niveles de altura en cada rango:

Así, podemos ver que entre mayor sea la altura de la barra correspondiente a cada rango mayor será la probabilidad de encontrar mujeres con esos niveles de altura.
¿Qué es la distribución Gaussiana?
Muy bien, habiendo recordado qué es una distribución de probabilidad ya estamos listos para entender qué es la distribución Gaussiana.
Y para ello volvamos al ejemplo anterior donde veíamos la distribución de alturas de las mujeres en Estados Unidos: lo que nos interesa analizar en este caso particular de la distribución de alturas es la forma que tiene el histograma. Específicamente, podemos observar que dicha distribución es relativamente simétrica con respecto a los valores centrales (ubicados entre 160 y 162 cm).
Esta simetría quiere decir que, en promedio, la mayoría de las mujeres tiene alturas dentro de ese rango (160 a 162 cm) y a medida que nos alejamos de ese punto central (bien sea hacia la izquierda o la derecha) las probabilidades van decayendo (es decir que la cantidad de mujeres que tienen alturas diferentes de dicho valor central se va reduciendo).
Y si realizamos el cálculo matemático correspondiente a esta distribución de probabilidad, tendría una forma similar a la curva de color amarillo mostrada a continuación:

Y con esta curva se evidencia más claramente esta simetría. Además, vemos que esta curva tiene una forma de campana donde, dada esta simetría, la mitad del lado izquierdo es prácticamente idéntica a la del lado derecho. Esto es precisamente un ejemplo de una variable del mundo real que tiene una distribución Gaussiana.
Analicemos otra variable del mundo real: la distribución de temperaturas a lo largo del día.
Si usamos un sensor para recolectar datos de temperatura ambiente durante varios días, por ejemplo cada minuto, y dibujamos el histograma y la distribución continua correspondiente, tendríamos un comportamiento similar al mostrado a continuación:

En este caso vemos nuevamente un comportamiento similar al del primer ejemplo: una campana simétrica con respecto a los valores promedio (que en este caso están cerca de los 5 °C). De nuevo tenemos un ejemplo real de una distribución Gaussiana.
Y veamos un tercer ejemplo real: en una fábrica donde se producen piezas mecánicas, por ejemplo tuercas, lo importante es garantizar que el diámetro de las piezas está dentro de un rango predefinido (por ejemplo 10 mm).
Sin embargo, en la práctica las piezas fabricadas no tendrán exactamente ese tamaño «ideal» y en su lugar los diámetros reales tendrán valores cercanos o ligeramente por encima o por debajo de ese valor de referencia. En este caso el histograma y la distribución tendrían una forma similar a esta:

De nuevo vemos el mismo comportamiento de los dos casos anteriores: una distribución con forma de campana que es simétrica con respecto a un valor central (en este caso un diámetro de 10 mm). Es decir que en este caso la variable diámetro tiene precisamente una distribución Gaussiana o Normal.
Así que con estos tres ejemplos que acabamos de ver ya tenemos una idea intuitiva de lo que es la distribución Gaussiana y por tanto ya la podemos definir de manera formal:
La distribución Gaussiana, también conocida como distribución Normal, es una distribución de probabilidad continua que describe cómo se distribuyen ciertos tipos de datos en torno a un valor central.
Y una manera informal de verificar si los datos tienen una distribución Gaussiana es precisamente dibujando el histograma y la distribución continua (como lo hicimos en los ejemplos anteriores) o haciendo uso de pruebas estadísticas conocidas como pruebas de normalidad.
Características de la distribución Gaussiana
Entendamos ahora las principales características de la distribución Gaussiana.
La primera característica es que cualquier conjunto de datos que tenga una distribución Gaussiana estará caracterizado por dos parámetros: la media y la desviación estándar:
La media es el valor central de la distribución. Es decir la media es un ejemplo de lo que se conoce como una medida de tendencia central. En la práctica, esta media es simplemente el valor promedio de los datos.
Por ejemplo, en la figura de abajo tenemos una distribución Gaussiana con una media (𝜇) igual a cero:

Por otra parte, la desviación estándar determina el ancho de la campana Gaussiana. Así, en la figura de abajo tenemos la misma distribución Gaussiana pero en amarillo se indica de forma gráfica la desviación estándar (σ):

En particular, esta desviación estándar es una manera de cuantificar el grado de dispersión de los datos y es, por tanto, una medida de variabilidad.
En esencia, lo que mide la desviación estándar es en promedio qué tanto se alejan los datos de la media. Así, entre mayor sea el valor de la desviación estándar más ancha será la campana correspondiente a la distribución y viceversa.
Y otro conjunto de características importante se deriva de la simetría presente en la distribución Gaussiana. En particular, y como ocurre con cualquier distribución de probabilidad, si calculamos el área bajo la curva de esta distribución obtendremos un valor exactamente igual a 1 (o al 100%):

Teniendo en cuenta que el área bajo la curva indica la probabilidad de encontrar un dato dentro del rango de valores de la distribución, un área exactamente igual a 1 indica una probabilidad del 100% de encontrar un dato de dicha distribución dentro del rango de valores especificado por el eje horizontal de la gráfica.
Sin embargo, acá viene lo más interesante: un conjunto de principios muy sencillos que resultan de utilidad en diferentes aplicaciones en Ciencia de Datos.
Si por ejemplo tomamos como punto de referencia la media de la distribución (𝜇) y nos movemos hacia el lado izquierdo una desviación estándar (es decir al punto 𝜇-σ) y al punto equivalente al lado derecho (es decir 𝜇+σ) y calculamos el área bajo la curva, obtendremos siempre un valor del 68% independientemente de los valores particulares de 𝜇 y σ:

Y si repetimos lo anterior pero para el rango desde 𝜇-2σ hasta 𝜇+2σ siempre obtendremos un área bajo la curva de aproximadamente 95.4%:

Y finalmente, si repetimos lo anterior pero para el rango desde 𝜇-3σ hasta 𝜇+3σ el área bajo la curva siempre será aproximadamente igual a 99.7%:

Estos principios son usados por ejemplo cuando se desarrolla lo que se conocen como pruebas de hipótesis (que hacen parte de la Estadística Inferencial Paramétrica) o cuando se usan técnicas básicas de limpieza de datos como el método z-score para la detección de valores extremos.
Aplicaciones en Ciencia de Datos
Muy bien, teniendo claro qué es la distribución Gaussiana y cuáles son sus principales características, veamos algunos de sus principales usos en Ciencia de Datos.
La transformación de datos
En la transformación de los datos lo que buscamos es tomar una variable numérica (los datos) cuya distribución no es Gaussiana y a través de un procedimiento matemático cambiar la forma de dicha distribución para que se asemeje a una distribución Normal:

Esto tiene aplicaciones cuando desarrollamos ciertos tipos de modelos de Machine Learning o cuando realizamos pruebas de hipótesis, pues se trata de situaciones donde en ocasiones se parte del supuesto de que los datos tienen una distribución Normal.
Detección de valores extremos (u «outliers»)
En esta aplicación aprovechamos las características de simetría de la distribución Gaussiana descritas anteriormente.
En particular, sabemos que el área bajo una curva Gaussiana en el rango desde 𝜇-3σ hasta 𝜇+3σ es de aproximadamente 99.7%. Esto quiere decir que la gran mayoría de los datos en una distribución Gaussiana (el 99.7% para ser precisos) se encontrará dentro de dicho rango de valores (𝜇-3σ a 𝜇+3σ).
Así que si al analizar nuestros datos encontramos que algunos de ellos tienen valores por fuera de dicho rango podríamos estar bastante seguros de que se trata de datos atípicos o valores extremos, pues existirá sólo un 100-99.7 = 0.3% de probabilidad de que estos datos hagan parte de la distribución normal.
Este principio se ilustra a continuación:

Este es precisamente el principio del método z-score que en ocasiones podremos usar cuando estamos realizando limpieza de nuestros datos.
Desarrollo de modelos de Machine Learning y pruebas de hipótesis
Otra aplicación de la distribución Gaussiana es que es un requisito para el desarrollo de algunos Modelos de Machine Learning.
Por ejemplo, cuando se implementa un modelo de Regresión Lineal se parte del supuesto de que los residuos (es decir la diferencia entre cada dato y la recta de regresión) tiene precisamente una distribución Gaussiana, como ocurre en el ejemplo de regresión mostrado en la siguiente figura:

Si se cumple este supuesto los resultados arrojados por esta Regresión Lineal tendrán validez. Sin embargo, si por el contrario los residuos obtenidos no tienen una distribución Gaussiana los resultados de la Regresión Lineal dejarán de ser válidos y por tanto las conclusiones que extraigamos al usar este modelo, o las predicciones que generemos con el mismo, dejarán de ser útiles. Un ejemplo de esta situación se muestra a continuación:

De manera similar, los modelos de mezcla Gaussiana (usados en técnicas de «clustering» o agrupamiento y de reducción de dimensionalidad) también hacen uso de distribuciones normales para intentar modelar el comportamiento de nuestros datos.
Siguiendo una lógica similar, podemos encontrar que algunas pruebas de hipótesis (como la prueba z, la prueba t y la prueba ANOVA) parten del supuesto de que nuestros datos tienen precisamente una distribución Normal.
Conclusión
Muy bien, como acabamos de ver la distribución Gaussiana es una manera de representar matemáticamente muchas distribuciones de probabilidad y muchos fenómenos que ocurren en el mundo real. Pero más allá de eso es una de las distribuciones de probabilidad más usadas en Ciencia de Datos.
En esencia, la distribución Gaussiana se caracteriza por dos parámetros que son la media (el valor central de la distribución) y la desviación estándar que corresponde al ancho de la campana y que indica, en promedio, qué tanto se alejan los datos de la media.
Y esta sencilla distribución es muy usada en diferentes técnicas que podemos aplicar a nuestros proyectos de Ciencia de Datos y Machine Learning, como la detección de valores extremos, la transformación de los datos, el desarrollo de algunos tipos de modelos de Machine Learning o la aplicación de pruebas de hipótesis.
