• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

¿Qué es una distribución de probabilidad?

En la Probabilidad existe un concepto que muchas veces, de hecho casi siempre, estará presente en un proyecto de Ciencia de Datos. Y este concepto se conoce como la distribución de probabilidad.

Y es clave entender este concepto pues es la base de muchas herramientas y técnicas de Ciencia de Datos que son usadas no sólo en fases iniciales de un proyecto, como el análisis exploratorio de datos, sino también en fases como el pre-procesamiento de los datos o el desarrollo y despliegue de modelos de Machine Learning.

Así que en este artículo vamos a entender en detalle qué es una distribución de probabilidad y su importancia en la Ciencia de Datos.

¿Qué es una variable aleatoria?

Para entender qué es una distribución de probabilidad debemos tener claro un concepto muy sencillo: las variables aleatorias.

Entendamos este concepto con un ejemplo sencillo: supongamos que vivimos en una región del mundo donde tenemos estaciones y supongamos que estamos en invierno y queremos conocer el comportamiento de la temperatura en un día determinado del mes de Enero.

Entonces usamos un sensor para registrar estos datos de temperatura cada hora y obtenemos el siguiente comportamiento a lo largo del día:

El comportamiento de la temperatura tomada cada hora en un día de invierno
El comportamiento de la temperatura tomada cada hora en un día de invierno

En el gráfico anterior podemos ver que por ejemplo entre las 0 y las 9 horas la temperatura es relativamente baja (entre 1 y 3 °C) mientras que entre las 10 y las 17 horas las temperaturas son un poco más altas (y oscilan entre los 3 y los 6 °C) y luego, después de las 18 horas las temperaturas se mantienen estables entre los 5 y los 6°C.

Y ahora supongamos que queremos intentar predecir el comportamiento de la temperatura a futuro. Sin embargo, como puede haber variaciones entre un día y otro, para tener mayor certeza de las temperaturas que se alcanzarán a diferentes horas, adquirimos por ejemplo un registro de 10 días consecutivos (con datos tomados cada hora):

El comportamiento de la temperatura cada hora para un periodo de 10 días consecutivos
El comportamiento de la temperatura cada hora para un periodo de 10 días consecutivos

En el gráfico anterior cada registro diario corresponde a una curva de un color diferente. Y si miramos en detalle este gráfico veremos que para una hora dada ¡cada día tendremos una temperatura diferente!

Por ejemplo, podemos ver que en la hora 6 las temperaturas oscilan entre -6 y 6 °C, mientras que por ejemplo para la hora 14 estos rangos van desde aproximadamente 2 hasta casi los 8°C.

Así que podemos ver que realmente la temperatura no alcanzará un valor totalmente predecible para una hora determinada y que en lugar de ello tendremos un rango probable de valores.

Así, si queremos determinar la temperatura que se tendrá a las 8 de la mañana en el día 11 no podremos establecer con total certeza este valor y en su lugar, con base en lo ilustrado en el gráfico anterior, tan solo podremos decir que probablemente dicha temperatura estará entre los -6 y los 6 °C.

Pero lo importante a tener en cuenta en este sencillo ejemplo es que la temperatura tiene un grado de incertidumbre y que por tanto no podremos tener una total certeza del valor que alcanzará para un día y hora dadas. Y es por ello que podemos decir que la temperatura es una variable aleatoria.

Así que, una variable aleatoria se puede definir como:

una variable numérica cuyos valores no se pueden predecir con exactitud y en su lugar debemos describir su comportamiento mediante probabilidades.

Así, volviendo al caso de la temperatura, podríamos decir que con base en los registros de 10 días consecutivos será más probable de que la temperatura a las 17 horas esté entre -2 y 6°C y será poco probable que alcance valores de por ejemplo 20 o 25°C.

Y observemos que usamos los términos «más probable» o «menos probable» pero nunca podremos tener una certeza absoluta. Y estas probabilidades se definen con valores entre 0 y 1 (o 0% y 100%) donde entre más cerca a 0 estemos tendremos un evento «menos probable» y entre más cerca a 1 (o 100%) estemos el evento será «más probable».

De hecho, en Ciencia de Datos siempre tendremos variables aleatorias y por tanto cada vez que hagamos estimaciones a partir de los datos tendremos un mayor o menor grado de incertidumbre y esto se debe precisamente a que los datos siempre serán variables aleatorias.

Así que teniendo claro qué es una variable aleatoria ya estamos listos para entender qué es una distribución de probabilidad.

La distribución de probabilidad

Volvamos al ejemplo hipotético de la medición de temperaturas para varios consecutivos.

Supongamos que ahora adquirimos un registro de temperatura cada hora pero para todos los días del mes de enero:

El comportamiento de la temperatura cada hora para los 31 días del mes de Enero
El comportamiento de la temperatura cada hora para los 31 días del mes de Enero

Y acá seguimos viendo el mismo comportamiento: para cada hora se tiene un rango de valores más probables para dicha temperatura.

Ahora supongamos que con base en estos datos que hemos recolectado nos planteamos la siguiente pregunta: ¿cuáles son las temperaturas más probables y cuáles las menos probables a lo largo del mes de Enero?

Es decir, en este punto hemos recolectado en total 744 datos de temperatura (24 por día para un total de 31 días) y queremos saber, de entre todos estos valores cuáles son los más probables y cuáles los menos probables.

Pues la respuesta a esta pregunta está precisamente en la distribución de probabilidad.

Así que intentemos responder a la pregunta paso a paso. Comencemos subdividiendo la variable temperatura en pequeños subniveles. Por ejemplo, a continuación podemos ver el mismo gráfico de temperaturas diarias para el mes de Enero pero en el recuadro gris vemos uno de estos subniveles, que va de -15 a -14 °C:

Las temperaturas para el mes de Enero y en gris (abajo) el rango de interés de -15 a -14 °C
Las temperaturas para el mes de Enero y en gris (abajo) el rango de interés de -15 a -14 °C

Supongamos que analizamos en detalle este subnivel y realizamos el conteo de cuántos datos se encuentran dentro de este rango y obtenemos un valor de 8. Almacenemos el rango de valores y el conteo correspondiente.

Y ahora repitamos el procedimiento para el siguiente rango, de -14 a -13°C:

Las temperaturas para el mes de Enero y en gris (abajo) el rango de interés de -14 a -13 °C
Las temperaturas para el mes de Enero y en gris (abajo) el rango de interés de -14 a -13 °C

Donde en este caso tenemos un total de 22 datos.

Y si repetimos el procedimiento una y otra vez para los diferentes rangos y representamos gráficamente este resultado lo que tendremos será un histograma.

En este histograma tendremos, en el eje horizontal los diferentes rangos y en el eje vertical el conteo correspondiente:

Histograma de temperaturas para el mes de Enero
Histograma de temperaturas para el mes de Enero

Este histograma nos indica cómo están distribuidas las temperaturas de acuerdo a la frecuencia (o conteo) que hicimos anteriormente.

Así, podemos ver que en el eje horizontal las temperaturas van del rango desde aproximadamente -15 °C hasta aproximadamente 15 °C, mientras que si analizamos el eje vertical podremos fácilmente determinar las temperaturas más comunes y las menos comunes:

  • Las temperaturas más comunes corresponderán a aquellos rangos cuyos conteos (o frecuencias) sean mayores, lo cual equivale simplemente a buscar las barras más altas en el histograma. En este caso podemos ver que alrededor de 0°C tendremos las temperaturas más frecuentes.
  • Por otra parte, las temperaturas menos comunes corresponderán a aquellos rangos con frecuencias menores, es decir a las barras de menor altura en el histograma. En este caso se trata de los rangos de temperatura alrededor de -15°C y de 15°C

A pesar de que con el histograma podemos ya tener una idea general de la manera como están distribuidas las temperaturas, aún no hemos respondido a la pregunta inicial: ¿cuáles son las temperaturas más probables y cuáles las menos probables?.

Sin embargo, con una ligera modificación a este histograma ya podremos dar respuesta a la pregunta.

Y la idea es simple: tan solo debemos cambiar la escala del eje vertical para que en lugar de indicar frecuencias o conteos tengamos valores de probabilidad. Y para lograrlo simplemente debemos dividir la escala entre el número total de datos.

Así, si tenemos por ejemplo un total de 744 datos, entonces un conteo de por ejemplo 70 equivale a una probabilidad de 70/744 o 0.094 (0 9.4%) mientras que un conteo de por ejemplo 80 equivale a una probabilidad de 80/744 o 0.107.

Y estas probabilidades nos indican precisamente, como su nombre lo indica, qué tan probable es que la temperatura alcance el rango de valores correspondiente.

Así que tras realizar este cambio de escala obtenemos un gráfico similar a este:

Distribución de probabilidades de la variable temperatura para el mes de Enero
Distribución de probabilidades de la variable temperatura para el mes de Enero

¡Y acá tenemos precisamente una distribución de probabilidad! Así que, de manera formal, podemos definir una distribución de probabilidad como:

una función matemática o una representación gráfica que describe cómo se distribuyen las probabilidades de ocurrencia de una variable aleatoria

Es decir que, en pocas palabras, la distribución de probabilidad de una variable aleatoria nos indica qué tan probable es que ocurra cada uno de sus valores.

Así que volviendo a la pregunta planteada anteriormente, sobre ¿cuáles son las temperaturas más probables y las menos probables? Podemos responder lo siguiente con base en los datos recolectados y en la distribución de probabilidad dibujada anteriormente:

  • Las temperaturas más probables serán aquellas con valores cercanos a 0°C, con una probabilidad de ocurrencia de aproximadamente 0.10 (o del 10%)
  • Las temperaturas menos probables serán aquellas con valores cercanos a -15°C y a 15°C, con probabilidades de ocurrencia muy cercanas a 0.0 (o 0%)

En el ejemplo que venimos analizando, hemos obtenido la distribución discreta de probabilidades que es precisamente el gráfico de barras obtenido anteriormente.

Sin embargo, podemos usar herramientas computacionales para estimar la versión continua de esta distribución de probabilidad, que tendría una forma similar a esta:

La distribución de probabilidad continua para la variable temperatura durante el mes de Enero
La distribución de probabilidad continua para la variable temperatura durante el mes de Enero

Conclusión

Muy bien, acabamos de entender qué es una distribución de probabilidad que es en esencia una manera de representar (gráfica o matemáticamente) las probabilidades de ocurrencia de una variable aleatoria.

Y este sencillo concepto es clave en Ciencia de Datos, pues en esta disciplina siempre tendremos variables aleatorias. Así que siempre que analicemos nuestros datos tendremos que referirnos a ellos en términos de probabilidades o de rangos de incertidumbre.

De hecho, cuando hablamos de fases como el Análisis Exploratorio de Datos, el escalamiento de datos, la construcción de un modelo de Machine Learning o incluso su despliegue en producción, precisamente allí encontraremos de manera explícita el concepto de distribución de probabilidad.

Y es por esto que resulta clave conocer toda la teoría de la Probabilidad, un campo de las matemáticas que resulta fundamental en Ciencia de Datos e Inteligencia Artificial. De hecho, acá en la Academia están disponibles los cursos Probabilidad Nivel Básico, Probabilidad Nivel Intermedio y Probabilidad Nivel Avanzado en donde revisamos en detalle tanto la teoría como la práctica relacionada con todos estos conceptos. Así que si te interesa profundizar en este campo te invito a darle una mirada a estos cursos.

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }