Lección 2 del curso Clustering en el Machine Learning.
En la lección anterior entendimos la idea básica del clustering (o agrupamiento de datos) y su relación con el aprendizaje no supervisado.
En esta lección vamos a entender qué son y para qué sirven las métricas de distancia y las métricas de bondad del clustering más usadas en los algoritmos de agrupamiento. Y en particular veremos en detalle qué son la distancia euclidiana y el puntaje silueta que se usan en los diferentes algoritmos de agrupamiento.
Comencemos entonces hablando de la distancia euclidiana:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En esencia esta distancia euclidiana es la métrica de distancia más usada en los algoritmos de clustering y permite cuantificar la distancia existente entre pares de datos, un paso fundamental al construir agrupaciones con los diferentes algoritmos que veremos más adelante.
Teniendo claro este concepto, veamos ahora en qué consiste el puntaje silueta (o silhouette score):
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, el puntaje silueta es la métrica más usada al momento de cuantificar la calidad de los clusters obtenidos tras el uso de un algoritmo de agrupamiento.
Es decir, este puntaje permite medir qué tan bien se ajusta cada dato a su correspondiente agrupación. Así, un puntaje silueta cercano a 1 indica la existencia de agrupaciones en los datos y una clara diferenciación entre una agrupación y otra, mientras que un puntaje silueta cercano a cero (o incluso negativo) indica la ausencia de patrones (o agrupaciones) en los datos.
Así que con esto ya hemos completado este primer módulo del curso donde hemos visto los conceptos fundamentales que estarán detrás de la gran mayoría de los algoritmos y modelos de clustering usados en el Machine Learning.
En el segundo módulo del curso veremos en detalle los algoritmos básicos de agrupamiento, comenzando con el algoritmo de clustering con K-Means que será el tema de la próxima lección.
Todas las lecciones del curso Clustering en el Machine Learning
