Lección 2 del curso Clustering de Texto y Modelado de Tópicos con LLMs.
En la lección anterior vimos qué es el clustering o agrupamiento de texto, una aplicación del Procesamiento del Lenguaje Natural donde lo que se busca es generar de forma automática agrupaciones de textos semánticamente similares.
En esta segunda lección del curso veremos en detalle todos los elementos que conforman un sistema de clustering de texto. Así que vamos a entender cómo los textos de entrada son procesados por un Gran Modelo de Lenguaje (LLM) para posteriormente generar las agrupaciones usando un algoritmo de clustering:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, un sistema de agrupamiento de textos contiene los siguientes bloques esenciales:
- Un LLM que permite obtener los «embeddings» de cada texto de entrada
- Un bloque de reducción de dimensionalidad que permite obtener una representación más compacta de cada «embedding».
- Un algoritmo de «clustering» que obtiene de forma automática las agrupaciones de textos.
Así que en este punto ya tenemos claros todos los elementos que conforman un sistema de clustering de texto. Entonces, en la próxima lección veremos cómo hacer uso de Python y librerías especializadas para implementar un sistema de clustering de texto con LLMs pre-entrenados.
Todas las lecciones del curso Clustering de Texto y Modelado de Tópicos con LLMs
