Lección 4 del curso Clustering de Texto y Modelado de Tópicos con LLMs.
En la lección anterior vimos de forma práctica cómo realizar el clustering de texto usando Grandes Modelos de Lenguaje (o LLMs) pre-entrenados.
Sin embargo, a pesar de que el clustering de texto nos entrega agrupaciones de documentos semánticamente similares, aún nos interesa tener una idea clara de la temática principal de cada una de estas agrupaciones.
Y no resulta práctico leer uno a uno algunos o todos los documentos en cada cluster para, de forma manual, definir dichas temáticas o tópicos.
Así que en este segundo módulo del curso nos enfocaremos en el modelado de tópicos y específicamente en esta lección vamos a entender qué es el modelado de tópicos, que permite obtener de forma automática una representación en formato texto de la temática principal de cada una de las agrupaciones de textos obtenidas previamente:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, como acabamos de ver el modelado de tópicos es una aplicación del Procesamiento del Lenguaje Natural que permite obtener de forma automática una descripción de los documentos que conforman cada agrupación de textos.
Así que teniendo claro este concepto, en la próxima lección vamos a ver qué es y cómo funciona BERTopic, la herramienta más usada en la actualidad para implementar computacionalmente el modelado de tópicos.
Todas las lecciones del curso Clustering de Texto y Modelado de Tópicos con LLMs
