Lección 7 del curso Clustering de Texto y Modelado de Tópicos con LLMs.
En la lección anterior vimos cómo implementar de forma práctica el modelado de tópicos usando la librería BERTopic.
Sin embargo, allí vimos que los tópicos (o representaciones) obtenidos con los módulos básicos de BERTopic, en ocasiones no describen con precisión las temáticas asociadas a cada agrupación de documentos.
Así que en esta lección veremos cómo mejorar las representaciones de los tópicos obtenidos con BERTopic haciendo uso de «re-rankers», los cuales permiten obtener una descripción más precisa de los tópicos asociados a cada agrupación de documentos.
Comencemos entendiendo qué son estos «re-rankers» y cómo funcionan los «re-rankers» más usados:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
En esencia un re-ranker permite reorganizar el listado de palabras clave, obtenido con las representaciones originales de BERTopic, para retornar aquellas palabras clave que mejor representan cada cluster.
Y para ello podemos usar diferentes alternativas, entre las cuales las más usadas son KeyBERT (con un enfoque semántico) y MMR (o Maximal Marginal Relevance, que tiene un enfoque bag-of-words).
Así que teniendo claro qué son y cómo funcionan estos dos re-rankers, veamos cómo usarlos para mejorar las representaciones en BERTopic:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver el uso de «re-rankers» es muy sencillo, pues simplemente debemos definir una instancia del modelo a usar (KeyBERT o MMR, por ejemplo) y luego presentar esta instancia del modelo a BERTopic a través del argumento «representation_model».
Y tras incluir cualquiera de estos dos «re-rankers» pudimos verificar que las representaciones obtenidas son mucho más precisas y describen mucho mejor cada uno de los «clusters» de documentos.
Sin embargo, en este punto cada uno de los tópicos obtenidos obedece a la lógica «bag-of_words»: tenemos un listado de palabras que describen cada «cluster».
Pero existe una opción adicional que consiste en tomar estas representaciones y llevarlas a un LLM generativo para, en su lugar, obtener una corta frase que describa cada tópico. Así que en la próxima lección, la última de este curso, veremos cómo mejorar las representaciones de BERTopic usando modelos generativos.
Todas las lecciones del curso Clustering de Texto y Modelado de Tópicos con LLMs
