Lección 8 del curso Clustering de Texto y Modelado de Tópicos con LLMs.
En la lección anterior vimos cómo mejorar las representaciones de tópicos usando «re-rankers». Y con esto logramos obtener un conjunto de palabras clave que describe de manera mucho más precisa cada tópico.
Sin embargo, estas representaciones obtenidas aún siguen la lógica de «bag-of-words», es decir siguen siendo un conjunto de palabras sueltas.
Así que en esta última lección del curso veremos cómo usar Grandes Modelos de Lenguaje (LLMs) generativos para lograr describir cada tópico con una corta frase en lenguaje natural:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, mejorar las representaciones de los tópicos en BERTopic usando LLMs generativos es un proceso bastante sencillo:
- En primer lugar tomamos tanto las palabras clave obtenidas con KeyBERT junto con los documentos representativos de cada tópico (obtenidos previamente tras entrenar BERTopic)
- En segundo lugar definimos el «prompt» para el LLM generativo, indicándole que queremos obtener una corta frase que describa cada tópico a partir de las palabras clave y de los documentos representativos
- Y luego post-procesamos los textos obtenidos con el modelo generativo para obtener las descripciones esperadas
En términos generales podemos decir que este enfoque permite obtener representaciones en formato texto que permiten entender claramente la temática de cada tópico para la gran mayoría de las agrupaciones.
Sin embargo, es importante tener en cuenta que este es un enfoque que implica recursos de cómputo adicionales (pues debemos usar un modelo generativo) y que en ocasiones las descripciones obtenidas no son del todo adecuadas. Así que podemos considerar esta alternativa del uso de LLMs generativos con una opción adicional, a la cual podemos recurrir en caso de que las representaciones obtenidas con los enfoques que vimos en las lecciones anteriores no cumplan con nuestras expectativas.
Así que con esto hemos culminado este curso de Clustering de Texto y Modelado de Tópicos con LLMs… !te felicito por haber llegado hasta este punto!
Espero que te haya gustado este curso y ya sabes que si quieres compartirme tus comentarios o tus sugerencias para seguir mejorando el contenido de la Academia, te invito a contactarme a través de la Intranet.
Y desde luego te invito a continuar tu formación tomando el siguiente curso en esta especialización: Búsqueda Semántica con LLMs.
¡Te envío un saludo y nos vemos en el próximo curso!
Todas las lecciones del curso Clustering de Texto y Modelado de Tópicos con LLMs
