• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

5 – BERTopic

Lección 5 del curso Clustering de Texto y Modelado de Tópicos con LLMs.

En la lección anterior vimos qué es el modelado de tópicos, una aplicación del Procesamiento del Lenguaje Natural que permite obtener las palabras clave o frases que describen un determinado «cluster» o agrupación de textos.

En esta lección veremos en detalle los pasos involucrados en la obtención de tópicos a partir de agrupaciones de texto. En particular, veremos todos los elementos que conforman BERTopic, el algoritmo y librería de Python más usado en la actualidad para implementar este modelado de tópicos.

Comencemos viendo los elementos que componen BERTopic:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Como acabamos de ver, BERTopic contiene dos grandes bloques de procesamiento: el primero se encarga de obtener los clusters de texto (usando exactamente los mismos métodos que vimos en detalle en el módulo anterior), mientras que el segundo se encarga precisamente de realizar el modelado de tópicos.

Veamos entonces en detalle cómo funciona este segundo bloque de procesamiento:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Como acabamos de ver, este segundo bloque tiene tres elementos clave:

  • Vectorización: permite calcular la frecuencia de aparición (a nivel de cluster) de cada palabra del corpus. Es decir, permite calcular la matriz c-TF (class-based term frequency)
  • Ponderación de importancia: toma la matriz c-TF y pondera sus valores, dando así más relevancia a las palabras más representativas de cada cluster, generando como resultado la matriz c-TF-IDF (donde IDF se refiere a Inverse Document Frequency). A la salida de este bloque se tiene entonces un listado de top-n palabras clave que describen cada agrupación de texto
  • Refinación: este bloque es opcional y permite tomar las palabras clave obtenidas en el bloque anterior y representarlas de forma equivalente para facilitar su comprensión

Así que en este punto ya tenemos claras las características de BERTopic y la manera como funcionan sus diferentes bloques de procesamiento.

Entonces ya estamos listos para ver cómo implementar de forma práctica el modelado de tópicos con BERTopic, que será precisamente el tema de la próxima lección.

Todas las lecciones del curso Clustering de Texto y Modelado de Tópicos con LLMs

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }