Lección 2 del curso Búsqueda Semántica con LLMs.
En la lección anterior vimos qué es la Búsqueda Semántica, que es una de las aplicaciones más comunes del Procesamiento del Lenguaje Natural en la actualidad y cuyo elemento central son precisamente los Grandes Modelos de Lenguaje (o LLMs).
Así que en esta lección vamos a ver en detalle cómo funciona la recuperación densa (o dense retrieval) uno de los dos esquemas de Búsqueda Semántica más usados en la actualidad. En particular, veremos en detalle el papel que juegan los LLMs en este tipo de búsqueda:
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Como acabamos de ver, los sistemas de recuperación densa hacen uso de Grandes Modelos de Lenguaje de Representación que permiten codificar los textos de entrada y su significado, entregando a la salida los embeddings.
Estos embeddings son simplemente representaciones vectoriales de dichos textos pero que preservan su semántica. Así que los sistemas dense retrieval obtienen los embeddings tanto de la consulta introducida por el usuario como de los documentos de referencia para luego comparar dichas representaciones vectoriales y retornar a la salida sólo aquellos documentos que sean más relevantes (es decir, cuyo significado sea «cercano») para la consulta introducida por el usuario.
Así que teniendo claro el principio de funcionamiento de estos sistemas dense retrieval, en la próxima lección comenzaremos con el componente práctico del curso. Entonces veremos precisamente cómo implementar un sistema de recuperación densa usando Python y LLMs pre-entrenados.
Todas las lecciones del curso Búsqueda Semántica con LLMs
