Lección 2 del curso Introducción a los Grandes Modelos de Lenguaje.
En la lección anterior vimos qué es un Modelo de Lenguaje y además vimos un panorama general de la evolución de este tipo de modelos que al final ha llevado al desarrollo de lo que hoy conocemos como Grandes Modelos de Lenguaje (o LLMs por sus siglas en Inglés: Large Language Models).
En esta lección comenzaremos a ver en detalle los elementos que conforman un LLM y que hacen que este tipo de modelos sean capaces de comprender y generar texto y que, por tanto, nos permiten desarrollar aplicaciones en el ámbito del Procesamiento del Lenguaje Natural.
Y específicamente en esta lección hablaremos de los tokens y los embeddings, que son los dos elementos que permiten tomar el texto de entrada (que es un tipo de dato no estructurado) al modelo y darle una estructura que le permita al LLM procesar posteriormente de forma adecuada dicho texto.
Además, a través de un sencillo ejemplo práctico en Python, veremos estos dos conceptos de tokens y embeddings de forma totalmente práctica haciendo uso de un Gran Modelo de Lenguaje disponible en Hugging Face.
Y al final de la lección hablaremos de un concepto que también está asociado a los tokens: la ventana de contexto.
¡Así que listo, comencemos!
Contenido exclusivo para suscriptores
Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.
Muy bien, En este punto ya tenemos claro los conceptos de tokens y embeddings y ya los hemos visto en acción ¡interactuando con nuestro primer LLM!
En últimas, la «tokenización» y la generación de los embeddings de entrada son las dos primeras etapas de procesamiento de texto implementadas en cualquier LLM. La idea es partir del texto, un tipo de dato no estructurado, y a través de la generación de tokens y de «embeddings» se obtienen representaciones vectoriales del texto de entrada.
Lo importante de los «embeddings» generados es que:
- Estandarizan el texto de entrada
- Al tratarse de vectores, en el rango de -1 a 1, tienen el formato adecuado para ser procesado posteriormente por el LLM
- Esta codificación vectorial no es arbitraria y, por el contrario, preserva parte del significado de los tokens que conforman el texto de entrada
Además, vimos que la ventana de contexto define esencialmente el número máximo de tokens que el LLM logrará procesar en un momento dado.
En este punto ya tenemos el texto representado vectorialmente (como «embeddings») y ya está listo para ser procesado por el LLM.
Y para que el Gran Modelo de Lenguaje logre «comprender» este texto vectorizado hace uso de lo que se conoce como el mecanismo de atención que le permite al modelo codificar adecuadamente cada token en la secuencia dependiendo de su significado dentro del texto. De hecho, este mecanismo de atención es lo que ha permitido que realmente los Grandes Modelos de Lenguaje logren interpretar y generar lenguaje natural.
Así que en la próxima lección hablaremos precisamente de la Atención en los Grandes Modelos de Lenguaje.
Todas las lecciones del curso Introducción a los Grandes Modelos de Lenguaje
