• Saltar a la navegación principal
  • Saltar al contenido principal
Logo Codificando Bits

Codificando Bits

  • Academia
    • Rutas
    • Cursos
    • Proyectos
    • Tutoriales
  • Acceder
  • Suscribirse

3 – La Atención en los Modelos de Lenguaje

Lección 3 del curso Introducción a los Grandes Modelos de Lenguaje.

En la lección anterior vimos qué papel juegan los tokens y los embeddings en un Gran Modelo de Lenguaje (o LLM por sus siglas en Inglés: Large Language Model) al momento de darle estructura al texto que será procesado por el modelo.

En esta lección veremos en qué consiste el mecanismo atencional de los Grandes Modelos de Lenguaje, que es lo que en últimas explica la capacidad de estos modelos de comprender y generar texto en lenguaje natural:

Contenido exclusivo para suscriptores

Si eres suscriptor accede en este enlace ó suscríbete a la Academia Online y accede a todo el contenido (lecciones en video, código fuente, sets de datos y descargas) de todos los cursos, proyectos y tutoriales.

Como acabamos de ver, el mecanismo atencional de una Red Transformer (y, por tanto, de un LLM) permite tomar los embeddings generados a la entrada del modelo (los cuales poseen significado pero carecen de contexto) y añadirles contexto.

En esencia este «contexto» quiere decir que palabras (o realmente «tokens») que a la entrada del modelo se representan con el mismo embedding, una vez han sido procesados por este mecanismo atencional tendrán un embedding diferente que dependerá de su relación con los diferentes elementos del texto.

Y para lograr esto, los bloques atencionales del LLM determinan qué elementos del texto requieren más atención al momento de codificar cada embedding, para así incorporar esta información en los embeddings generados.

Y este mecanismo es el que ha hecho tan exitosos a estos Grandes Modelos de Lenguaje, pues es lo que le ha permitido al modelo lograr comprender el texto escrito y a partir de esto desarrollar diferentes aplicaciones (entre las cuales se incluye, por ejemplo, precisamente la generación de texto en lenguaje natural).

Así que teniendo claro cómo funciona este mecanismo atencional, en la próxima lección veremos cómo se combinan todos estos elementos que hemos visto en estas dos últimas lecciones (los tokens, los embeddings y los bloques atencionales) en lo que es la arquitectura sobre la cual se construyen los Grandes Modelos de Lenguaje en la actualidad. Así que veremos qué son y cómo funcionan las Redes Transformer.

Todas las lecciones del curso Introducción a los Grandes Modelos de Lenguaje

© Codificando Bits, LLC | Blog | Contacto | Servicios | Acerca de | Políticas

¿Has olvidado la contraseña?
¿Has perdido tu contraseña? Por favor, introduce tu nombre de usuario o dirección de correo electrónico. Recibirás por correo electrónico un enlace para crear una nueva contraseña.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }