Saltar al contenido

Transformers sin fórmulas: la intuición de la atención

Cómo funcionan los Transformers explicados con metáforas: la atención, los embeddings y por qué desplazaron a las RNN.

6 de agosto de 2026 Angel Francisco Palestina Blancas
Deep Learning Transformers NLP IA

Si lees papers de IA, la palabra Transformer aparece en todas partes. La mayoría de las explicaciones empiezan con matrices Q, K y V y pierden al lector en el segundo párrafo. Esta es la versión que yo habría querido: sin una sola fórmula.

La metáfora de la fiesta

Imagina que estás en una fiesta y alguien dice: “Angel trajo el pastel”.

Para entender esa frase, tu cerebro no procesa las palabras una por una en orden — conecta “trajo” con “pastel” y con “Angel” al mismo tiempo. Esa conexión simultánea entre todas las palabras es exactamente lo que hace el mecanismo de atención.

Una RNN clásica lee la frase palabra por palabra, como una fila de personas pasándose un mensaje susurrado: al final de la frase, los detalles del inicio se desdibujan. La atención es la fiesta entera escuchándose a sí misma: cada palabra puede “mirar” directamente a cualquier otra, sin importar la distancia.

Los embeddings: palabras como puntos en un mapa de significado

Antes de la atención, cada palabra se convierte en un embedding: una lista de números que representa su significado como un punto en un espacio enorme. Palabras con significados cercanos quedan cerca en ese espacio.

Lo interesante es que el embedding de “banco” (institución) y “banco” (para sentarse) empieza igual — es el contexto, mediante atención, el que los separa. Cuando la frase es “me senté en el banco del parque”, la atención empuja el significado hacia el mueble. El contexto crea el significado; el embedding solo es el punto de partida.

¿Qué aprende realmente un modelo como GPT?

Durante el entrenamiento, el modelo ve millones de frases con una palabra tapada y debe adivinarla. Para acertar, tiene que aprender gramática, hechos del mundo, estilo, incluso humor. Adivinar la siguiente palabra suena trivial, pero adivinarla BIEN requiere entender el mundo que produjo el texto.

Por qué importaba tanto el paralelismo

Las RNN procesan secuencialmente — palabra 1, luego 2, luego 3. Los Transformers procesan todas a la vez (por eso “Attention Is All You Need”, 2017, cambió el campo). Con GPUs, entrenar en paralelo significa modelos billones de veces más grandes en el mismo tiempo. Sin ese cambio, los modelos de lenguaje actuales serían inviables.

Cierre

La idea central de los Transformers cabe en una frase: el significado de cada palabra depende de todas las demás, y hay que dejar que el modelo aprenda en qué fijarse. Todo lo demás — las matrices, las cabezas múltiples, las capas — son implementaciones ingeniosas de esa idea.

Ver todos los artículos