Saltar al contenido principal

términos del glosario

Transformer

Categoría
Neural Networks & Architectures
Dificultad
Intermedio

Definición

Una arquitectura de aprendizaje profundo basada en el mecanismo de autoatención (self-attention) que permite el procesamiento paralelo de datos secuenciales, capturando eficazmente dependencias de largo alcance sin necesidad de recurrencia.

Cómo funciona y contexto

Introducida en el artículo de 2017 'Attention Is All You Need', la arquitectura Transformer reemplazó a las redes neuronales recurrentes (RNN) tradicionales y a las redes de memoria a corto y largo plazo (LSTM). Su innovación principal es el mecanismo de 'autoatención', que permite al modelo sopesar la importancia de diferentes palabras en una secuencia en relación con otras, independientemente de su distancia. Al procesar datos en paralelo en lugar de secuencialmente, los Transformers pueden entrenarse en conjuntos de datos masivos mucho más rápido que sus predecesores. Aunque son altamente efectivos, los Transformers son computacionalmente costosos de entrenar y tienen un límite de 'ventana de contexto', lo que significa que solo pueden procesar una cantidad finita de información a la vez, lo que puede generar restricciones de memoria en documentos extremadamente largos.

Por qué es importante

La arquitectura Transformer es el avance fundamental que permitió la explosión actual en la IA generativa. Su capacidad para manejar grandes cantidades de datos en paralelo permite la creación de modelos con miles de millones de parámetros que exhiben capacidades de razonamiento, traducción y codificación similares a las humanas.

Ejemplo real

Cuando le pides a una IA que resuma un contrato legal de 50 páginas, utiliza la arquitectura Transformer para mantener la 'atención' en todo el documento. Identifica que una cláusula específica en la página 45 está directamente relacionada con una definición proporcionada en la página 2. Debido a que el modelo procesa estas relaciones simultáneamente en lugar de leer palabra por palabra, puede sintetizar el significado de todo el documento y proporcionar un resumen preciso en segundos.

Errores frecuentes

  • Asumir que los Transformers son solo para texto; se utilizan cada vez más para el procesamiento de imágenes, audio y video.
  • Confundir la arquitectura Transformer con modelos específicos como ChatGPT, que es una aplicación construida sobre dicha arquitectura.
  • Creer que los Transformers tienen una 'memoria verdadera'; solo tienen una ventana de contexto fija y no retienen información entre sesiones separadas a menos que estén diseñados específicamente para hacerlo.

Preguntas frecuentes

¿En qué se diferencia la autoatención de las RNN tradicionales?

Las RNN procesan los datos secuencialmente, lo que significa que deben terminar un paso antes de pasar al siguiente, lo que las hace lentas y propensas a 'olvidar' información temprana. La autoatención permite al modelo observar cada palabra en una secuencia al mismo tiempo, creando conexiones directas entre todas las partes de la entrada.

¿Cuáles son las principales limitaciones de la arquitectura Transformer?

La limitación principal es el costo computacional cuadrático en relación con la longitud de la secuencia, lo que hace que el procesamiento de entradas extremadamente largas consuma mucha memoria. Además, requieren cantidades masivas de datos y potencia de cómputo para alcanzar su máximo rendimiento.

¿Están todos los modelos de IA modernos basados en Transformers?

Aunque los Transformers son la arquitectura dominante para los LLMs y la IA generativa, se están investigando otras arquitecturas como los Modelos de Espacio de Estados (SSMs) como alternativas potenciales para abordar las limitaciones de eficiencia de los Transformers.