Saltar al contenido principal

términos del glosario

Preentrenamiento

Categoría
LLMs & Generative AI
Dificultad
Intermedio

Definición

El preentrenamiento es la fase inicial e intensiva en cómputo del aprendizaje automático donde un modelo se entrena con un conjunto de datos vasto y sin etiquetar para aprender patrones generales, estructuras lingüísticas y conocimiento del mundo. Este proceso crea un 'modelo base' que luego puede adaptarse para tareas específicas.

Cómo funciona y contexto

El preentrenamiento sirve como base para la IA generativa moderna. Durante esta fase, un modelo (típicamente una arquitectura transformer) se expone a billones de tokens de diversas fuentes como libros, sitios web y repositorios de código. El objetivo suele ser el aprendizaje autosupervisado, donde el modelo predice el siguiente token en una secuencia, obligándolo efectivamente a internalizar la gramática, el razonamiento y las asociaciones factuales. Esta etapa es computacionalmente costosa y a menudo requiere miles de GPUs funcionando durante semanas. El modelo resultante, conocido como modelo base, posee capacidades amplias pero carece de instrucciones específicas para tareas. Aunque el preentrenamiento proporciona la 'inteligencia' del sistema, no hace que el modelo sea inherentemente útil o seguro; esas cualidades se inculcan típicamente durante etapas posteriores como el ajuste fino supervisado y el aprendizaje por refuerzo a partir de retroalimentación humana (RLHF).

Por qué es importante

El preentrenamiento es el principal impulsor de las 'capacidades emergentes' observadas en la IA moderna. Al aprender de conjuntos de datos masivos y diversos, los modelos desarrollan una comprensión generalizada del mundo que les permite realizar tareas para las que nunca fueron entrenados explícitamente. Esta fase es crítica porque determina el conocimiento base, la capacidad de razonamiento y los sesgos potenciales del modelo, convirtiéndola en la inversión más significativa en el ciclo de vida de desarrollo de la IA.

Ejemplo real

Imagina una empresa que construye una IA médica especializada. Primero realizan un preentrenamiento en un corpus masivo de texto general de internet para enseñar al modelo cómo entender el lenguaje, la sintaxis y la lógica. Una vez establecida esta base general, realizan un ajuste fino en un conjunto de datos más pequeño y curado de libros de texto médicos y notas clínicas. Sin el preentrenamiento inicial, el modelo tendría dificultades para entender la estructura básica de las oraciones o el contexto, independientemente de cuántos datos médicos recibiera después.

Errores frecuentes

  • Confundir el preentrenamiento con el ajuste fino; el preentrenamiento trata sobre conocimiento general, mientras que el ajuste fino trata sobre el comportamiento específico de la tarea.
  • Asumir que un modelo preentrenado está listo para su despliegue; los modelos preentrenados a menudo carecen de las barreras de seguridad y las capacidades de seguimiento de instrucciones requeridas para aplicaciones de usuario final.
  • Subestimar los requisitos de calidad de los datos; incluso en el preentrenamiento, se aplica el principio de 'basura entra, basura sale', ya que datos de mala calidad pueden llevar a modelos propensos a alucinaciones o sesgos.
  • Ignorar el costo ambiental y financiero; el preentrenamiento es la parte más intensiva en recursos del desarrollo de IA, costando a menudo millones de dólares en cómputo.

Preguntas frecuentes

¿En qué se diferencia el preentrenamiento del aprendizaje supervisado?

El aprendizaje supervisado requiere datos etiquetados donde se le dice al modelo la respuesta 'correcta' para cada entrada. El preentrenamiento típicamente utiliza aprendizaje autosupervisado, donde el modelo genera sus propias etiquetas a partir de la estructura de los datos, como predecir la siguiente palabra en una oración.

¿Se puede usar un modelo inmediatamente después del preentrenamiento?

Técnicamente sí, pero rara vez es práctico. Un modelo preentrenado en bruto es un 'modelo base' que actúa más como un motor de finalización de documentos. Necesita ajuste fino para convertirse en un asistente útil que pueda seguir instrucciones, mantener una personalidad o adherirse a pautas de seguridad.

¿El preentrenamiento requiere intervención humana?

El preentrenamiento está en gran medida automatizado, pero la intervención humana es crítica en la fase de curación de datos. Los ingenieros deben filtrar, limpiar y desduplicar los conjuntos de datos masivos para asegurar que el modelo aprenda de información de alta calidad y representativa en lugar de ruido o contenido dañino.