términos del glosario
Aprendizaje por transferencia
- Categoría
- Training, Adaptation & Inference
- Dificultad
- Intermedio
Definición
Una técnica de aprendizaje automático donde un modelo desarrollado para una tarea de origen se reutiliza como punto de partida para un modelo en una segunda tarea relacionada (tarea objetivo).
Cómo funciona y contexto
El aprendizaje por transferencia opera bajo el principio de que muchos modelos de IA, particularmente las redes neuronales profundas, aprenden características genéricas en sus capas iniciales (como bordes, texturas o patrones lingüísticos básicos) que son útiles en muchas aplicaciones diferentes. En lugar de entrenar un modelo desde cero, lo cual requiere conjuntos de datos masivos y una gran capacidad de cómputo, los profesionales toman un modelo preentrenado en un conjunto de datos grande y general (como ImageNet para visión o un corpus masivo para lenguaje) y lo 'ajustan' (fine-tuning) en un conjunto de datos más pequeño y específico para la tarea. Este proceso implica congelar algunas de las capas iniciales y volver a entrenar las capas finales para adaptar la salida del modelo a los nuevos requisitos. Aunque es altamente eficiente, el aprendizaje por transferencia está limitado por la 'brecha de dominio'; si las tareas de origen y destino son demasiado diferentes, el conocimiento transferido puede ser irrelevante o incluso perjudicial para el rendimiento.
Por qué es importante
El aprendizaje por transferencia es la columna vertebral de la accesibilidad moderna a la IA. Permite a desarrolladores e investigadores construir aplicaciones de alto rendimiento sin necesidad de presupuestos de cómputo multimillonarios requeridos para entrenar modelos base desde cero. Al aprovechar la inteligencia preexistente, democratiza el desarrollo de la IA, permite la creación rápida de prototipos y posibilita la creación de modelos especializados que pueden funcionar eficazmente incluso cuando los datos de entrenamiento para la tarea objetivo específica son escasos.
Ejemplo real
Una startup de imágenes médicas quiere construir un modelo para detectar enfermedades raras de la piel. En lugar de recopilar millones de imágenes para entrenar una red neuronal desde cero, toman un modelo preentrenado en objetos generales (como automóviles y animales). Debido a que el modelo ya comprende formas y patrones básicos, solo necesitan ajustarlo con unos pocos cientos de imágenes etiquetadas de afecciones de la piel para lograr una alta precisión diagnóstica.
Errores frecuentes
- Asumir que un modelo entrenado en un dominio funcionará automáticamente bien en un dominio completamente no relacionado sin un ajuste fino suficiente.
- No normalizar el conjunto de datos objetivo para que coincida con la distribución del conjunto de datos de origen utilizado para el preentrenamiento.
- Sobreajustar el modelo a un conjunto de datos objetivo pequeño durante la fase de ajuste fino, lo que anula los beneficios de las características preentrenadas.
- Congelar demasiadas o muy pocas capas, lo que puede llevar a una subadaptación o al olvido catastrófico del conocimiento original.
Preguntas frecuentes
¿En qué se diferencia el aprendizaje por transferencia del ajuste fino (fine-tuning)?
El aprendizaje por transferencia es la estrategia general de reutilizar un modelo, mientras que el ajuste fino es el proceso específico de ajustar los pesos de ese modelo preentrenado en un nuevo conjunto de datos.
¿Qué es el 'olvido catastrófico' en el contexto del aprendizaje por transferencia?
Ocurre cuando un modelo, mientras se ajusta para una nueva tarea, pierde la capacidad de realizar la tarea original para la que fue entrenado porque las actualizaciones de peso son demasiado agresivas.
¿Se puede usar el aprendizaje por transferencia con cualquier tipo de modelo de aprendizaje automático?
Aunque es más común en el aprendizaje profundo (redes neuronales), es menos aplicable a algoritmos tradicionales como la regresión lineal o los árboles de decisión, que normalmente no aprenden representaciones de características jerárquicas.