Saltar al contenido principal

términos del glosario

Aprendizaje supervisado

Categoría
AI & Machine Learning Fundamentals
Dificultad
Principiante

Definición

Un paradigma de aprendizaje automático donde un algoritmo aprende una función de mapeo desde variables de entrada a variables de salida basándose en un conjunto proporcionado de ejemplos de entrenamiento etiquetados.

Cómo funciona y contexto

El aprendizaje supervisado funciona presentando a un modelo un conjunto de datos que contiene tanto características de entrada como sus etiquetas objetivo correspondientes. Durante la fase de entrenamiento, el algoritmo ajusta iterativamente sus parámetros internos para minimizar la diferencia entre sus predicciones y las etiquetas reales de referencia. Este proceso se basa en una función de pérdida para cuantificar el error y un algoritmo de optimización para guiar el aprendizaje. Una vez entrenado, el modelo puede generalizar estos patrones aprendidos para predecir resultados para entradas nuevas y no etiquetadas. Las tareas comunes incluyen la clasificación, donde la salida es una categoría discreta, y la regresión, donde la salida es un valor numérico continuo. Aunque es altamente efectivo para tareas estructuradas, el aprendizaje supervisado está limitado por la disponibilidad y calidad de los datos etiquetados, ya que el rendimiento del modelo está estrictamente limitado por la precisión y representatividad del conjunto de entrenamiento proporcionado.

Por qué es importante

El aprendizaje supervisado es la columna vertebral de la mayoría de las aplicaciones prácticas de IA actuales, desde filtros de spam en correos electrónicos hasta herramientas de diagnóstico médico. Proporciona un marco confiable para automatizar procesos de toma de decisiones donde hay datos históricos disponibles. Al permitir que las máquinas aprendan de ejemplos verificados por humanos, permite el desarrollo de sistemas escalables y de alta precisión que pueden realizar tareas complejas de manera consistente, siempre que los datos de entrenamiento estén bien seleccionados y sean representativos de escenarios del mundo real.

Ejemplo real

Un banco utiliza el aprendizaje supervisado para detectar transacciones fraudulentas con tarjetas de crédito. El modelo se entrena con un conjunto de datos masivo de transacciones pasadas, cada una etiquetada como 'legítima' o 'fraudulenta'. Al analizar características como el monto de la transacción, la ubicación y la hora, el modelo aprende a identificar patrones asociados con el fraude. Cuando ocurre una nueva transacción, el modelo la evalúa en tiempo real y la marca para su revisión si coincide con las características aprendidas de la actividad fraudulenta.

Errores frecuentes

  • Asumir que más datos siempre es mejor, incluso si las etiquetas son ruidosas o incorrectas.
  • Sobreajustar (overfitting) el modelo a los datos de entrenamiento, lo que conduce a un bajo rendimiento en datos nuevos y no vistos.
  • Ignorar la fuga de datos (data leakage), donde la información de la etiqueta objetivo influye inadvertidamente en las características de entrada durante el entrenamiento.
  • No tener en cuenta el desequilibrio de clases, donde una categoría supera significativamente a las demás en el conjunto de entrenamiento.

Preguntas frecuentes

¿En qué se diferencia el aprendizaje supervisado del aprendizaje no supervisado?

El aprendizaje supervisado requiere datos etiquetados para guiar el proceso de entrenamiento hacia un objetivo específico, mientras que el aprendizaje no supervisado trabaja con datos no etiquetados para descubrir estructuras o patrones ocultos sin resultados predefinidos.

¿Cuál es la limitación principal del aprendizaje supervisado?

La limitación principal es el 'cuello de botella del etiquetado'. Adquirir datos de alta calidad anotados por humanos suele ser costoso, requiere mucho tiempo y es difícil de escalar, lo que puede restringir la capacidad del modelo para aprender en dominios donde dichos datos son escasos.

¿Se puede utilizar el aprendizaje supervisado para tareas generativas?

Aunque se utiliza principalmente para tareas predictivas, el aprendizaje supervisado es un componente de muchos sistemas generativos, como el ajuste fino (fine-tuning) de modelos de lenguaje grandes en pares específicos de instrucción-respuesta para mejorar su capacidad de seguir las indicaciones del usuario.