Saltar al contenido principal

términos del glosario

Hiperparámetro

Categoría
AI & Machine Learning Fundamentals
Dificultad
Intermedio

Definición

Un hiperparámetro es un ajuste de configuración externo a un modelo de aprendizaje automático que se establece antes de que comience el proceso de entrenamiento y permanece constante durante toda la fase de aprendizaje.

Cómo funciona y contexto

En el aprendizaje automático, un modelo aprende parámetros internos (como pesos y sesgos) directamente de los datos de entrenamiento. Por el contrario, los hiperparámetros son los ajustes estructurales de alto nivel que dictan cómo ocurre ese aprendizaje. Algunos ejemplos incluyen la tasa de aprendizaje, que determina el tamaño del paso durante la optimización, el número de capas en una red neuronal o el tamaño del lote (batch size). Debido a que los hiperparámetros no son aprendidos por el modelo en sí, deben ser elegidos por el profesional mediante experimentación, a menudo utilizando técnicas como la búsqueda en cuadrícula (grid search), la búsqueda aleatoria o la optimización bayesiana. Elegir los hiperparámetros correctos es un compromiso crítico; valores demasiado altos o demasiado bajos pueden llevar al subajuste o sobreajuste, donde el modelo no logra capturar los patrones subyacentes o se vuelve demasiado especializado en los datos de entrenamiento, perdiendo su capacidad de generalizar a información nueva y desconocida.

Por qué es importante

Los hiperparámetros son esenciales porque influyen directamente en la velocidad de convergencia, la estabilidad y la precisión predictiva final del modelo. Sin un ajuste adecuado, incluso la arquitectura más sofisticada puede tener un rendimiento deficiente. En el desarrollo moderno de IA, automatizar la selección de estos ajustes, a menudo llamado Optimización de Hiperparámetros (HPO), es una práctica estándar para garantizar que los modelos alcancen su máximo potencial mientras se minimiza el tiempo y los recursos computacionales necesarios para el entrenamiento.

Ejemplo real

Imagina a un científico de datos entrenando un modelo de aprendizaje profundo para reconocer imágenes médicas. Debe establecer el hiperparámetro de "tasa de aprendizaje". Si lo establece demasiado alto, el modelo podría sobrepasar la solución óptima y no aprender. Si lo establece demasiado bajo, el proceso de entrenamiento podría tardar semanas en converger. Al ejecutar múltiples pruebas de entrenamiento con diferentes tasas de aprendizaje, identifican el "punto óptimo" que permite al modelo aprender de manera precisa y eficiente.

Errores frecuentes

  • Confundir los hiperparámetros con los parámetros del modelo (pesos/sesgos) que el modelo aprende automáticamente.
  • Asumir que existe un conjunto "universal" de hiperparámetros óptimos que funcionan para cada conjunto de datos.
  • Sobreajustar los hiperparámetros en el conjunto de prueba, lo que conduce a una fuga de datos y un rendimiento deficiente en el mundo real.
  • Ignorar el costo computacional de las búsquedas exhaustivas de hiperparámetros.

Preguntas frecuentes

¿Cómo sé qué hiperparámetros ajustar primero?

Comienza con los más impactantes, como la tasa de aprendizaje, ya que suele tener el efecto más significativo en la convergencia del modelo. Después de eso, concéntrate en los ajustes específicos de la arquitectura, como el número de capas o unidades, seguidos de los parámetros de regularización.

¿Cuál es la diferencia entre la búsqueda en cuadrícula (grid search) y la búsqueda aleatoria?

La búsqueda en cuadrícula prueba exhaustivamente cada combinación de un conjunto predefinido de valores, lo cual es minucioso pero computacionalmente costoso. La búsqueda aleatoria toma muestras de valores de una distribución, lo que a menudo es más eficiente para encontrar buenos hiperparámetros en espacios de alta dimensión.

¿Se pueden cambiar los hiperparámetros durante el entrenamiento?

Aunque el hiperparámetro base se establece antes del entrenamiento, algunas estrategias como la "programación de la tasa de aprendizaje" permiten que el modelo ajuste la tasa de aprendizaje efectiva dinámicamente según el progreso del entrenamiento, aunque la lógica subyacente sigue definida por la configuración inicial del hiperparámetro.