Saltar al contenido principal

términos del glosario

Muestreo

Categoría
LLMs & Generative AI
Dificultad
Intermedio

Definición

El muestreo es el proceso probabilístico utilizado por los Modelos de Lenguaje Extensos para seleccionar el siguiente token en una secuencia a partir de una distribución de probabilidad sobre todo el vocabulario.

Cómo funciona y contexto

En el contexto de los Modelos de Lenguaje Extensos (LLM), el muestreo ocurre después de que el modelo calcula una puntuación de probabilidad para cada posible siguiente token. En lugar de elegir siempre el token más probable (un método conocido como decodificación codiciosa), el muestreo introduce una aleatoriedad controlada. Esto permite al modelo generar texto variado y similar al humano. Las técnicas de muestreo comunes incluyen la Temperatura, que aplana o agudiza la distribución de probabilidad, y el muestreo Top-P (núcleo), que restringe la selección a un subconjunto de tokens cuya probabilidad acumulada supera un cierto umbral. Estos mecanismos son esenciales para equilibrar la coherencia con la creatividad. Sin muestreo, los modelos a menudo caerían en bucles repetitivos o producirían respuestas demasiado simplistas y deterministas. Sin embargo, configuraciones de muestreo inadecuadas pueden llevar a 'alucinaciones' o resultados sin sentido si el modelo se ve obligado a seleccionar entre tokens irrelevantes de baja probabilidad.

Por qué es importante

El muestreo es la palanca principal para controlar la 'personalidad' de una IA. En aplicaciones profesionales, el muestreo de baja aleatoriedad es crítico para tareas que requieren precisión factual, como la generación de código o la extracción de datos. Por el contrario, el muestreo de alta aleatoriedad es vital para la escritura creativa, la lluvia de ideas y el juego de roles. Comprender estos parámetros permite a los desarrolladores y usuarios optimizar el comportamiento del modelo para casos de uso específicos, asegurando que el resultado se alinee con el nivel deseado de precisión o innovación.

Ejemplo real

Imagina a un desarrollador construyendo un chatbot de atención al cliente. Configura la temperatura a un valor bajo (por ejemplo, 0.2) para asegurar que el modelo proporcione respuestas precisas y conformes a las políticas de manera consistente. Más tarde, el mismo desarrollador crea un asistente de escritura creativa para un equipo de marketing. Aumenta la temperatura a 0.8, permitiendo que el modelo explore un vocabulario más diverso y estructuras de oraciones únicas, lo que resulta en un texto publicitario más atractivo y menos predecible.

Errores frecuentes

  • Asumir que una temperatura más alta siempre conduce a una salida más 'inteligente'; en realidad aumenta la aleatoriedad, lo que puede degradar la coherencia.
  • Confundir el muestreo con el entrenamiento; el muestreo solo afecta la fase de inferencia (generación), no el conocimiento subyacente del modelo.
  • Descuidar la interacción entre Top-P y Temperatura, lo que puede llevar a un comportamiento de salida inesperado cuando ambos se ajustan agresivamente.

Preguntas frecuentes

¿En qué se diferencia la Temperatura del muestreo Top-P?

La temperatura escala toda la distribución de probabilidad, haciendo que los tokens de alta probabilidad sean más probables o aplanando la distribución para dar una oportunidad a los tokens de baja probabilidad. El muestreo Top-P, por el contrario, ignora la distribución de probabilidad por completo una vez que se alcanza un umbral acumulativo, centrándose solo en el 'núcleo' de los candidatos más probables.

¿Se puede usar el muestreo para eliminar alucinaciones?

Aunque bajar la temperatura puede reducir la probabilidad de que un modelo elija tokens 'creativos' pero incorrectos, no puede eliminar las alucinaciones por completo. Las alucinaciones a menudo tienen sus raíces en los datos de entrenamiento y la lógica interna del modelo, no solo en el método de muestreo.

¿Por qué mi modelo repite la misma frase incluso con muestreo?

La repetición a menudo es causada por una combinación de baja temperatura y el sesgo interno del modelo. Es posible que necesites ajustar los parámetros de 'penalización de frecuencia' o 'penalización de presencia' junto con tus configuraciones de muestreo para desalentar al modelo de reutilizar tokens.