Saltar al contenido principal

términos del glosario

Predicción del siguiente token

Categoría
LLMs & Generative AI
Dificultad
Intermedio

Definición

Un objetivo de entrenamiento de aprendizaje automático donde un modelo tiene la tarea de predecir la unidad de texto posterior más probable, conocida como token, dada una secuencia precedente de tokens.

Cómo funciona y contexto

La predicción del siguiente token es el mecanismo principal que impulsa a los Modelos de Lenguaje Grandes (LLM) autorregresivos modernos. Durante el entrenamiento, el modelo recibe conjuntos de datos masivos y se le asigna la tarea de predecir el siguiente token en una secuencia. Al minimizar la diferencia entre su predicción y el siguiente token real, el modelo aprende patrones complejos, gramática y asociaciones fácticas. Al generar texto, el modelo toma un prompt de entrada, lo convierte en tokens y calcula una distribución de probabilidad sobre todo su vocabulario para el siguiente token. Luego selecciona uno (a menudo utilizando técnicas de muestreo como temperatura o top-p) y lo añade a la secuencia. Este proceso se repite iterativamente. Una limitación crítica es que el modelo carece de un 'modelo del mundo' o una comprensión verdadera; es esencialmente un motor estadístico sofisticado que optimiza la continuación más probable de un patrón.

Por qué es importante

Este concepto es el motor de la IA generativa. Entenderlo explica por qué los modelos pueden ser creativos pero propensos a alucinaciones; están optimizando la probabilidad estadística en lugar de la verdad fáctica. También destaca la importancia de las ventanas de contexto, ya que la capacidad del modelo para predecir el siguiente token con precisión depende totalmente de la información disponible dentro de su secuencia inmediata de tokens precedentes.

Ejemplo real

Cuando escribes 'La capital de Francia es' en un chatbot, el modelo analiza esta secuencia. Basándose en su entrenamiento, asigna una probabilidad muy alta al token 'París'. Selecciona 'París', lo añade a la secuencia y luego repite el proceso para predecir el siguiente token, como un punto o una nueva línea, 'escribiendo' efectivamente la oración pieza por pieza.

Errores frecuentes

  • Asumir que el modelo 'piensa' o 'razona' como un humano; está realizando una finalización de secuencia probabilística.
  • Creer que el modelo tiene acceso a una base de datos estática de hechos; se basa en patrones codificados en sus pesos.
  • Confundir la predicción de tokens con la recuperación basada en la intención; el modelo no 'sabe' lo que quieres, solo lo que sigue estadísticamente a tu prompt.
  • Pasar por alto el impacto de los parámetros de muestreo (como la temperatura) en la salida, lo que puede hacer que el mismo prompt arroje resultados diferentes.

Preguntas frecuentes

¿Cómo decide un modelo qué token elegir si hay varios probables?

Los modelos utilizan estrategias de muestreo. En lugar de elegir siempre el token más probable (búsqueda codiciosa), a menudo utilizan técnicas como la 'temperatura' para introducir aleatoriedad, lo que permite al modelo elegir entre un conjunto de tokens de alta probabilidad para crear un texto más natural y variado.

¿Por qué los modelos a veces se repiten?

La repetición a menudo ocurre porque el modelo ha entrado en un bucle estadístico donde el siguiente token más probable es uno que ya ha generado, reforzando el patrón. A menudo se utilizan estrategias de decodificación avanzadas y penalizaciones para desalentar este comportamiento.

¿Es la predicción del siguiente token lo mismo que el autocompletado?

A un nivel alto, sí, pero los LLM modernos son mucho más sofisticados. Mientras que el autocompletado básico podría sugerir una sola palabra basada en la frecuencia, los LLM utilizan redes neuronales profundas para comprender el contexto semántico complejo, lo que les permite generar párrafos, código y argumentos lógicos coherentes.