Saltar al contenido principal

términos del glosario

Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF)

Categoría
Training, Adaptation & Inference
Dificultad
Intermedio

Definición

Un método de entrenamiento de aprendizaje automático donde un modelo se ajusta mediante una señal de recompensa derivada de las preferencias humanas para alinear mejor sus resultados con los valores e instrucciones humanas.

Cómo funciona y contexto

El Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF) sigue típicamente un proceso de varias etapas. Primero, se entrena un modelo base con un conjunto de datos masivo. A continuación, los anotadores humanos clasifican múltiples respuestas generadas por el modelo ante el mismo prompt, creando un conjunto de datos de preferencias. Estos datos se utilizan para entrenar un 'modelo de recompensa' separado que aprende a predecir las preferencias humanas. Finalmente, el modelo de lenguaje original se ajusta mediante aprendizaje por refuerzo (a menudo a través de Optimización de Política Proximal) para maximizar la puntuación asignada por este modelo de recompensa. Este proceso es esencial para transformar modelos de lenguaje crudos e impredecibles en asistentes conversacionales útiles. Sin embargo, RLHF introduce compensaciones: puede llevar al 'hackeo de recompensa', donde el modelo optimiza respuestas que agradan a los humanos en lugar de la precisión factual, y puede introducir inadvertidamente sesgos presentes en el grupo de anotadores humanos.

Por qué es importante

RLHF es el mecanismo principal para la alineación de la IA, cerrando la brecha entre las capacidades estadísticas crudas de un modelo y los requisitos matizados de la interacción humana. Sin él, los modelos a menudo producen contenido tóxico, irrelevante o inútil. Al incorporar el juicio humano, los desarrolladores pueden dirigir los modelos hacia un comportamiento más seguro, confiable y contextualmente apropiado, lo cual es un requisito previo para implementar IA en aplicaciones profesionales, educativas y orientadas al consumidor.

Ejemplo real

Considera un chatbot al que se le pide explicar un evento histórico controvertido. Sin RLHF, el modelo podría generar una respuesta sesgada o incendiaria basada en datos crudos de internet. Con RLHF, los anotadores humanos clasifican más alto las respuestas que son neutrales, basadas en hechos y equilibradas que aquellas que son opinativas. El modelo aprende a priorizar estas respuestas objetivas y de alta calidad, asegurando que el resultado final sea útil y seguro para una audiencia general.

Errores frecuentes

  • Asumir que RLHF reemplaza la necesidad de datos de preentrenamiento de alta calidad.
  • Creer que RLHF garantiza la precisión factual; optimiza principalmente para la preferencia humana, lo que a veces puede favorecer respuestas que suenan seguras pero son incorrectas.
  • Pasar por alto el potencial de que el sesgo del anotador se incorpore en la personalidad del modelo.
  • Tratar RLHF como un proceso de 'configurar y olvidar' en lugar de un ciclo iterativo de evaluación y refinamiento.

Preguntas frecuentes

¿En qué se diferencia RLHF del Ajuste Fino Supervisado (SFT)?

SFT implica entrenar al modelo en ejemplos específicos de pares de entrada-salida deseados. RLHF, por el contrario, utiliza un modelo de recompensa para guiar a la IA hacia comportamientos preferidos, permitiéndole aprender de clasificaciones relativas en lugar de solo ejemplos estáticos.

¿Se puede usar RLHF para corregir alucinaciones?

Aunque RLHF puede desalentar al modelo de inventar hechos penalizando respuestas incorrectas, no es una solución perfecta. Es más efectivo cuando se combina con generación aumentada por recuperación (RAG) u otras técnicas de fundamentación.

¿Cuál es el papel del modelo de recompensa?

El modelo de recompensa actúa como un proxy para el juicio humano. Se entrena con datos de preferencias humanas para asignar una puntuación numérica a cualquier resultado dado del modelo, que el modelo principal intenta maximizar durante la fase de aprendizaje por refuerzo.