Saltar al contenido principal

términos del glosario

Reranking

Categoría
RAG, Embeddings & Search
Dificultad
Intermedio

Definición

El reranking es un proceso de recuperación de información en dos etapas donde un conjunto inicial de documentos candidatos se refina mediante un modelo computacionalmente más intensivo para mejorar la precisión de los resultados finales.

Cómo funciona y contexto

En los sistemas modernos de búsqueda y Generación Aumentada por Recuperación (RAG), el proceso de recuperación a menudo se divide en dos fases para equilibrar la velocidad y la precisión. La primera fase, a menudo llamada 'recuperación' o 'bi-codificación', utiliza incrustaciones vectoriales para obtener rápidamente una gran cantidad de documentos potencialmente relevantes de una base de datos masiva. Sin embargo, la similitud vectorial a veces puede pasar por alto relaciones semánticas matizadas. El reranking actúa como la segunda fase, donde un modelo de 'codificador cruzado' examina los resultados top-k de la primera fase con mayor detalle. Al procesar la consulta y el documento juntos, el reranker puede capturar interacciones complejas entre ellos que las matemáticas vectoriales simples ignoran. Aunque es altamente efectivo para aumentar la precisión, el reranking es computacionalmente costoso, por lo que generalmente se aplica solo a una lista pequeña y prefiltrada de candidatos en lugar de a toda la base de datos.

Por qué es importante

El reranking es esencial para los sistemas RAG de alta calidad porque reduce significativamente el 'ruido' en el contexto recuperado. Al garantizar que la información más precisa y relevante se pase al Modelo de Lenguaje Grande (LLM), el reranking mejora directamente la precisión fáctica y la calidad de la respuesta generada, minimizando las alucinaciones y asegurando que el sistema se centre en los puntos de datos más pertinentes.

Ejemplo real

Imagina una plataforma de investigación legal que almacena millones de archivos de casos. Un usuario busca 'responsabilidad en accidentes de vehículos autónomos'. La búsqueda vectorial inicial recupera 100 documentos basados en palabras clave generales y similitud semántica. Luego, un reranker analiza estos 100 documentos específicamente por su relevancia para la consulta del usuario, promoviendo los casos legalmente más precisos y contextualmente exactos a los 5 primeros, que luego se resumen para el usuario.

Errores frecuentes

  • Intentar reordenar toda la base de datos en lugar de solo los candidatos top-k, lo que conduce a una latencia prohibitiva.
  • Asumir que un reranker puede arreglar una recuperación inicial deficiente; si el documento relevante no está en el top-k inicial, el reranker no puede encontrarlo.
  • Confundir el reranking con el simple aumento de palabras clave; el reranking utiliza una comprensión semántica profunda en lugar de solo conteos de frecuencia.

Preguntas frecuentes

¿En qué se diferencia el reranking de la bi-codificación?

La bi-codificación (utilizada en la recuperación inicial) procesa consultas y documentos de forma independiente para mayor velocidad, mientras que el reranking (codificación cruzada) los procesa juntos para capturar relaciones semánticas más profundas a costa de una mayor latencia.

¿Cuándo debería implementar un reranker en mi pipeline RAG?

Deberías implementar un reranker si tus resultados de recuperación inicial son ruidosos o si tu LLM tiene dificultades para encontrar la respuesta correcta dentro de la ventana de contexto proporcionada.

¿El reranking siempre mejora el rendimiento?

Mejora la precisión, pero introduce latencia. Si tu aplicación requiere tiempos de respuesta de sub-milisegundos, la sobrecarga de un reranker podría ser inaceptable.