Saltar al contenido principal

términos del glosario

Generación Aumentada por Recuperación (RAG)

Categoría
RAG, Embeddings & Search
Dificultad
Intermedio

Definición

La Generación Aumentada por Recuperación es un marco arquitectónico que mejora la precisión y relevancia de los modelos de lenguaje extensos mediante la recuperación dinámica de contexto desde bases de conocimiento externas, privadas o actualizadas antes de generar una respuesta.

Cómo funciona y contexto

La Generación Aumentada por Recuperación (RAG) aborda las limitaciones inherentes de los Modelos de Lenguaje Extensos (LLM), como su tendencia a alucinar y su incapacidad para acceder a información posterior al entrenamiento. El proceso involucra tres etapas principales: recuperación, aumento y generación. Primero, la consulta del usuario se convierte en un embedding vectorial y se utiliza para buscar documentos o fragmentos de datos relevantes en una base de datos vectorial. Segundo, esta información recuperada se combina con el prompt original del usuario para crear un contexto aumentado. Finalmente, el LLM procesa este prompt enriquecido para generar una respuesta fundamentada en los hechos proporcionados. Esta arquitectura es altamente efectiva para aplicaciones empresariales donde la privacidad de los datos, el conocimiento específico del dominio y la precisión factual son críticos. Al desacoplar las capacidades de razonamiento del modelo de su base de conocimiento, RAG permite a las organizaciones actualizar su información sin necesidad de un costoso reentrenamiento del modelo.

Por qué es importante

RAG es esencial para construir sistemas de IA confiables porque reduce las alucinaciones y proporciona transparencia mediante citas. Permite a los desarrolladores integrar datos propietarios, en tiempo real o sensibles en los flujos de trabajo de IA sin exponer esos datos al proceso de entrenamiento del modelo. Esto hace que la IA sea práctica para casos de uso empresarial como atención al cliente, análisis legal y documentación técnica, donde la precisión y la seguridad de los datos son requisitos innegociables.

Ejemplo real

Una empresa de servicios financieros utiliza RAG para potenciar un chatbot interno para sus asesores. Cuando un asesor pregunta sobre la política de cumplimiento más reciente, el sistema recupera los documentos PDF más recientes del servidor interno seguro de la empresa. El pipeline de RAG alimenta estos extractos de políticas específicos al LLM, que luego genera una respuesta precisa y citada basada únicamente en esos documentos, asegurando que el asesor reciba información precisa y actualizada en lugar de una respuesta genérica u obsoleta.

Errores frecuentes

  • Asumir que RAG solucionará datos de origen de mala calidad; si los documentos recuperados son inexactos, la respuesta de la IA también lo será.
  • Descuidar la calidad de la 'recuperación'; usar resultados de búsqueda irrelevantes confundirá al modelo y degradará el rendimiento.
  • No implementar controles de acceso adecuados, lo que puede llevar a que la IA muestre información sensible que el usuario no debería poder ver.
  • Sobrecargar la ventana de contexto recuperando demasiados documentos, lo que puede causar que el modelo pierda el enfoque o ignore la información más relevante.

Preguntas frecuentes

¿En qué se diferencia RAG del ajuste fino (fine-tuning)?

El ajuste fino modifica los pesos internos del modelo para aprender nuevos patrones o estilos, mientras que RAG proporciona al modelo información externa durante la ejecución. RAG es generalmente mejor para la precisión factual y datos dinámicos, mientras que el ajuste fino es mejor para cambiar el comportamiento o el tono del modelo.

¿RAG requiere una base de datos vectorial?

Aunque las bases de datos vectoriales son la forma más común y eficiente de almacenar y recuperar información para RAG, no es estrictamente obligatorio. Puedes implementar RAG usando búsqueda tradicional por palabras clave (como BM25) u otros métodos de recuperación, aunque la búsqueda vectorial es preferible para la comprensión semántica.

¿Puede RAG eliminar por completo las alucinaciones de la IA?

RAG reduce significativamente las alucinaciones al fundamentar el modelo en hechos proporcionados, pero no puede eliminarlas por completo. El modelo aún puede malinterpretar el contexto recuperado o no seguir las instrucciones, por lo que la supervisión humana sigue siendo importante para aplicaciones críticas.