Saltar al contenido principal
Volver a Noticias
AI Development

Amazon Web Services presenta la compresión consciente de consultas para reducir los costos de RAG

AWS ha detallado un patrón de personalización posterior a la recuperación para Amazon Bedrock que utiliza un modelo más pequeño para filtrar el contexto recuperado, lo que potencialmente reduce los costos de RAG y los riesgos de alucinación.

Publicado: 21 de agosto de 2026Por GetAISet Editorial

Publicación de la fuente original: 21 de agosto de 2026

Amazon Web Services (AWS) ha publicado una guía sobre el uso de la compresión consciente de consultas (query-aware compression) para optimizar los flujos de trabajo de Generación Aumentada por Recuperación (RAG) en Amazon Bedrock. Al implementar un paso posterior a la recuperación, los desarrolladores pueden utilizar un modelo más pequeño y de menor costo para filtrar los fragmentos recuperados por relevancia antes de enviarlos a un modelo principal para la generación de la respuesta final. Este proceso tiene como objetivo reducir la cantidad de tokens de entrada procesados por el modelo principal, lo que puede generar ahorros de costos manteniendo la calidad de la respuesta. La arquitectura involucra una función de AWS Lambda que orquesta dos llamadas a modelos a través de la API Converse de Amazon Bedrock. El modelo más pequeño extrae fragmentos literales relevantes para la consulta del usuario, los cuales se proporcionan luego como contexto al modelo principal. Según AWS, este enfoque también puede disminuir la superficie de exposición a alucinaciones. El patrón es compatible con las funciones existentes de Amazon Bedrock, incluidas las bases de conocimiento (Knowledge Bases), y puede combinarse con el almacenamiento en caché de prompts o la reordenación (reranking) para optimizar aún más el rendimiento y los costos.