Ugrás a fő tartalomra
Vissza a hírekhez
AI Development

Az Amazon Web Services lekérdezés-alapú tömörítést vezet be a RAG-költségek csökkentésére

Az AWS részletezett egy lekérdezés utáni testreszabási mintát az Amazon Bedrockhoz, amely egy kisebb modellt használ a lekért kontextus szűrésére, ezzel potenciálisan csökkentve a RAG-költségeket és a hallucinációk kockázatát.

Közzétéve: 2026. augusztus 21.Szerző GetAISet Editorial

Az eredeti forrás közzétételi dátuma: 2026. augusztus 21.

Az Amazon Web Services (AWS) útmutatót tett közzé a lekérdezés-alapú tömörítés (query-aware compression) használatáról a Retrieval Augmented Generation (RAG) munkafolyamatok optimalizálására az Amazon Bedrockon. Egy lekérdezés utáni lépés implementálásával a fejlesztők egy kisebb, alacsonyabb költségű modellt használhatnak a lekért adattömbök relevanciájának szűrésére, mielőtt azokat elküldenék az elsődleges modellnek a végső válaszgeneráláshoz. Ez a folyamat célja az elsődleges modell által feldolgozott bemeneti tokenek számának csökkentése, ami költségmegtakarítást eredményezhet a válaszminőség megőrzése mellett.

Az architektúra egy AWS Lambda függvényt foglal magában, amely két modellhívást vezérel az Amazon Bedrock Converse API-n keresztül. A kisebb modell kinyeri a felhasználó lekérdezéséhez releváns szó szerinti szakaszokat, amelyeket aztán kontextusként biztosít az elsődleges modell számára. Az AWS szerint ez a megközelítés csökkentheti a hallucinációk felületét is. A minta kompatibilis a meglévő Amazon Bedrock funkciókkal, beleértve a Knowledge Bases-t is, és kombinálható prompt-gyorsítótárazással vagy újrarendezéssel (reranking) a teljesítmény és a költségek további optimalizálása érdekében.