Ugrás a fő tartalomra

szójegyzékbejegyzés

Retrieval-Augmented Generation (RAG)

Kategória
RAG, Embeddings & Search
Nehézség
Középhaladó

Meghatározás

A Retrieval-Augmented Generation egy olyan építészeti keretrendszer, amely a nagy nyelvi modellek pontosságát és relevanciáját növeli azáltal, hogy a válasz generálása előtt dinamikusan lekéri a kontextust külső, privát vagy naprakész tudásbázisokból.

Működés és összefüggések

A Retrieval-Augmented Generation (RAG) a nagy nyelvi modellek (LLM-ek) belső korlátait kezeli, mint például a hallucinációra való hajlamot és a képzés utáni információkhoz való hozzáférés hiányát. A folyamat három fő szakaszból áll: lekérés (retrieval), kiegészítés (augmentation) és generálás (generation). Először a felhasználói lekérdezést vektoros beágyazássá alakítják, és egy vektoradatbázisban keresnek releváns dokumentumokat vagy adatrészleteket. Másodszor, ezt a lekért információt kombinálják az eredeti felhasználói prompthoz, hogy egy kiegészített kontextust hozzanak létre. Végül az LLM feldolgozza ezt a dúsított promptot, hogy olyan választ generáljon, amely a megadott tényeken alapul. Ez az architektúra rendkívül hatékony vállalati alkalmazásoknál, ahol az adatvédelem, a szakterületi tudás és a ténybeli pontosság kritikus fontosságú. A modell érvelési képességeinek a tudásbázistól való leválasztásával a RAG lehetővé teszi a szervezetek számára, hogy frissítsék információikat anélkül, hogy drága modell-újraképzésre lenne szükség.

Miért fontos

A RAG elengedhetetlen a megbízható AI-rendszerek kiépítéséhez, mivel csökkenti a hallucinációkat és átláthatóságot biztosít az idézetek révén. Lehetővé teszi a fejlesztők számára, hogy saját, valós idejű vagy érzékeny adatokat integráljanak az AI-munkafolyamatokba anélkül, hogy ezeket az adatokat kitennék a modell képzési folyamatának. Ez teszi az AI-t praktikussá olyan üzleti felhasználási esetekben, mint az ügyfélszolgálat, a jogi elemzés és a műszaki dokumentáció, ahol a pontosság és az adatbiztonság nem alku tárgya.

Gyakorlati példa

Egy pénzügyi szolgáltató cég RAG-ot használ a tanácsadói számára készült belső chatbot működtetésére. Amikor egy tanácsadó a legújabb megfelelőségi szabályzatról kérdez, a rendszer lekéri a legfrissebb PDF-dokumentumokat a cég biztonságos belső szerveréről. A RAG-folyamat ezeket a konkrét szabályzati kivonatokat továbbítja az LLM-nek, amely ezután pontos, hivatkozásokkal ellátott választ generál kizárólag ezek alapján a dokumentumok alapján, biztosítva, hogy a tanácsadó pontos, naprakész információkat kapjon, ne pedig általános vagy elavult választ.

Gyakori hibák

  • Annak feltételezése, hogy a RAG kijavítja a rossz minőségű forrásadatokat; ha a lekért dokumentumok pontatlanok, az AI válasza is az lesz.
  • A „lekérés” minőségének elhanyagolása; az irreleváns keresési eredmények használata összezavarja a modellt és rontja a teljesítményt.
  • A megfelelő hozzáférés-vezérlés megvalósításának elmulasztása, ami ahhoz vezethet, hogy az AI olyan érzékeny információkat jelenít meg, amelyeket a felhasználó nem láthatna.
  • A kontextusablak túlterhelése túl sok dokumentum lekérésével, ami miatt a modell elveszítheti a fókuszt, vagy figyelmen kívül hagyhatja a legrelevánsabb információkat.

Gyakori kérdések

Miben különbözik a RAG a finomhangolástól?

A finomhangolás módosítja a modell belső súlyait új minták vagy stílusok megtanulásához, míg a RAG futásidőben biztosít külső információkat a modell számára. A RAG általában jobb a ténybeli pontosság és a dinamikus adatok tekintetében, míg a finomhangolás jobb a modell viselkedésének vagy hangnemének megváltoztatására.

A RAG igényel vektoradatbázist?

Bár a vektoradatbázisok a leggyakoribb és leghatékonyabb módjai az információk tárolásának és lekérésének a RAG számára, ez nem szigorú követelmény. A RAG-ot hagyományos kulcsszavas kereséssel (például BM25) vagy más lekérési módszerekkel is megvalósíthatja, bár a szemantikai megértéshez a vektorkeresés az előnyben részesített módszer.

A RAG teljesen kiküszöbölheti az AI-hallucinációkat?

A RAG jelentősen csökkenti a hallucinációkat azáltal, hogy a modellt a megadott tényekre alapozza, de nem tudja teljesen kiküszöbölni azokat. A modell továbbra is félreértelmezheti a lekért kontextust, vagy elmulaszthatja követni az utasításokat, ezért a kritikus alkalmazásoknál az emberi felügyelet továbbra is fontos marad.