Ugrás a fő tartalomra

szójegyzékbejegyzés

Emberi visszajelzésen alapuló megerősítéses tanulás (RLHF)

Kategória
Training, Adaptation & Inference
Nehézség
Középhaladó

Meghatározás

Egy gépi tanulási képzési módszer, amely során a modellt emberi preferenciákból származó jutalomjelzés segítségével finomhangolják, hogy kimenetei jobban igazodjanak az emberi értékekhez és utasításokhoz.

Működés és összefüggések

Az emberi visszajelzésen alapuló megerősítéses tanulás (RLHF) általában egy többlépcsős folyamatot követ. Először egy alapmodellt képeznek ki egy hatalmas adatkészleten. Ezután emberi értékelők rangsorolják ugyanarra a promptra adott több modell által generált választ, létrehozva egy preferencia-adatkészletet. Ezt az adatot egy külön „jutalommodell” betanítására használják, amely megtanulja előrejelezni az emberi preferenciákat. Végül az eredeti nyelvi modellt megerősítéses tanulással (gyakran Proximal Policy Optimization segítségével) finomhangolják, hogy maximalizálják a jutalommodell által adott pontszámot. Ez a folyamat elengedhetetlen ahhoz, hogy a nyers, kiszámíthatatlan nyelvi modellekből hasznos, társalgási asszisztensek váljanak. Az RLHF azonban kompromisszumokkal jár: „jutalomhackeléshez” vezethet, ahol a modell a tényszerű pontosság helyett az embernek tetsző válaszokat optimalizálja, és akaratlanul is bevezetheti az emberi értékelők körében jelenlévő torzításokat.

Miért fontos

Az RLHF az AI-igazítás elsődleges mechanizmusa, amely áthidalja a szakadékot a modell nyers statisztikai képességei és az emberi interakció árnyalt követelményei között. Enélkül a modellek gyakran toxikus, irreleváns vagy haszontalan tartalmat állítanak elő. Az emberi ítélőképesség beépítésével a fejlesztők biztonságosabb, megbízhatóbb és kontextuálisan megfelelő viselkedés felé terelhetik a modelleket, ami előfeltétele az AI professzionális, oktatási és fogyasztói alkalmazásokban történő bevezetésének.

Gyakorlati példa

Képzeljünk el egy chatbotot, amelyet egy ellentmondásos történelmi esemény elmagyarázására kérnek. RLHF nélkül a modell torz vagy gyújtó hatású választ generálhatna a nyers internetes adatok alapján. Az RLHF segítségével az emberi értékelők magasabbra rangsorolják azokat a válaszokat, amelyek semlegesek, tényalapúak és kiegyensúlyozottak, mint azokat, amelyek véleményvezéreltek. A modell megtanulja előnyben részesíteni ezeket a kiváló minőségű, objektív válaszokat, biztosítva, hogy a végső kimenet hasznos és biztonságos legyen az általános közönség számára.

Gyakori hibák

  • Annak feltételezése, hogy az RLHF helyettesíti a kiváló minőségű előképzési adatok szükségességét.
  • Azt hinni, hogy az RLHF garantálja a tényszerű pontosságot; elsősorban az emberi preferenciákra optimalizál, ami néha a magabiztosan hangzó, de helytelen válaszokat részesítheti előnyben.
  • Az értékelői torzítások modell személyiségébe való beépülésének lehetőségének figyelmen kívül hagyása.
  • Az RLHF-et „beállít és elfelejt” folyamatként kezelni, ahelyett, hogy az értékelés és finomítás iteratív ciklusaként tekintenénk rá.

Gyakori kérdések

Miben különbözik az RLHF a felügyelt finomhangolástól (SFT)?

Az SFT során a modellt a kívánt bemeneti-kimeneti párok konkrét példáin képezik ki. Ezzel szemben az RLHF egy jutalommodellt használ az AI preferált viselkedés felé terelésére, lehetővé téve számára, hogy relatív rangsorolásokból tanuljon, ne csak statikus példákból.

Használható-e az RLHF a hallucinációk kijavítására?

Bár az RLHF elriaszthatja a modellt a tények kitalálásától a helytelen válaszok büntetésével, ez nem tökéletes megoldás. Akkor a leghatékonyabb, ha visszakereséssel bővített generálással (RAG) vagy más megalapozó technikákkal kombinálják.

Mi a jutalommodell szerepe?

A jutalommodell az emberi ítélet helyettesítőjeként szolgál. Emberi preferenciaadatokon képzik ki, hogy numerikus pontszámot rendeljen bármely adott modellkimenethez, amelyet az elsődleges modell a megerősítéses tanulási fázisban megpróbál maximalizálni.