Ugrás a fő tartalomra

szójegyzékbejegyzés

Előképzés (Pretraining)

Kategória
LLMs & Generative AI
Nehézség
Középhaladó

Meghatározás

Az előképzés a gépi tanulás kezdeti, számításigényes fázisa, ahol a modellt egy hatalmas, címkézetlen adatkészleten képzik ki, hogy általános mintákat, nyelvi struktúrákat és világtudást sajátítson el. Ez a folyamat hozza létre az „alapmodellt”, amely később konkrét feladatokra adaptálható.

Működés és összefüggések

Az előképzés a modern generatív AI alapköve. Ebben a fázisban a modellt – jellemzően transzformátor architektúrát – trilliónyi tokennek teszik ki különféle forrásokból, például könyvekből, weboldalakból és kódgyűjteményekből. A cél általában az önfelügyelt tanulás, ahol a modell megjósolja a következő tokent egy sorozatban, ezzel hatékonyan kényszerítve arra, hogy internalizálja a nyelvtant, az érvelést és a tényszerű összefüggéseket. Ez a szakasz számításilag drága, gyakran több ezer GPU hetekig tartó futtatását igényli. Az eredményül kapott modell, az úgynevezett alapmodell, széles körű képességekkel rendelkezik, de hiányzik belőle a feladatspecifikus utasításkövetés. Bár az előképzés biztosítja a rendszer „intelligenciáját”, önmagában nem teszi a modellt segítőkészsé vagy biztonságossá; ezeket a tulajdonságokat jellemzően a későbbi szakaszokban, például a felügyelt finomhangolás és az emberi visszajelzésen alapuló megerősítéses tanulás (RLHF) során építik be.

Miért fontos

Az előképzés a modern AI-ban megfigyelhető „felbukkanó képességek” elsődleges mozgatórugója. A hatalmas, változatos adatkészletekből való tanulással a modellek a világ olyan általánosított megértését fejlesztik ki, amely lehetővé teszi számukra, hogy olyan feladatokat is elvégezzenek, amelyekre soha nem képezték ki őket kifejezetten. Ez a fázis kritikus, mert meghatározza a modell alapvető tudását, érvelési kapacitását és potenciális torzításait, így ez az AI-fejlesztési életciklus legjelentősebb befektetése.

Gyakorlati példa

Képzeljünk el egy vállalatot, amely speciális orvosi AI-t épít. Először előképzést végeznek egy hatalmas általános internetes szövegkorpuszon, hogy megtanítsák a modellnek a nyelv, a szintaxis és a logika megértését. Miután ez az általános alap létrejött, finomhangolást végeznek orvosi tankönyvek és klinikai jegyzetek kisebb, kurált adatkészletén. A kezdeti előképzés nélkül a modell küzdene az alapvető mondatszerkezet vagy kontextus megértésével, függetlenül attól, hogy később mennyi orvosi adatot kapott.

Gyakori hibák

  • Az előképzés összekeverése a finomhangolással; az előképzés az általános tudásról szól, míg a finomhangolás a feladatspecifikus viselkedésről.
  • Annak feltételezése, hogy egy előképzett modell készen áll a telepítésre; az előképzett modellekből gyakran hiányoznak a végfelhasználói alkalmazásokhoz szükséges biztonsági korlátok és utasításkövetési képességek.
  • Az adatminőségi követelmények alábecsülése; még az előképzésnél is érvényes a „szemetet be, szemetet ki” elv, mivel a rossz minőségű adatok hallucinációkra vagy torzításokra hajlamos modellekhez vezethetnek.
  • A környezeti és pénzügyi költségek figyelmen kívül hagyása; az előképzés az AI-fejlesztés leginkább erőforrás-igényes része, amely gyakran millió dolláros számítási költséggel jár.

Gyakori kérdések

Miben különbözik az előképzés a felügyelt tanulástól?

A felügyelt tanuláshoz címkézett adatokra van szükség, ahol a modellnek minden bemenethez megadják a „helyes” választ. Az előképzés általában önfelügyelt tanulást használ, ahol a modell maga generálja a címkéket az adatok szerkezetéből, például egy mondat következő szavának megjóslásával.

Használható egy modell közvetlenül az előképzés után?

Technikailag igen, de ritkán praktikus. A nyers előképzett modell egy „alapmodell”, amely inkább dokumentumkiegészítő motorként működik. Finomhangolásra van szüksége ahhoz, hogy segítőkész asszisztenssé váljon, amely képes utasításokat követni, személyiséget fenntartani vagy betartani a biztonsági irányelveket.

Az előképzés igényel emberi beavatkozást?

Az előképzés nagyrészt automatizált, de az emberi beavatkozás kritikus az adatok kurálásának fázisában. A mérnököknek szűrniük, tisztítaniuk és deduplikálniuk kell a hatalmas adatkészleteket, hogy biztosítsák, a modell kiváló minőségű, reprezentatív információkból tanuljon, ne pedig zajból vagy káros tartalomból.