szójegyzékbejegyzés
Előképzés (Pretraining)
- Kategória
- LLMs & Generative AI
- Nehézség
- Középhaladó
Meghatározás
Az előképzés a gépi tanulás kezdeti, számításigényes fázisa, ahol a modellt egy hatalmas, címkézetlen adatkészleten képzik ki, hogy általános mintákat, nyelvi struktúrákat és világtudást sajátítson el. Ez a folyamat hozza létre az „alapmodellt”, amely később konkrét feladatokra adaptálható.
Működés és összefüggések
Az előképzés a modern generatív AI alapköve. Ebben a fázisban a modellt – jellemzően transzformátor architektúrát – trilliónyi tokennek teszik ki különféle forrásokból, például könyvekből, weboldalakból és kódgyűjteményekből. A cél általában az önfelügyelt tanulás, ahol a modell megjósolja a következő tokent egy sorozatban, ezzel hatékonyan kényszerítve arra, hogy internalizálja a nyelvtant, az érvelést és a tényszerű összefüggéseket. Ez a szakasz számításilag drága, gyakran több ezer GPU hetekig tartó futtatását igényli. Az eredményül kapott modell, az úgynevezett alapmodell, széles körű képességekkel rendelkezik, de hiányzik belőle a feladatspecifikus utasításkövetés. Bár az előképzés biztosítja a rendszer „intelligenciáját”, önmagában nem teszi a modellt segítőkészsé vagy biztonságossá; ezeket a tulajdonságokat jellemzően a későbbi szakaszokban, például a felügyelt finomhangolás és az emberi visszajelzésen alapuló megerősítéses tanulás (RLHF) során építik be.
Miért fontos
Az előképzés a modern AI-ban megfigyelhető „felbukkanó képességek” elsődleges mozgatórugója. A hatalmas, változatos adatkészletekből való tanulással a modellek a világ olyan általánosított megértését fejlesztik ki, amely lehetővé teszi számukra, hogy olyan feladatokat is elvégezzenek, amelyekre soha nem képezték ki őket kifejezetten. Ez a fázis kritikus, mert meghatározza a modell alapvető tudását, érvelési kapacitását és potenciális torzításait, így ez az AI-fejlesztési életciklus legjelentősebb befektetése.
Gyakorlati példa
Képzeljünk el egy vállalatot, amely speciális orvosi AI-t épít. Először előképzést végeznek egy hatalmas általános internetes szövegkorpuszon, hogy megtanítsák a modellnek a nyelv, a szintaxis és a logika megértését. Miután ez az általános alap létrejött, finomhangolást végeznek orvosi tankönyvek és klinikai jegyzetek kisebb, kurált adatkészletén. A kezdeti előképzés nélkül a modell küzdene az alapvető mondatszerkezet vagy kontextus megértésével, függetlenül attól, hogy később mennyi orvosi adatot kapott.
Gyakori hibák
- Az előképzés összekeverése a finomhangolással; az előképzés az általános tudásról szól, míg a finomhangolás a feladatspecifikus viselkedésről.
- Annak feltételezése, hogy egy előképzett modell készen áll a telepítésre; az előképzett modellekből gyakran hiányoznak a végfelhasználói alkalmazásokhoz szükséges biztonsági korlátok és utasításkövetési képességek.
- Az adatminőségi követelmények alábecsülése; még az előképzésnél is érvényes a „szemetet be, szemetet ki” elv, mivel a rossz minőségű adatok hallucinációkra vagy torzításokra hajlamos modellekhez vezethetnek.
- A környezeti és pénzügyi költségek figyelmen kívül hagyása; az előképzés az AI-fejlesztés leginkább erőforrás-igényes része, amely gyakran millió dolláros számítási költséggel jár.
Gyakori kérdések
Miben különbözik az előképzés a felügyelt tanulástól?
A felügyelt tanuláshoz címkézett adatokra van szükség, ahol a modellnek minden bemenethez megadják a „helyes” választ. Az előképzés általában önfelügyelt tanulást használ, ahol a modell maga generálja a címkéket az adatok szerkezetéből, például egy mondat következő szavának megjóslásával.
Használható egy modell közvetlenül az előképzés után?
Technikailag igen, de ritkán praktikus. A nyers előképzett modell egy „alapmodell”, amely inkább dokumentumkiegészítő motorként működik. Finomhangolásra van szüksége ahhoz, hogy segítőkész asszisztenssé váljon, amely képes utasításokat követni, személyiséget fenntartani vagy betartani a biztonsági irányelveket.
Az előképzés igényel emberi beavatkozást?
Az előképzés nagyrészt automatizált, de az emberi beavatkozás kritikus az adatok kurálásának fázisában. A mérnököknek szűrniük, tisztítaniuk és deduplikálniuk kell a hatalmas adatkészleteket, hogy biztosítsák, a modell kiváló minőségű, reprezentatív információkból tanuljon, ne pedig zajból vagy káros tartalomból.