szójegyzékbejegyzés
Token
- Kategória
- LLMs & Generative AI
- Nehézség
- Kezdő
Meghatározás
A token a szöveg alapvető egysége, amelyet egy nagy nyelvi modell (LLM) feldolgoz, és amely karakterek, szavak vagy részszavak sorozatát jelöli.
Működés és összefüggések
A modern nagy nyelvi modellek architektúrájában a szöveget nem karakterek nyers karakterláncaként dolgozzák fel. Ehelyett egy tokenizációnak nevezett folyamaton megy keresztül, ahol a bemenetet numerikus azonosítók sorozatává alakítják, amelyeket tokeneknek neveznek. Egyetlen token képviselhet egy gyakori szót, egy szó egy részét, vagy akár egyetlen karaktert is, a modell által használt konkrét tokenizálótól függően. Például az „unhappiness” szó felbontható „un”, „happi” és „ness” részekre. Ez a részszavas megközelítés lehetővé teszi a modellek számára, hogy hatékonyan kezeljék a ritka szavakat, a helyesírási hibákat és az összetett morfológiai struktúrákat. A tokenek teljes számát, amelyet egy modell egyszerre képes feldolgozni, a „kontextusablak” határozza meg, amely a modell rövid távú memóriájaként működik. A tokenizáció megértése kritikus fontosságú, mivel közvetlenül befolyásolja a modell teljesítményét, a számítási költségeket és a kimenet generálásának pontosságát.
Miért fontos
A tokenek a generatív AI költségeinek és kapacitásának elsődleges mérőszámai. Az API-árazás szinte kivétel nélkül a feldolgozott tokenek számán alapul, és a modell kontextusablakának mérete határozza meg, mennyi információt tud „megjegyezni” egy beszélgetés során. A fejlesztőknek ismerniük kell a tokenkorlátokat az adatok csonkolásának megelőzése, valamint a promptok és alkalmazások hatékonyságának optimalizálása érdekében.
Gyakorlati példa
Amikor promptot küldesz egy olyan AI-nak, mint a ChatGPT, a rendszer először tokenizálja a bemenetedet. Ha azt kérdezed: „Hány token van ebben a mondatban?”, a modell nagyjából 10-12 tokenre bontja a mondatot. Ha API-t használó alkalmazást építenél, a számlázás ezen tokenek teljes száma alapján történne mind a bemeneted, mind a modell által generált válasz tekintetében, így a tokenkezelés elengedhetetlen a költségvetés ellenőrzéséhez.
Gyakori hibák
- Azt feltételezni, hogy egy token mindig egy szónak felel meg; a valóságban sok szó több tokenre bomlik.
- A modell tokenkorlátjának figyelmen kívül hagyása, ami ahhoz vezet, hogy az AI „elfelejti” egy hosszú beszélgetés elejét.
- A hosszú promptok költségének alábecslése, mivel a bemeneti tokenekért ugyanúgy számláznak, mint a kimeneti tokenekért.
- Azt hinni, hogy a tokenizáció minden AI-modellnél azonos; a különböző modellek eltérő szókészleteket és tokenizációs stratégiákat használnak.
Gyakori kérdések
Miért használnak a modellek részszavas tokeneket egész szavak helyett?
A részszavas tokenek használata lehetővé teszi a modell számára a végtelen szókincs kezelését. Képes megalkotni ritka vagy új szavak jelentését ismert részszavas töredékek kombinálásával, míg egy szavas alapú rendszer kudarcot vallana, ha olyan szóval találkozna, amely nincs a rögzített szótárában.
Kiszámíthatom a szövegemben lévő tokenek pontos számát?
Igen, a legtöbb modellszolgáltató kínál „tokenizáló” eszközöket vagy könyvtárakat, amelyek lehetővé teszik a szöveg bevitelét, és pontosan láthatod, hogyan bontja azt tokenekre az adott modell szókészlete.
A tokenek száma befolyásolja az AI-válasz sebességét?
Igen, mivel az LLM-ek egyszerre egy tokent generálnak. A hosszabb válasz több szekvenciális generálási lépést igényel, ami növeli a kimenet befejezéséhez szükséges teljes időt.