Ugrás a fő tartalomra

szójegyzékbejegyzés

Token

Kategória
LLMs & Generative AI
Nehézség
Kezdő

Meghatározás

A token a szöveg alapvető egysége, amelyet egy nagy nyelvi modell (LLM) feldolgoz, és amely karakterek, szavak vagy részszavak sorozatát jelöli.

Működés és összefüggések

A modern nagy nyelvi modellek architektúrájában a szöveget nem karakterek nyers karakterláncaként dolgozzák fel. Ehelyett egy tokenizációnak nevezett folyamaton megy keresztül, ahol a bemenetet numerikus azonosítók sorozatává alakítják, amelyeket tokeneknek neveznek. Egyetlen token képviselhet egy gyakori szót, egy szó egy részét, vagy akár egyetlen karaktert is, a modell által használt konkrét tokenizálótól függően. Például az „unhappiness” szó felbontható „un”, „happi” és „ness” részekre. Ez a részszavas megközelítés lehetővé teszi a modellek számára, hogy hatékonyan kezeljék a ritka szavakat, a helyesírási hibákat és az összetett morfológiai struktúrákat. A tokenek teljes számát, amelyet egy modell egyszerre képes feldolgozni, a „kontextusablak” határozza meg, amely a modell rövid távú memóriájaként működik. A tokenizáció megértése kritikus fontosságú, mivel közvetlenül befolyásolja a modell teljesítményét, a számítási költségeket és a kimenet generálásának pontosságát.

Miért fontos

A tokenek a generatív AI költségeinek és kapacitásának elsődleges mérőszámai. Az API-árazás szinte kivétel nélkül a feldolgozott tokenek számán alapul, és a modell kontextusablakának mérete határozza meg, mennyi információt tud „megjegyezni” egy beszélgetés során. A fejlesztőknek ismerniük kell a tokenkorlátokat az adatok csonkolásának megelőzése, valamint a promptok és alkalmazások hatékonyságának optimalizálása érdekében.

Gyakorlati példa

Amikor promptot küldesz egy olyan AI-nak, mint a ChatGPT, a rendszer először tokenizálja a bemenetedet. Ha azt kérdezed: „Hány token van ebben a mondatban?”, a modell nagyjából 10-12 tokenre bontja a mondatot. Ha API-t használó alkalmazást építenél, a számlázás ezen tokenek teljes száma alapján történne mind a bemeneted, mind a modell által generált válasz tekintetében, így a tokenkezelés elengedhetetlen a költségvetés ellenőrzéséhez.

Gyakori hibák

  • Azt feltételezni, hogy egy token mindig egy szónak felel meg; a valóságban sok szó több tokenre bomlik.
  • A modell tokenkorlátjának figyelmen kívül hagyása, ami ahhoz vezet, hogy az AI „elfelejti” egy hosszú beszélgetés elejét.
  • A hosszú promptok költségének alábecslése, mivel a bemeneti tokenekért ugyanúgy számláznak, mint a kimeneti tokenekért.
  • Azt hinni, hogy a tokenizáció minden AI-modellnél azonos; a különböző modellek eltérő szókészleteket és tokenizációs stratégiákat használnak.

Gyakori kérdések

Miért használnak a modellek részszavas tokeneket egész szavak helyett?

A részszavas tokenek használata lehetővé teszi a modell számára a végtelen szókincs kezelését. Képes megalkotni ritka vagy új szavak jelentését ismert részszavas töredékek kombinálásával, míg egy szavas alapú rendszer kudarcot vallana, ha olyan szóval találkozna, amely nincs a rögzített szótárában.

Kiszámíthatom a szövegemben lévő tokenek pontos számát?

Igen, a legtöbb modellszolgáltató kínál „tokenizáló” eszközöket vagy könyvtárakat, amelyek lehetővé teszik a szöveg bevitelét, és pontosan láthatod, hogyan bontja azt tokenekre az adott modell szókészlete.

A tokenek száma befolyásolja az AI-válasz sebességét?

Igen, mivel az LLM-ek egyszerre egy tokent generálnak. A hosszabb válasz több szekvenciális generálási lépést igényel, ami növeli a kimenet befejezéséhez szükséges teljes időt.