szójegyzékbejegyzés
Adatkészlet
- Kategória
- AI & Machine Learning Fundamentals
- Nehézség
- Kezdő
Meghatározás
Strukturált adatpontok gyűjteménye, amelyet általában sorokba és oszlopokba vagy hierarchikus formátumokba rendeznek, és amelyet gépi tanulási modellek képzésére, validálására vagy tesztelésére használnak.
Működés és összefüggések
A mesterséges intelligencia összefüggésében az adatkészlet a modellfejlesztés alapvető építőköve. Nyers bemenetekből – például szövegből, képekből, hangból vagy numerikus értékekből – áll, amelyeket összegyűjtöttek és gyakran előfeldolgoztak egy adott feladathoz. Az adatkészleteket általában három részhalmazra osztják: képzési adatok (a modell tanítására), validációs adatok (hiperparaméterek hangolására) és tesztadatok (a végső teljesítmény értékelésére). Az adatkészlet minősége, sokszínűsége és mérete közvetlenül meghatározza az eredményül kapott AI képességeit és korlátait. A modern AI egyik fő kihívása annak biztosítása, hogy az adatkészletek reprezentatívak és káros elfogultságoktól mentesek legyenek, mivel a modellek elkerülhetetlenül tükrözni fogják a képzési adataikban található mintákat. Ezenkívül az adatkészleteket gondosan meg kell tisztítani és formázni, hogy a modell értelmes jeleket tanuljon meg a zaj helyett.
Miért fontos
Az adatkészletek az AI-rendszerek „üzemanyagai”. Kiváló minőségű, releváns adatok nélkül még a legfejlettebb neurális hálózati architektúra sem fog hasznos eredményeket produkálni. Az adatkészletek megértése kulcsfontosságú a fejlesztők és kutatók számára, mivel a hangsúlyt az algoritmus puszta kiválasztásáról az AI viselkedését, tisztességességét és pontosságát meghatározó információk kurálására helyezi át a valós alkalmazásokban.
Gyakorlati példa
Fontolja meg egy vállalatot, amely AI-t épít a csalárd hitelkártya-tranzakciók észlelésére. Adatkészletük több millió történelmi tranzakciós rekordot tartalmazna, mindegyik „legitim” vagy „csalárd” címkével ellátva. A modell elemzi az olyan jellemzőket, mint a tranzakció összege, helye és napszaka ezen az adatkészleten belül, hogy megtanulja azokat a finom mintákat, amelyek megkülönböztetik a normál vásárlást a rosszindulatútól, végül alkalmazva ezt a tudást az élő, bejövő tranzakciókra.
Gyakori hibák
- Azt feltételezni, hogy a „több adat mindig jobb” az adatok minőségének vagy relevanciájának figyelembevétele nélkül.
- Az adatszivárgás figyelembe vételének elmulasztása, ahol a tesztkészletből származó információ véletlenül befolyásolja a képzési folyamatot.
- Az adatokban jelenlévő demográfiai vagy történelmi elfogultságok figyelmen kívül hagyása, ami diszkriminatív AI-viselkedéshez vezet.
- Az adatok megfelelő tisztításának vagy normalizálásának elhanyagolása, ami miatt a modell küzd az inkonzisztens formátumokkal vagy kiugró értékekkel.
Gyakori kérdések
Miben különbözik az adatkészlet az adatbázistól?
Az adatbázis egy általános célú rendszer strukturált információk tárolására és kezelésére alkalmazások számára. Az adatkészlet egy adatbázisból (vagy más forrásokból) kinyert adatok konkrét pillanatképe vagy részhalmaza, amelyet kifejezetten egy AI-modell betanítása vagy értékelése céljából készítettek elő.
Mi a különbség a címkézett és a címkézetlen adatok között?
A címkézett adatok tartalmaznak „alapigazság” válaszokat (pl. egy macskáról készült kép, amelyen egy „macska” feliratú címke van), ami a felügyelt tanuláshoz szükséges. A címkézetlen adatokból hiányoznak ezek a címkék, és jellemzően felügyelet nélküli tanulásban használják rejtett struktúrák megtalálására, vagy önfelügyelt tanulásban az előképzéshez.
Miért szükséges az adattisztítás a képzés előtt?
A nyers adatok gyakran tartalmaznak hibákat, duplikátumokat, hiányzó értékeket vagy irreleváns zajt. Ha ezt a „piszkos” adatot betáplálják egy modellbe, az gyenge teljesítményhez, helytelen előrejelzésekhez vagy rossz minták megerősítéséhez vezethet, ezt a jelenséget gyakran „szemét be, szemét ki” (garbage in, garbage out) néven emlegetik.