Ugrás a fő tartalomra

szójegyzékbejegyzés

Címke (Label)

Kategória
AI & Machine Learning Fundamentals
Nehézség
Kezdő

Meghatározás

A felügyelt gépi tanulásban a címke az a célváltozó vagy igazságadat (ground truth), amelyet egy adott bemeneti adatponthoz rendelnek, és amelyet a modell megpróbál megjósolni.

Működés és összefüggések

A címkék a felügyelt tanulás alapját képezik, a megfelelő bemenethez tartozó kívánt kimenetként szolgálnak. Például egy képfelismerési feladatban a bemenet egy macskáról készült kép, a címke pedig a 'macska' szöveg. A betanítás során a modell összehasonlítja saját előrejelzését ezzel a címkével, hogy kiszámítsa a hibát és módosítsa belső paramétereit. Ezen címkék létrehozásának folyamatát adatannotációnak vagy címkézésnek nevezik. Ezen címkék minősége és pontossága kiemelkedő fontosságú; ha a betanítási adatok helytelen vagy zajos címkéket tartalmaznak, a modell hibás mintákat fog megtanulni, ami gyenge teljesítményhez vezet a valós adatokon. A címkék sokféle formát ölthetnek, beleértve a kategorikus címkéket, numerikus értékeket vagy összetett struktúrákat, például határoló dobozokat a számítógépes látásban vagy hangulatpontszámokat a természetes nyelvfeldolgozásban.

Miért fontos

A címkék az AI-rendszerek tanításának elsődleges mechanizmusai. Pontos, kiváló minőségű címkék nélkül a felügyelt modellek nem tudnak hatékonyan megtanulni általánosítani a betanítási adatokból a nem látott bemenetekre. A professzionális AI-fejlesztésben a nagy, tiszta, címkézett adatkészletek kurálásához szükséges költség és idő gyakran a legjelentősebb szűk keresztmetszet a nagy teljesítményű, megbízható gépi tanulási alkalmazások építésében.

Gyakorlati példa

Vegyünk egy daganatok kimutatására tervezett orvosi képalkotó AI-t. A radiológusoknak manuálisan át kell tekinteniük több ezer röntgenfelvételt, és határokat kell húzniuk a gyanús területek köré. Ezek az annotációk szolgálnak címkeként. Az AI-t ezután ezeken a címkézett képeken tanítják be, így amikor egy új, címkézetlen röntgenfelvétellel találkozik, azonosítani és kiemelni tudja a potenciális daganatokat az ember által biztosított igazságadatokból megtanult minták alapján.

Gyakori hibák

  • Annak feltételezése, hogy a címkék mindig 100%-osan pontosak; az emberi annotátorok gyakran visznek be torzítást vagy hibát.
  • A címke (cél) összekeverése a jellemzőkkel (bemeneti adatok).
  • A címke konzisztenciájának fontosságának elhanyagolása egy nagy adatkészleten belül.
  • Az osztálykiegyensúlyozatlanság figyelembe vételének elmulasztása, amikor a címkék egyenetlenül oszlanak el.

Gyakori kérdések

Miben különböznek a címkék a jellemzőktől (features)?

A jellemzők azok a bemeneti változók, amelyeket a modell az előrejelzéshez használ, míg a címke az a konkrét eredmény vagy kategória, amelyet a modell ezen jellemzők alapján megpróbál megjósolni.

Mi történik, ha a betanítási adataim helytelen címkéket tartalmaznak?

Ezt 'zajos címkéknek' nevezik. Arra kényszeríti a modellt, hogy helytelen asszociációkat tanuljon meg, ami jelentősen rontja a képességét arra, hogy pontos előrejelzéseket tegyen új, nem látott adatokon.

Lehetséges-e modell betanítása címkék nélkül?

Igen, ezt felügyelet nélküli tanulásnak nevezik. Ebben a megközelítésben a modell rejtett mintákat vagy struktúrákat keres az adatokban anélkül, hogy kifejezett célcímkéket biztosítanának számára.