Ugrás a fő tartalomra

szójegyzékbejegyzés

Szemantikus keresés

Kategória
RAG, Embeddings & Search
Nehézség
Középhaladó

Meghatározás

Olyan keresési technika, amely vektorbeágyazásokat és természetes nyelvfeldolgozást használ az információk lekérésére a lekérdezés fogalmi jelentése és szándéka alapján, nem pedig pontos kulcsszó-egyeztetések alapján.

Működés és összefüggések

Ehelyett mind a felhasználó lekérdezését, mind az adatbázisban lévő dokumentumokat nagy dimenziós numerikus reprezentációkká, úgynevezett vektorbeágyazásokká alakítja. Ezek a vektorok rögzítik az adatok szemantikai kapcsolatait és kontextusát. Amikor a felhasználó keresést hajt végre, a rendszer kiszámítja a matematikai távolságot a lekérdezési vektor és a dokumentumvektorok között, hogy megtalálja a leginkább fogalmilag hasonló tartalmat. Ez a megközelítés lehetővé teszi a rendszer számára a szinonimák, a többértelműség és az összetett természetes nyelvű lekérdezések hatékony kezelését. A szemantikus keresés azonban néha küzdhet a rendkívül specifikus technikai zsargonnal vagy a pontos egyezést igénylő követelményekkel, például egy adott termék sorozatszámának keresésekor, ahol a hagyományos kulcsszó-alapú indexelés továbbra is kiváló.

Miért fontos

Azzal, hogy lehetővé teszi az AI-modellek számára a kontextuálisan releváns információk lekérését hatalmas tudásbázisokból, lehetővé teszi az LLM-ek számára, hogy pontos, megalapozott válaszokat adjanak.

Gyakorlati példa

Képzelje el, hogy egy felhasználó a „hogyan javítsam meg a csöpögő csapot” kifejezésre keres rá egy barkácsoldalon. Egy hagyományos kulcsszavas keresés kudarcot vallhat, ha a cikk a „szivárgó csap” kifejezést használja a „csöpögő csap” helyett. Egy szemantikus keresőrendszer azonban felismeri, hogy a „szivárgó” és a „csöpögő” fogalmilag hasonló, és hogy a „csap” és a „csaptelep” szinonimák, így sikeresen lekéri a megfelelő javítási útmutatót a pontos kulcsszó-átfedés hiánya ellenére is.

Gyakori hibák

  • Annak feltételezése, hogy a szemantikus keresés mindig jobb, mint a kulcsszavas keresés; gyakran rosszul teljesít pontos egyezést igénylő lekérdezéseknél, mint például azonosítók vagy konkrét alkatrészszámok.
  • A vektorbeágyazások újraindexelésének vagy frissítésének elmulasztása, amikor a mögöttes forrásadatok megváltoznak.
  • A hibrid keresési megközelítés megvalósításának elmulasztása, amely ötvözi a szemantikus és a kulcsszó-alapú lekérést az optimális teljesítmény érdekében.
  • A beágyazási modell kiválasztásának fontosságának figyelmen kívül hagyása, ami jelentősen befolyásolhatja a keresési eredmények minőségét.

Gyakori kérdések

Miben különbözik a szemantikus keresés a kulcsszavas kereséstől?

A kulcsszavas keresés a szavak vagy kifejezések pontos egyezését keresi egy dokumentumban. A szemantikus keresés a szavak mögötti fogalmi jelentést keresi, lehetővé téve a releváns eredmények megtalálását akkor is, ha a lekérdezésben használt konkrét szavak nem szerepelnek a dokumentumban.

Mi az a vektorbeágyazás a keresés kontextusában?

A vektorbeágyazás a szöveg numerikus reprezentációja, amely megragadja annak jelentését. A hasonló jelentésű szavakat vagy dokumentumokat közelebb helyezik egymáshoz egy többdimenziós térben, lehetővé téve a keresőmotor számára a hasonlóság matematikai kiszámítását.

Használható a szemantikus keresés nem szöveges adatokhoz?

Igen, a szemantikus keresés alkalmazható képekre, hangokra és videókra is azáltal, hogy beágyazásokat generál ezekhez a médiatípusokhoz, lehetővé téve a felhasználók számára, hogy vizuális vagy auditív hasonlóság alapján keressenek tartalmat.