Ugrás a fő tartalomra
Vissza a hírekhez
AI Development

A Sentence Transformers v6.0 Multi-Vector Encoder támogatással bővült

A Sentence Transformers könyvtár bevezette a MultiVectorEncoder-t a ColBERT-stílusú késleltetett interakciós lekérdezéshez, lehetővé téve a felhasználók számára egyedi többvektoros modellek betanítását és finomhangolását.

Közzétéve: 2026. augusztus 26.Szerző GetAISet Editorial
Forrás: Hugging FaceEredeti cikk megtekintése

Az eredeti forrás közzétételi dátuma: 2026. augusztus 26.

A Sentence Transformers Python könyvtár kiadta a v6.0 frissítést, amely bevezeti a MultiVectorEncoder-t. Ez az új modelltípus támogatja a ColBERT-stílusú késleltetett interakciós (late interaction) lekérdezést, amely egy olyan módszer, amely megőrzi a finomszemcsés token-szintű jeleket azáltal, hogy a lekérdezéseket a dokumentumokkal szemben a MaxSim operátor használatával értékeli. Ez a megközelítés a lekérdezési teljesítmény javítását célozza a hagyományos sűrű beágyazási (dense embedding) modellekhez képest, amelyek a szöveget egyetlen vektorba tömörítik. A felhasználók mostantól finomhangolhatják a meglévő többvektoros modelleket, vagy újakat építhetnek az alap transzformerekből. A frissítés lehetővé teszi az egyedi konfigurációkat, például a dokumentumhossz-korlátok beállítását és az írásjel-kihagyási listák (punctuation skiplists) implementálását az indexelés optimalizálása érdekében. A dokumentáció szerint a tartományspecifikus finomhangolás segíthet a modelleknek alkalmazkodni a speciális szókincsekhez és dokumentumhosszokhoz, amelyeket az általános célú lekérdezők esetleg nem kezelnek hatékonyan. A könyvtár strukturált megközelítést biztosít a betanításhoz, beleértve az adatkészletekhez, veszteségfüggvényekhez és értékelőkhöz szükséges komponenseket, lehetővé téve a fejlesztők számára, hogy saját adataikon építsenek és finomítsanak modelleket.