Ugrás a fő tartalomra
← Vissza a hírekhez
AI Tools

Keresőügynökök finomhangolása többszörös körös RL-lel a SageMaker-en

Az AWS részletezi, hogyan lehet finomhangolni egy Qwen3.6‑27B keresőügynököt az Amazon SageMaker AI többszörös körös megerősítéses tanulásával, magasabb visszakeresési minőséget és alacsonyabb hibaarányt elérve.

Közzétéve: 2026. október 2.Szerző GetAISet Editorial

Az eredeti forrás közzétételi dátuma: 2026. október 2.

Az AWS elmagyarázza, hogy a nagy nyelvi modellek által hajtott keresőügynökök önállóan dönthetnek arról, hogy mit kérdezzenek le, melyik visszakeresési stratégiát használják, és mikor álljanak le, de a megbízható többszörös körös viselkedés elérése nehéz.

A blog bemutatja az Amazon SageMaker AI Multi‑turn Reinforcement Learning (MTRL) megoldást, amely egy ügynöki feladatot döntéssorozatként ábrázol, és politikagradiensek algoritmusaival optimalizálja, miközben az integrációt alacsony kódszintűre és a végrehajtást szerver nélküli módra tartja.

A szerzők finomhangolták a Qwen3.6‑27B modellt egy vállalati keresési forgatókönyvhöz, amely BM25 lexikális és vektorkeresési eszközökhöz fér hozzá. A képzés több nyilvános és szintetikus adathalmazt, az nDCG@10 alapú jutalmat, valamint minimális hiperparaméter‑változtatást (max_epochs = 1, batch = 128, rollout concurrency = 32) használt. Az MTRL alapértelmezett beállításai kezelik az algoritmusválasztást, az előnybecslést és az off‑policy határokat.

Négy tartalék benchmarkon végzett értékelés három adathalmazon mutatott javulást, a legnagyobb nyereségek a BrowseComp‑Plus (+23,7 % nDCG@10) és a WixQA (+18,4 %) esetében voltak. A hibaarányok is drámaian csökkentek, amit a BrowseComp‑Plus 22,89 %-ról 0,68 %-ra csökkenése példáz, ami megbízhatóbb feladatbefejezést jelez.