Ugrás a fő tartalomra
Vissza a hírekhez
AI Agents

AI ügynökök értékelése eszközhívások és feladatkivitelezés alapján

Az NVIDIA egy új keretrendszert részletez, amely az AI ügynököket lépés‑szintű folyamat és vég‑től‑végig kimenetek alapján pontozza végrehajtható környezetekben.

Közzétéve: 2026. szeptember 21.Szerző GetAISet Editorial

Az eredeti forrás közzétételi dátuma: 2026. szeptember 21.

Az NVIDIA technikai blogja szerint az ügynökök értékelése a különálló függvényhívások pontozásáról a teljes feladatkivitelezés mérésére vált egy végrehajtható környezetben, amely minden eszközhívást futtat és nyomon követi az állapotot a lépések során. Ez a váltás lehetővé teszi annak ellenőrzését, hogy a végső környezeti állapot megfelel‑e a kitűzött célnak.

A javasolt keretrendszer két pontozási réteget használ: lépés‑szintű folyamatpontozást az érvénytelen, irreleváns vagy redundáns hívások azonosítására, valamint vég‑től‑végig kimenetpontozást, amely a végső állapotot ellenőrzi. A metrikák egy hierarchián (benchmark → trial → task → turn → step) keresztül aggregálódnak, és pontosság, részletesség és költség tengelyeken kerülnek jelentésre, gyakran párosítva (pl. sikerarány‑tartományok). A Nemotron 3.5 Lightning például 86 % pontosságot ért el a PinchBench‑en, miközben a feladatokat 30 %‑kal gyorsabban teljesítette. A cikk azt tanácsolja a vállalkozásoknak, hogy valós jegyekből és API‑kból építsenek domain‑specifikus értékeléseket, a környezeti állapot kimeneteleire fókuszálva a különálló hívások pontossága helyett.