Az AWS készség‑fókuszú értékelőket ad hozzá a Strands Evals-hez és a Bedrock AgentCore-hoz
A Strands Evals SDK és az Amazon Bedrock AgentCore Evaluations most három, a készségekre összpontosító értékelőt biztosítanak az ügynökök számára, amelyek moduláris készségeket használnak.
Az eredeti forrás közzétételi dátuma: 2026. szeptember 22.
Amazon Web Services bejelentette, hogy a Strands Evals SDK és az Amazon Bedrock AgentCore Evaluations képesség három, a készségekre fókuszáló értékelőt tartalmaz: Skill Selection Accuracy, amely bináris eredményt ad vissza, jelezve, hogy a meghívott készség megfelel-e a feladatnak; Skill Instruction Following, amely egy ötszintű skálán értékeli, mennyire teljesen követi az ügynök a készség által előírt lépéseket; és Skill Invoked, egy determinisztikus ellenőrzés, amely megerősíti, hogy egy megnevezett készség sikeresen betöltődött. Ezek az értékelők a Strands Evals-ben rögzített ügynök‑trajektóriákon vagy az AgentCore által rögzített OpenTelemetry nyomkövetéseken működnek, lehetővé téve a fejlesztők számára, hogy elkülönítsék az útválasztási hibákat és a hiányzó eljárási lépéseket, amelyeket az általános kimeneti metrikák esetleg figyelmen kívül hagynak.
Az eszközök elérhetők egy Python SDK‑n keresztül (Python 3.10+ és Bedrock hozzáférés szükséges) és az AgentCore CLI‑n keresztül. Az értékelők tesztkészletekbe vagy telepítési kapukba való integrálásával a csapatok diagnosztizálhatják a készség‑kiválasztási problémákat, ellenőrizhetik az utasítások betartását, és kényszeríthetik a kritikus készségbetöltést anélkül, hogy további modelleket kellene meghívni. Ez támogatja a karbantarthatóbb, moduláris ügynökfejlesztést olyan felhasználási esetekhez, mint a HR asszisztensek vagy a dokumentumfeldolgozás.