Saltar al contenido principal
Volver a Noticias
AI Agents

Evaluación de agentes de IA mediante llamadas a herramientas y finalización de tareas

NVIDIA detalla un nuevo marco que puntúa a los agentes de IA tanto en procesos a nivel de paso como en resultados de extremo a extremo usando entornos ejecutables.

Publicado: 21 de septiembre de 2026Por GetAISet Editorial
Fuente: NVIDIA DevVer artículo original

Publicación de la fuente original: 21 de septiembre de 2026

El blog técnico de NVIDIA señala que la evaluación de agentes ha pasado de puntuar llamadas a funciones aisladas a medir la finalización completa de tareas en entornos ejecutables que ejecutan cada llamada de herramienta y rastrean el estado a lo largo de los pasos. Este cambio permite verificar si el estado final del entorno coincide con el objetivo previsto.

El marco propuesto utiliza dos capas de puntuación: puntuación de proceso a nivel de paso para identificar llamadas inválidas, irrelevantes o redundantes, y puntuación de resultados de extremo a extremo que verifica el estado final. Las métricas se agregan a través de una jerarquía (benchmark → trial → task → turn → step) y se informan en ejes de precisión, verbosidad y costo, a menudo combinados (p. ej., rangos de tasa de éxito). Se cita a Nemotron 3.5 Lightning como alcanzando un 86 % de precisión en PinchBench mientras completa tareas un 30 % más rápido. El artículo aconseja a las empresas construir evaluaciones específicas por dominio a partir de tickets y API reales, enfocándose en los resultados del estado del entorno en lugar de la precisión de llamadas aisladas.