تقييم وكلاء الذكاء الاصطناعي عبر استدعاءات الأدوات وإكمال المهام
توضح NVIDIA إطارًا جديدًا يقيم وكلاء الذكاء الاصطناعي على كل من عملية على مستوى الخطوة والنتائج الشاملة باستخدام بيئات قابلة للتنفيذ.
تاريخ نشر المصدر الأصلي: 21 سبتمبر 2026
تشير مدونة NVIDIA التقنية إلى أن تقييم الوكلاء انتقل من تقييم المكالمات الوظيفية المنعزلة إلى قياس إكمال المهمة بالكامل في بيئات قابلة للتنفيذ تشغل كل مكالمة أداة وتتابع الحالة عبر الخطوات. يتيح هذا التحول التحقق مما إذا كانت حالة البيئة النهائية تتطابق مع الهدف المقصود.
يستخدم الإطار المقترح طبقتين من التقييم: تقييم عملية على مستوى الخطوة لتحديد المكالمات غير الصالحة أو غير ذات الصلة أو المتكررة، وتقييم النتيجة الشاملة التي تتحقق من الحالة النهائية. تُجمع المقاييس عبر تسلسل هرمي (benchmark → trial → task → turn → step) وتُبلغ عن الدقة والثرثرة وتكلفة الاستخدام، غالبًا بشكل مزدوج (مثال: نطاقات معدل النجاح). يُذكر أن Nemotron 3.5 Lightning حقق دقة 86 % على PinchBench مع إكمال المهام أسرع بنسبة 30 %. تنصح المقالة المؤسسات بإنشاء تقييمات متخصصة حسب المجال استنادًا إلى تذاكر حقيقية وواجهات برمجة التطبيقات، مع التركيز على نتائج حالة البيئة بدلاً من دقة المكالمات المنعزلة.