تظهر قياسات AWS أن GPT‑5.6 Luna غالبًا ما يتفوق على Mini و Nano من حيث التكلفة والجودة
تقارن AWS خمسة نماذج OpenAI على Amazon Bedrock، وتجد أن نموذج GPT‑5.6 Luna الأحدث يقدم تكلفة أقل لكل إجابة صحيحة، ولكل نجاح للوكيل، ولكل تسليم مهني مقارنةً بالنموذجين الأقدمين GPT‑5.4 mini و nano.
تاريخ نشر المصدر الأصلي: 11 سبتمبر 2026
أصدرت AWS أداة قياس معيارية مفتوحة المصدر تشغّل نفس واجهة OpenAI Responses API ضد ثلاثة نماذج Bedrock (gpt‑5.6‑luna، terra، sol) ونموذجين أساسيين محسّنين من حيث التكلفة لواجهة OpenAI API (gpt‑5.4‑mini، nano). عبر اختبارات الدقة ذات الاستدعاء الواحد (AIME، GPQA Diamond، MMLU‑Pro) حقق Luna أقل تكلفة ملحوظة لكل إجابة صحيحة — $0.0021 مقابل $0.0139 للـ mini بعد تخفيض الأسعار في 30 يوليو 2026. في مهام الوكيل متعددة الأدوار (DeepSearchQA)، احتاج Luna إلى عدد أقل من الأدوار وتكلف $0.05 لكل إجابة ناجحة، مقارنةً بـ $0.40 للـ mini، بينما تم تعويض السعر الأعلى للرمز في terra بعدد الأدوار الأقل.
لأعباء العمل على شكل مستندات (GDPval)، نجح Luna في 27 من 48 تسليمًا مهنيًا بتكلفة $0.010 لكل نجاح، متفوقًا على $0.030 للـ mini و $0.012 للـ nano. تشير المشاركة أيضًا إلى أن متوسط الوقت للوصول إلى أول رمز في Luna كان أقل بنسبة 21 % مقارنةً بالـ mini، وأن معدل الإنتاجية كان أعلى بنسبة 43 % للمخرجات التي تتجاوز 500 رمز. تقترح AWS استخدام هذه المقاييس القائمة على النتائج — التكلفة لكل إجابة صحيحة، كفاءة الأدوار، ومعدل نجاح التقييم — لتحديد النموذج الأنسب للعبء الوظيفي المحدد.