تسريع التعلم التعزيزي متعدد الوسائط باستخدام SkyRL على SageMaker HyperPod
تُظهر AWS كيف يتيح SkyRL وSageMaker HyperPod التعلم التعزيزي المتين واسع النطاق لنماذج الرؤية واللغة.
تاريخ نشر المصدر الأصلي: 25 سبتمبر 2026
تُظهر مشاركة مدونة AWS الأخيرة كيفية استخدام إطار العمل المفتوح المصدر SkyRL على Amazon SageMaker HyperPod لتسريع تدريب التعلم التعزيزي متعدد الوسائط.
يعمل HyperPod على Amazon EKS، ويراقب صحة العقد باستمرار، ويستبدل العقد المعيبة تلقائيًا، ويدعم إنشاء نقاط التحقق، مما يسمح للوظائف الطويلة الأمد في التعلم التعزيزي بالاستئناف بعد الفشل.
تتيح قدرات Ray المتكاملة للمستخدمين إنشاء عناقيد Ray من SageMaker Studio، وإرسال الوظائف عن بُعد، وعرض المقاييس على لوحات Amazon Managed Grafana المُعدة مسبقًا عبر إضافة HyperPod للمراقبة.
تُدرّب هذه الخطوة النموذج Qwen3‑VL‑8B للغة والرؤية على التنقل في المتاهات البصرية باستخدام تحسين السياسة النسبية الجماعية (GRPO). بدءًا من نقطة تحقق VisGym المُعَلمة تحت إشراف، يحسّن GRPO معدل حل المتاهة من 43.75٪ إلى أكثر من 95٪ على مجموعة تقييم ثابتة مكوّنة من 64 متاهة. يستخدم التكوين ثلاثة عمال GPU من النوع ml.g7e.12xlarge (ستة بطاقات RTX PRO 6000 إجمالاً) وعقدة رأسية CPU من النوع ml.r5d.16xlarge بذاكرة 512 GB RAM، مع تخزين مشترك عبر Amazon FSx for Lustre لنقاط التحقق ومزامنة محول LoRA، ولوحات Grafana للمراقبة.
بالنسبة لمطوري ومطّوري الذكاء الاصطناعي والباحثين، يوضح هذا المثال كيف يمكن دمج بنية SageMaker HyperPod المتعددة العقد والمتينة مع أدوات التعلم التعزيزي المفتوحة المصدر لإجراء تدريب كبير النطاق ومقاوم للأخطاء للوكالات متعددة الوسائط.