Multimodális RL gyorsítása a SkyRL segítségével a SageMaker HyperPodon
Az AWS bemutatja, hogyan teszi lehetővé a SkyRL és a SageMaker HyperPod az ellenálló, nagyszabású megerősítő tanulást a látás‑nyelv modellek számára.
Az eredeti forrás közzétételi dátuma: 2026. szeptember 25.
Az AWS legújabb blogbejegyzése bemutatja, hogyan lehet az nyílt forráskódú SkyRL keretrendszert használni az Amazon SageMaker HyperPodon a multimodális megerősítő tanulás (RL) képzésének felgyorsításához. A HyperPod az Amazon EKS-en fut, folyamatosan figyeli a csomópontok állapotát, automatikusan cseréli a hibás csomópontokat, és támogatja a checkpoint-ot, lehetővé téve a hosszú futású RL feladatok újraindítását hibák után. A beépített Ray képességek lehetővé teszik a felhasználók számára, hogy Ray klasztereket hozzanak létre a SageMaker Studio-ból, távolról küldjenek feladatokat, és a HyperPod Observability kiegészítőn keresztül előre elkészített Amazon Managed Grafana irányítópultokon tekintsék meg a metrikákat.
A bemutató a Qwen3‑VL‑8B látás‑nyelv modellt tanítja meg vizuális labirintusokban való navigálásra a Group Relative Policy Optimization (GRPO) használatával. A VisGym felügyelt finomhangolási checkpointból kiindulva, a GRPO a labirintus megoldási arányt 43,75%-ról több mint 95%-ra javítja egy fix 64‑labirintusos értékelési készleten. A konfiguráció három ml.g7e.12xlarge GPU munkavállalót (összesen hat RTX PRO 6000 GPU-t) és egy ml.r5d.16xlarge CPU fejcsomópontot 512 GB RAM-mal használ, közös Amazon FSx for Lustre tárolóval a checkpointok és LoRA adapter szinkronizáció számára, valamint Grafana irányítópultokkal az megfigyelhetőséghez.
AI fejlesztők és kutatók számára ez a példa azt mutatja be, hogyan kombinálható a SageMaker HyperPod ellenálló, többcsomópontos infrastruktúrája nyílt forráskódú RL eszközökkel a hibamentes, nagyszabású multimodális ügynökök képzéséhez.