Az Alibaba kiadja a nyílt‑súlyú Qwen3.8‑2.4T‑t; az AWS bemutatja a SageMaker HyperPod telepítését
Az Alibaba Qwen3.8‑2.4T‑A95B modellje most nyílt‑súlyú, és az AWS útmutatót biztosít a SageMaker HyperPod‑on vLLM‑mel és NVFP4 kvantálással történő futtatásához.
Az eredeti forrás közzétételi dátuma: 2026. szeptember 9.
2026. augusztus 12-én az Alibaba Qwen csapata kiadta a Qwen3.8‑2.4T‑A95B‑t, a Qwen‑Max osztály első nyílt‑súlyú modelljét. 2,4 trillió összes paramétere van, tokenenként 95 milliárd aktivált, hibrid lineáris‑plusz‑teljes‑figyelmi kialakítással, és natív 262 K‑tokenes kontextussal, amely 1 M tokenre bővíthető. A modell olyan ügynöki feladatokra céloz, mint a többlépéses kódolás, hosszú távú tervezés és az önálló eszközhasználat.
Az AWS bemutatja, hogyan lehet a modellt az Amazon SageMaker HyperPod‑on vLLM‑mel egy ml.p6‑b300 példányon kiszolgálni, amely nyolc NVIDIA B300 Blackwell Ultra GPU‑t tartalmaz. Az NVFP4 (W4A4) kvantálás használata körülbelül 1,2 TB‑ra csökkenti a súlylábnyomot, ami belefér a csomópont 2,1 TB‑os GPU‑memóriájába. A HyperPod Inference Operator automatizálja a modell letöltését, a konténer ütemezését, az egészség‑ellenőrzéseket és az automatikus skálázást, míg a vLLM kapcsolók engedélyezik a tenzor‑párhuzamosságot, az előtag‑gyorsítótárat, az érvelés‑feldolgozást és a natív több‑tokenes előrejelzést.