Alibaba lanza Qwen3.8‑2.4T de peso abierto; AWS muestra el despliegue en SageMaker HyperPod
El modelo Qwen3.8‑2.4T‑A95B de Alibaba ahora es de peso abierto, y AWS ofrece una guía para ejecutarlo en SageMaker HyperPod con vLLM y cuantización NVFP4.
Publicación de la fuente original: 9 de septiembre de 2026
El 12 de agosto de 2026 el equipo Qwen de Alibaba lanzó Qwen3.8‑2.4T‑A95B, el primer modelo de peso abierto de la clase Qwen‑Max. Tiene 2,4 billones de parámetros totales, 95 mil millones activados por token, un diseño híbrido lineal‑más‑atención completa y un contexto nativo de 262 K tokens que puede ampliarse a 1 M tokens. El modelo está dirigido a cargas de trabajo agentivas como codificación de varios pasos, planificación a largo plazo y uso autónomo de herramientas.
AWS muestra cómo servir el modelo en Amazon SageMaker HyperPod con vLLM en una instancia ml.p6‑b300 que contiene ocho GPUs NVIDIA B300 Blackwell Ultra. Usar la cuantización NVFP4 (W4A4) reduce la huella del peso a aproximadamente 1,2 TB, encajando dentro de la memoria GPU de 2,1 TB del nodo. El Operador de Inferencia HyperPod automatiza la descarga del modelo, la programación de contenedores, las verificaciones de salud y el escalado automático, mientras que las banderas de vLLM habilitan el paralelismo de tensores, el almacenamiento en caché de prefijos, el análisis de razonamiento y la Predicción Multi‑Token nativa.