Saltar al contenido principal
← Volver a Noticias
AI Tools

Clonación de Voz en Tiempo Real con Qwen3‑TTS en SageMaker

AWS detalla cómo desplegar el modelo Qwen3‑TTS‑12Hz‑1.7B‑Base en SageMaker JumpStart para síntesis de voz personalizada en tiempo real usando clonación de voz.

Publicado: 25 de septiembre de 2026Por GetAISet Editorial

Publicación de la fuente original: 25 de septiembre de 2026

AWS anunció que el modelo de texto a voz Qwen3‑TTS‑12Hz‑1.7B‑Base, disponible públicamente, puede desplegarse desde SageMaker JumpStart a un endpoint de inferencia en tiempo real totalmente gestionado. Desarrollado por el equipo Qwen de Alibaba Cloud, el modelo admite diez idiomas, generación en streaming y clonación de voz a partir de unos segundos de audio de referencia sin reentrenamiento.

El despliegue utiliza el SDK de Python de SageMaker para crear un JumpStartModel, selecciona una instancia GPU ml.g6.4xlarge y configura la utilización de memoria GPU en 0.45 para que las etapas talker y code2wav compartan una GPU de 24 GB. Una vez que el endpoint está InService, los clientes envían una solicitud HTTP con el texto objetivo, un clip de referencia codificado en base64 y su transcripción, y reciben audio WAV a 24 kHz.

El blog menciona casos de uso como localización de contenido, e‑learning y IA conversacional en tiempo real, enfatizando que los datos de audio permanecen dentro de la cuenta de AWS y que los costos se alinean con el uso de cómputo.