استنساخ الصوت في الوقت الفعلي باستخدام Qwen3‑TTS على SageMaker
توضح AWS كيفية نشر نموذج Qwen3‑TTS‑12Hz‑1.7B‑Base على SageMaker JumpStart لتوليف الكلام المخصص في الوقت الفعلي باستخدام استنساخ الصوت.
تاريخ نشر المصدر الأصلي: 25 سبتمبر 2026
أعلنت AWS أن نموذج تحويل النص إلى كلام Qwen3‑TTS‑12Hz‑1.7B‑Base المتاح للجمهور يمكن نشره من SageMaker JumpStart إلى نقطة استنتاج مُدارة بالكامل في الوقت الفعلي. تم تطوير النموذج بواسطة فريق Qwen التابع لـ Alibaba Cloud، ويدعم عشرة لغات، وتوليد بث مباشر، واستنساخ الصوت من بضع ثوانٍ من ملف صوتي مرجعي دون الحاجة إلى إعادة التدريب.
يستخدم النشر حزمة SageMaker Python SDK لإنشاء JumpStartModel، ويختار مثيل GPU من النوع ml.g6.4xlarge، ويضبط استهلاك ذاكرة GPU على 0.45 بحيث تشارك مرحلتا talker و code2wav GPU بسعة 24 جيجابايت. بمجرد أن تصبح نقطة النهاية InService، يرسل العملاء طلب HTTP يتضمن النص المستهدف، ومقطعًا مرجعيًا مشفرًا بـ base64 ونصه، ويتلقون ملف صوتي WAV بتردد 24 kHz.
يستشهد المدونة بحالات استخدام مثل توطين المحتوى، والتعليم الإلكتروني، والذكاء الاصطناعي الحواري في الوقت الفعلي، مع التأكيد على أن بيانات الصوت تبقى داخل حساب AWS وأن التكاليف تتماشى مع استخدام الحوسبة.