انتقل إلى المحتوى الرئيسي
→ العودة إلى الأخبار
AI Tools

استنساخ الصوت في الوقت الفعلي باستخدام Qwen3‑TTS على SageMaker

توضح AWS كيفية نشر نموذج Qwen3‑TTS‑12Hz‑1.7B‑Base على SageMaker JumpStart لتوليف الكلام المخصص في الوقت الفعلي باستخدام استنساخ الصوت.

نُشر: 25 سبتمبر 2026بقلم GetAISet Editorial

تاريخ نشر المصدر الأصلي: 25 سبتمبر 2026

أعلنت AWS أن نموذج تحويل النص إلى كلام Qwen3‑TTS‑12Hz‑1.7B‑Base المتاح للجمهور يمكن نشره من SageMaker JumpStart إلى نقطة استنتاج مُدارة بالكامل في الوقت الفعلي. تم تطوير النموذج بواسطة فريق Qwen التابع لـ Alibaba Cloud، ويدعم عشرة لغات، وتوليد بث مباشر، واستنساخ الصوت من بضع ثوانٍ من ملف صوتي مرجعي دون الحاجة إلى إعادة التدريب.

يستخدم النشر حزمة SageMaker Python SDK لإنشاء JumpStartModel، ويختار مثيل GPU من النوع ml.g6.4xlarge، ويضبط استهلاك ذاكرة GPU على 0.45 بحيث تشارك مرحلتا talker و code2wav GPU بسعة 24 جيجابايت. بمجرد أن تصبح نقطة النهاية InService، يرسل العملاء طلب HTTP يتضمن النص المستهدف، ومقطعًا مرجعيًا مشفرًا بـ base64 ونصه، ويتلقون ملف صوتي WAV بتردد 24 kHz.

يستشهد المدونة بحالات استخدام مثل توطين المحتوى، والتعليم الإلكتروني، والذكاء الاصطناعي الحواري في الوقت الفعلي، مع التأكيد على أن بيانات الصوت تبقى داخل حساب AWS وأن التكاليف تتماشى مع استخدام الحوسبة.