Ugrás a fő tartalomra
← Vissza a hírekhez
AI Tools

Valós‑idős hangklónozás a Qwen3‑TTS‑vel a SageMakeren

Az AWS részletezi, hogyan telepíthető a Qwen3‑TTS‑12Hz‑1.7B‑Base modell a SageMaker JumpStarton valós‑idős, személyre szabott beszédszintézishez hangklónozással.

Közzétéve: 2026. szeptember 25.Szerző GetAISet Editorial

Az eredeti forrás közzétételi dátuma: 2026. szeptember 25.

Az AWS bejelentette, hogy a nyilvánosan elérhető Qwen3‑TTS‑12Hz‑1.7B‑Base szöveg‑hang modell telepíthető a SageMaker JumpStartból egy teljesen kezelt valós‑idős inferencia végpontra. Az Alibaba Cloud Qwen csapata fejlesztette, a modell tíz nyelvet támogat, streaming generálást, valamint hangklónozást néhány másodperces referencia‑hangból újraképzés nélkül.

A telepítés a SageMaker Python SDK-t használja egy JumpStartModel létrehozásához, kiválaszt egy ml.g6.4xlarge GPU példányt, és a GPU memóriahasználatot 0.45‑re állítja, hogy a talker és a code2wav szakaszok egy 24 GB GPU‑t osszanak meg. Amint a végpont InService állapotba kerül, az ügyfelek HTTP‑kérést küldenek a célszöveggel, egy base64‑kódolt referencia‑klippel és annak átiratával, és 24 kHz‑es WAV‑hangot kapnak.

A blog felhasználási eseteket sorol fel, például tartalom‑lokalizációt, e‑learninget és valós‑idős konverzációs AI‑t, kiemelve, hogy a hangadatok az AWS‑fiókon belül maradnak, és a költségek a számítási felhasználással arányosak.