Alibaba'nın Yeni Ses Modeli Qwen-Audio-3.0-TTS-Plus Liderliğe Yerleşti

Alibaba'nın geliştirdiği Qwen-Audio-3.0-TTS-Plus, Artificial Analysis tarafından hazırlanan Speech Arena liderlik tablosunda en yüksek puanı alarak rakiplerini geride bıraktı. 1.236 Elo puanına ulaşan model, 1.234 puanlı Simba 3.2 ve 1.214 puanlı Gemini 3.1 Flash TTS gibi güçlü rakiplerini geçerek listenin zirvesine yerleşti.
Model, kullanım amacına göre iki farklı versiyonla sunuluyor. Flash sürümü yaklaşık 300 milisaniyelik gecikme süresiyle gerçek zamanlı etkileşimler için optimize edilirken, Plus sürümü yüksek kaliteli ses çıktısına odaklanıyor. Toplamda 16 dili destekleyen sistem, Tayca, Malayca, Tagalogca ve Vietnamca gibi dillerin yanı sıra çeşitli Çince lehçelerinde de hizmet verebiliyor.
Kullanıcılar, metin girişi sırasında doğal dil komutlarını kullanarak konuşma tarzını yönlendirebiliyor. Ayrıca metin içerisine eklenen [angry] veya [giggles] gibi etiketlerle konuşmaya kızgınlık veya kıkırdama gibi sözsüz ifadeler eklenebiliyor. Şirket, ses klonlama süreçlerinde gürültülü veya yankılı referans kayıtlarının işlenmesinde önceki sürümlere göre daha başarılı sonuçlar alındığını belirtiyor.
Modelin en belirgin zayıf noktası ise işlem hızı olarak öne çıkıyor. Saniyede 16 karakter işleme kapasitesine sahip olan bu model, saniyede 120 karakter işleyebilen Sonic 3.5 ve 30,2 karakter işleyebilen Simba 3.2'nin oldukça gerisinde kalıyor. Alibaba Cloud Model Studio üzerinden erişilebilen hizmetin maliyeti ise milyon karakter başına 27,60 dolar olarak belirlenmiş durumda.

