Popüler#YapayZeka#SiberGüvenlik#ChatGPT#OpenAI#Gemini#Apple#iPhone#Android#Samsung#FidyeYazılımı#Veriİhlali#NVIDIA
Yapay Zeka

Nvidia, Sekiz Farklı Konuşmacıyı Gerçek Zamanlı Ayırt Eden Yapay Zeka Modelini Yayınladı

27 Eylül 20261 dk okuma18 okunma

Nvidia, sesli görüşmelerde hangi konuşmacının aktif olduğunu anlık olarak tespit edebilen Nemotron 3 Diarization adlı yeni yapay zeka modelini ücretsiz olarak kullanıma sundu. Yaklaşık 100 milyon parametreye sahip olan bu model, hem önceden kaydedilmiş ses dosyalarında hem de canlı ses akışlarında aynı anda sekiz farklı kişiyi birbirinden ayırt edebiliyor.

Sistem, Parakeet gibi konuşma tanıma teknolojileriyle entegre edildiğinde, görüşme dökümlerini konuşmacı etiketleriyle birlikte oluşturabiliyor. Ancak model, konuşmacıların kimliklerini değil, yalnızca anonim etiketler atayabiliyor. Cihazın performansını belirleyen ses tamponu (audio buffer) ayarları, 30,4 saniye ile 0,32 saniye arasında dört farklı seviyede yapılandırılabiliyor; daha kısa tampon süreleri ise tahmin edilebileceği üzere doğruluk oranını düşürüyor.

VoiceArena tarafından yürütülen Diarization-Bench testlerinde, yeni model %14,72 hata oranıyla şu anda listenin ilk sırasında yer alıyor. Bu sonuç, %19,3 hata oranına sahip en yakın rakibinin önünde bulunuyor. Söz konusu test süreci, konuşmacı geçişlerindeki milimetrik kaymaları ve üst üste binen konuşmaları hata olarak kabul eden oldukça katı kriterlere dayanıyor.

Önceki nesil Streaming Sortformer ile kıyaslandığında, yeni modelin 1,04 saniyelik tampon süresinde sekiz farklı test senaryosunda hata oranını ortalama yüzde 41 oranında azalttığı belirtiliyor. Çok sayıda katılımcının olduğu, yoğun arka plan gürültüsünün bulunduğu veya yankılı ortamlarda ise modelin hata payının arttığı gözlemleniyor.

TeknoHQ'yu Google'da tercih edilen kaynak olarak ekleyin
›Kaynak: The Decoder