Popüler#YapayZeka#SiberGüvenlik#ChatGPT#OpenAI#Gemini#Apple#iPhone#Android#Samsung#FidyeYazılımı#Veriİhlali#NVIDIA
Yapay Zeka

Black Forest Labs, 20 Saniyelik Videoları Sesle Üreten Flux 3 Modelini Duyurdu

1 saat önce1 dk okuma4 okunma
Black Forest Labs, 20 Saniyelik Videoları Sesle Üreten Flux 3 Modelini Duyurdu

Alman yapay zeka şirketi Black Forest Labs (BFL), görüntü, video ve sesi aynı anda işleyebilen çok modlu temel modeli Flux 3'ü duyurdu. Şirket, bu yeni modelin fiziksel ve dijital dünyayı algılama, tahmin etme ve hareket etme yeteneğine sahip bir dünya modeli geliştirme hedefinin bir parçası olduğunu belirtiyor.

Flux 3, video üretimi sırasında yerel ses desteği sunan ilk modellerden biri olarak öne çıkıyor. 20 saniyeye kadar video klipler oluşturabilen sistem; metinden videoya, görüntüden videoya ve videodan videoya dönüştürme gibi çok sayıda işlevi destekliyor. Özellikle insan yüz ifadelerini yakalama ve fiziksel olaylarla sesleri eşleştirme konusunda yüksek performans sergilediği ifade edilen model, çok dilli diyalogları ve uzun sekanslar için kurgusal geçişleri de yönetebiliyor.

Şirketin paylaştığı ön test sonuçlarına göre, 720p çözünürlüğündeki 10 saniyelik kliplerde model; Luma Ray 3.2, Runway Gen-4.5 ve Grok Imagine Video gibi rakiplerine kıyasla tercih ediliyor. Kling v3 Pro, Seedance 2.0 ve Gemini Omni Flash gibi sistemlerle yapılan karşılaştırmalarda ise sonuçların birbirine oldukça yakın olduğu görülüyor.

Mimic Robotics iş birliğiyle hazırlanan bu video-aksiyon modeli, halihazırda Audi üretim hatlarında test ediliyor. Sistemin temelinde, görsel ve işitsel verileri ortak bir iç temsile dönüştüren çok modlu bir transformer mimarisi yer alıyor.

BFL, tüm yetenekleri aşamalı olarak kullanıma sunmayı planlıyor. Flux 3 Video şu an erişilebilir durumdayken, görüntü oluşturma odaklı Flux 3 Image sürümünün önümüzdeki haftalarda yayınlanması bekleniyor. Şirket ayrıca, modelin temel yapısını Flux 3 Dev adıyla açık ağırlıklı olarak geliştiricilere sunmayı hedefliyor.

TeknoHQ'yu Google'da tercih edilen kaynak olarak ekleyin
Kaynak: The Decoder