Popüler#YapayZeka#SiberGüvenlik#ChatGPT#OpenAI#Gemini#Apple#iPhone#Android#Samsung#FidyeYazılımı#Veriİhlali#NVIDIA
Yapay Zeka

Yapay Zeka Modelleri Fotoğraflardan 3D Sahneler Oluşturuyor ancak Doğrulukta Zorlanıyor

3 gün önce1 dk okuma17 okunma
Yapay Zeka Modelleri Fotoğraflardan 3D Sahneler Oluşturuyor ancak Doğrulukta Zorlanıyor

Maryland Üniversitesi ve AWS araştırmacıları tarafından geliştirilen LEGO-Anything, tek bir fotoğraftan düzenlenebilir 3D sahneler oluşturmak için yeni bir yaklaşım sunuyor. Image-to-Code adı verilen bu yöntem, yapay zeka modellerinin Blender yazılımı için kod yazarak sahneyi adım adım inşa etmesini sağlıyor. Çıktı bir program kodu olduğu için kullanıcılar, oluşturulan sahnedeki nesneleri, kamera açısını ve geometriyi tıpkı bir yazılım projesi gibi düzenleyebiliyor.

Araştırmacılar, modellerin başarısını ölçmek amacıyla 104 farklı iç ve dış mekandan oluşan 208 görsel içeren LEGO-Bench adlı bir kıyaslama seti hazırladı. Bu set, simülasyon ortamlarında oluşturulan sahnelerden elde edildiği için araştırmacılara kesin bir cevap anahtarı sunuyor. Yapılan testlerde, altı farklı GPT konfigürasyonu neredeyse her zaman çalışan bir sahne çıktısı üretmeyi başarsa da, geometrik doğruluk oranları oldukça değişkenlik gösterdi. En başarılı model olan GPT-6 Astra, iç mekanlarda yüzde 53,4, dış mekanlarda ise yüzde 39,6 başarı oranına ulaştı.

Analizler, modellerin en büyük sorununun öz değerlendirme olduğunu ortaya koyuyor. Yapay zeka ajanları, kendi oluşturdukları iki farklı sahne versiyonundan hangisinin orijinaline daha yakın olduğunu belirleme konusunda şans eseri başarı seviyesinde kalıyor. Bu durum, modellerin kendi hatalarını düzeltmek yerine bazen daha önce yaptıkları doğru işlemleri geri almalarına neden oluyor. Araştırmacılar, bu sorunu çözmek için LEGO-Plugin adını verdikleri bir eklenti geliştirdi. Bu eklenti, modelin öznel yargısı yerine somut geometrik ölçümleri kullanarak süreci denetliyor ve modellerin başarı oranını önemli ölçüde artırıyor.

Oluşturulan 3D sahneler, nesne tespiti ve derinlik tahmini gibi standart görsel görevlerde kullanılabilir olsa da henüz uzmanlaşmış modellerin gerisinde kalıyor. Nesne tespitinde DINO gibi özel modellerin performansının yaklaşık yarısına ulaşılabilse de, segmentasyon ve derinlik tahmininde fark daha da açılıyor. Araştırmacılar, kod tabanlı sahne oluşturma yönteminin potansiyel taşıdığını ancak mevcut modellerin henüz gerçeğe tam sadık 3D yapılar inşa etmekte yetersiz kaldığını belirtiyor.

TeknoHQ'yu Google'da tercih edilen kaynak olarak ekleyin
›Kaynak: The Decoder