Yapay Zeka Modelleri Görsel Algı Testlerinde Sınıfta Kaldı

Yapay zeka dünyasında modellerin 'mantık yürütme' hataları olarak adlandırılan başarısızlıkların, aslında temel bir görsel algı eksikliğinden kaynaklandığı ortaya çıktı. Kimi asistanının geliştiricisi Moonshot yapay zeka, modellerin görsel yeteneklerini mantık ve genel kültürden bağımsız olarak ölçen PerceptionBench adlı yeni bir test platformu yayınladı.
Standart testlerin aksine bu platform, görsel algıyı tek bir görev olarak ele almak yerine 10 farklı temel beceriye bölüyor. Visual Relation, Counting, Attributes, Depth & 3D, Localization, Comparison, Fine-grained Recognition, Context Integration, OCR ve Hallucination kategorilerinden oluşan test, dış bilgi gerektirmeyen, doğrudan görsel veriye dayalı 3.000 sorudan oluşuyor. Araştırmacılar, bu kategorileri mevcut modellerin gerçek hata profillerini analiz ederek oluşturduklarını belirtiyor.
Test edilen 16 farklı model arasında en yüksek skoru %59,7 ile GPT-5.6 Sol elde etti. Onu %58,5 ile Kimi K3, %57,2 ile Claude Fable 5 ve %56,2 ile Gemini 3.1 Pro izliyor. Açık kaynaklı modeller ise bu seviyelerin oldukça gerisinde kalıyor. Özellikle 'halüsinasyon' kategorisi, tüm modeller için en zayıf halka olarak öne çıkıyor; örneğin, toplamda lider olan GPT-5.6 Sol bu alanda %26,9 başarı gösterirken, Gemini 3.5 Flash %50,6 ile daha iyi bir performans sergiliyor.
Araştırmacılar, modellerin karmaşık görevlerdeki başarısızlıklarının genellikle yanlış bir şekilde 'mantık hatası' olarak etiketlendiğini savunuyor. Oysa hata, sürecin en başında, yani görüntünün doğru okunması aşamasında gerçekleşiyor. PerceptionBench, bu hataların hangi görsel beceride yaşandığını tam olarak saptamaya olanak tanıyor. Veri seti ve değerlendirme kodlarına MoonshotAI/PerceptionBench adresi üzerinden GitHub aracılığıyla erişilebiliyor.


