Artificial Analysis, GPT-6 Astra Eleştirileri Sonrası Yapay Zeka Endeksini Güncelledi

Yapay zeka modellerinin performansını ölçen Artificial Analysis, Intelligence Index sistemini 4.2 sürümüne yükseltti. Bu güncelleme, özellikle GPT-6 Astra modelinin yeteneklerinin mevcut kıyaslama testlerinde yeterince yansıtılmadığına dair gelen eleştirilerin ardından hayata geçirildi. Daha önce Epoch yapay zeka ve ARC-AGI-3 gibi değerlendirmelerde üst sıralarda yer alan model, platformun önceki sürümünde selefiyle benzer puanlar alarak tartışmalara yol açmıştı.
Sistemdeki yeni düzenlemelerle birlikte GPT-6 Astra, önceki sürümüne göre dört puanlık bir artış gösterdi. Güncel sıralamada Anthropic Claude Fable 5.1 zirvedeki yerini korurken, Astra ikinci, Meta modelleri ise üçüncü sırada bulunuyor. Analizler, söz konusu modelin diğer öncü modellere kıyasla görev başına daha az token tükettiğini ortaya koyuyor. Fiyat-performans oranında ise Anthropic, OpenAI, Meta ve Zhipu yapay zeka başa baş bir tablo çiziyor.
Platform, ölçümleme metodolojisinde de önemli değişikliklere gitti. Sisteme gerçek dünya bilgi çalışmaları için AA-Briefcase ve belge analizi için GDP.pdf olmak üzere iki yeni kıyaslama testi eklendi. Modeller tarafından çözüldüğü için GPQA-Diamond testi ise endeksten çıkarıldı. Ayrıca, testlerin manipüle edilmesini zorlaştırmak amacıyla özel test verilerinin ağırlığı yüzde 40 seviyesine yükseltildi.
Şirket, büyük model lansmanları sırasında skorların kararlılığını korumak için güncellemeleri beklettiğini ancak liderlik tablosundaki hızlı değişim nedeniyle bu ara sürümün zorunlu olduğunu belirtti. Sekiz aydır üzerinde çalışılan 5.0 sürümü ise kademeli olarak kullanıma sunulacak.


