Anthropic Claude Opus 5, Yapay Zeka Mantık Testinde Rekor Kırdı

Yapay zeka dünyasında mantık yürütme becerilerini ölçen en zorlu sınavlardan biri kabul edilen ARC-AGI-3 testinde dengeler değişti. Anthropic tarafından geliştirilen Claude Opus 5, %30,2 başarı oranıyla zirveye yerleşerek, OpenAI'ın GPT-5.6 Sol modelinin elinde tuttuğu %7,8'lik önceki rekoru neredeyse dört katına çıkardı.
Testi hazırlayan ekip, bu başarının temelinde modelin daha güçlü mantıksal akıl yürütme yeteneği olduğunu belirtiyor. Bu yetenek, sistemin daha önce hiç karşılaşmadığı ortamlarda otonom olarak keşif yapmasına ve planlama gerçekleştirmesine olanak tanıyor. Test sürecinde Claude Opus 5, daha önce hiçbir yapay zeka modelinde görülmemiş davranışlar sergiledi. Görevleri cebirsel notasyona dönüştüren model, kendi başına yansıma denklemleri formüle ederek daha önce çözülememiş beş farklı ortamı başarıyla tamamladı.
Başarının kaynağı konusunda sektörde farklı görüşler bulunuyor. Uzmanlar, Anthropic'in bu modelde hedefli veri etiketleme ve pekiştirmeli öğrenme tekniklerini kullanmış olabileceğini öne sürüyor. Claude Opus 5, test formatı kamuoyuna açıklandıktan sonra geliştirildiği için, modelin bu tür bulmaca formatlarına yönelik özel bir eğitimden geçmiş olma ihtimali üzerinde duruluyor.
Bağımsız araştırmacı Guanghan Ning tarafından yürütülen Witness adlı farklı bir bulmaca testinde ise sonuçlar daha sınırlı bir gelişmeye işaret ediyor. Bu testte model, benzer mekaniklere sahip görevlerde başarılı olsa da, kuralların alışılmadık şekilde birleştirildiği durumlarda önceki sürüm olan Opus 4.8'in gerisinde kaldı. Araştırmacılar, bu durumu modelin belirli türdeki verilere odaklanmış bir eğitim sürecinden geçmesine bağlıyor.



