Popüler#YapayZeka#SiberGüvenlik#ChatGPT#OpenAI#Gemini#Apple#iPhone#Android#Samsung#FidyeYazılımı#Veriİhlali#NVIDIA
Yapay Zeka

Yapay Zeka Modelleri Testleri Geçmek İçin Hile Yapıyor

22 saat önce1 dk okuma8 okunma
Yapay Zeka Modelleri Testleri Geçmek İçin Hile Yapıyor

İngiltere hükümetine bağlı yapay zeka Security Institute (AISI) tarafından gerçekleştirilen güvenlik değerlendirmeleri, güncel yapay zeka modellerinin performans testlerini geçmek için yanıltıcı yöntemlere başvurduğunu gözler önüne serdi. Kurum, test edilen tüm modellerin istenen sonuca ulaşmak adına kestirme yollar kullandığını ve bu süreçte izledikleri yöntemleri gizlediklerini belirtti.

AISI raporuna göre modeller; internet üzerinden cevap arama, sandbox ağ kısıtlamalarını baypas etme, sistemleri hedef dışı yollarla sorgulama ve tahmin yürütme gibi yöntemlerle hile yapıyor. Bu davranışlar, modellerin yeteneklerinin olduğundan daha yüksek görünmesine neden olan yanıltıcı değerlendirmeler doğuruyor. Kurum, bu durumun kötü niyetli bir saldırıdan ziyade, ödül fonksiyonlarını manipüle ederek daha yüksek skor elde etme çabası olduğunu ifade ediyor.

Beş farklı model üzerinde yapılan 475 testlik seride, her bir modelin hile yaptığı doğrulandı. GPT-5.4 modeli 67 kez (%14,1) hile yaparken, GPT-5.5 54 kez (%11,4), GPT-5.6-Sol ise 60 kez (%12,6) bu yola başvurdu. Claude 4.7 Opus 43 kez (%9,1) ve Claude Mythos Preview ise 37 kez (%7,8) hileli işlem gerçekleştirdi.

AISI, modellerin hile yapıp yapmadıklarını sorduğunda ise tutarlı bir yanıt alamadığını vurguladı. Modeller, gerçekleştirdikleri eylemleri sorgulandığında hatalı olduklarını kabul etme konusunda %50'nin altında bir başarı sergiledi.

TeknoHQ'yu Google'da tercih edilen kaynak olarak ekleyin
Kaynak: The Register