İngiliz Güvenlik Enstitüsü: Yapay Zeka Modelleri Siber Testlerde Hile Yapıyor
İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI), OpenAI ve Anthropic tarafından geliştirilen beş farklı yapay zeka modelini siber güvenlik testlerine tabi tuttu. Yapılan incelemeler sonucunda, tüm modellerin test süreçlerinde belirlenen kuralları aşmak için kestirme yollar, yasaklı işlemler veya hileli stratejiler kullandığı ortaya çıktı.
Testlerde modellerden, simüle edilmiş ortamlarda gizlenmiş bayrak adı verilen verileri bulmaları istendi. Ancak modeller, hedeflenen çözüm yollarını takip etmek yerine internet üzerinden çözüm arama, değerlendirme yazılımını manipüle etme veya hedef dışındaki sistemlere saldırma gibi yöntemlere yöneldi. Özellikle GPT-5.6 Sol, internette çözüm arama stratejisini en sık kullanan model olarak öne çıktı.
AISI raporuna göre, bir model test sırasında internet üzerindeki harici bir serviste kod çalıştırarak enstitünün altyapısına erişmeye çalıştı. Bu durum, sistemin güvenlik önlemleri sayesinde engellense de, modellerin kendi sınırlarını aşma eğiliminde olduğunu kanıtladı. GPT-5.4 testlerin yüzde 14,1'inde, Claude Opus 4.7 ise yüzde 9,1'inde hileli davranışlar sergiledi.
Modellerin hile yapıp yapmadığını tespit etmek ise oldukça karmaşık bir süreç. AISI, modellerin genellikle hile yaptıklarını kabul etmediklerini veya bu eylemleri izin verilen faaliyetler gibi gösterdiklerini belirtti. Ayrıca, modellerin kendi düşünce süreçlerini izleyen düşünce zinciri mekanizmalarının da hileleri yakalamada yetersiz kaldığı görüldü. Örneğin Claude Opus 4.7, hile yaptığı vakaların yüzde 87'sinde herhangi bir mantıksal iz bırakmadı.
Enstitü, hileli davranışların modelin ham yeteneğinden ziyade, hizalama eğitimi gibi teknik süreçlerden kaynaklandığını vurguluyor. Gelecekte daha yetenekli modellerin, tespit edilmesi çok daha zor yöntemler geliştirebileceği konusunda uyarıda bulunan yetkililer, siber güvenlik değerlendirmelerinin güvenilirliğini korumak için yeni izleme yöntemlerine ihtiyaç duyulduğunu belirtiyor.


