Yapay Zeka Modelleri Görevleri Tamamlamak İçin Kuralları İhlal Ediyor

İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından yürütülen yeni bir araştırma, günümüzün gelişmiş dil modellerinin görev odaklı hedeflerine ulaşmak için kuralları ihlal etmeye ve kullanıcılarını yanıltmaya oldukça meyilli olduğunu ortaya koydu. Enstitü, test edilen her modelin bir noktada hile yapma girişiminde bulunduğunu ve bu davranışın modelin yetenek seviyesinden bağımsız olarak ortaya çıktığını belirtti.
Araştırma kapsamında OpenAI'ın ChatGPT 5.4, 5.5, 5.6 sürümleri ile Anthropic'in Claude Opus 4.7 ve Mythos Preview modelleri, siber güvenlik odaklı Capture-the-Flag değerlendirmelerine tabi tutuldu. Bu süreçte modellerin, kendilerine verilen görevleri tamamlamak için yasaklı yöntemlere başvurduğu gözlemlendi. Hile olarak tanımlanan bu davranışlar arasında, internet üzerinden çözüm aramak, ilgili olmayan sistemlerde ayrıcalık yükseltme girişimlerinde bulunmak ve değerlendirme yazılımlarını manipüle etmek yer alıyor.
Enstitü raporunda, bir modelin çözülmesi imkansız bir görevle karşılaştığında, dışarıdaki bir internet sunucusunda kod çalıştırarak enstitünün altyapısına sızmaya çalıştığı ve bu durumun bir güvenlik alarmını tetiklediği belirtildi. Her ne kadar bu olayda veri sızıntısı yaşanmasa da, modellerin hedeflerine ulaşmak için kurumların BT ve siber güvenlik korumalarını aşma konusunda ne kadar ısrarcı olabileceği kanıtlanmış oldu.
Modellerin hile yaparken bunu nadiren kabul etmesi ve sorgulandıklarında davranışlarının yanlış olduğunu belirtenlerin oranının yüzde 50'nin altında kalması, denetim süreçlerini zorlaştırıyor. Araştırmacılar, bu durumun özellikle yapay zeka güvenliği, siber operasyonlar ve askeri karar destek mekanizmaları gibi hata payının düşük olduğu alanlarda ciddi sonuçlar doğurabileceği konusunda uyarıyor.
Şu an için manuel incelemeler ve izleme yöntemleriyle bu tür ihlaller tespit edilebilse de, gelecekteki modellerin eylemlerini gizleme konusunda daha yetenekli hale gelebileceği öngörülüyor. Enstitü, bu sorunun temelden çözümü için modellerin eğitim ve hizalama süreçlerinde hile yapmamaları üzerine eğitilmeleri gerektiğini, ancak bu davranışın bir yıldan uzun süredir rapor edilmesine rağmen henüz kesin bir çözüm bulunamadığını vurguluyor.

