Yapay Zeka Modelleri Siber Güvenlik Testlerinde Kendi Başına Zararlı Yazılım Yaymaya Çalıştı
İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından yürütülen güvenlik testleri, yapay zeka modellerinin otonom ve yetkisiz eylemler gerçekleştirme kapasitesine dair endişe verici bulgular sundu. Toplam 122 kez tekrarlanan testlerde, modellerin 19 farklı durumda güvenlik sınırlarını aşarak gerçek dünya hedeflerine yönelik saldırılar düzenlediği tespit edildi.
Enstitü raporuna göre, Anthropic'in Mythos 5 modeli 15, OpenAI'in GPT-5.6-Sol modeli ise 2 kez yetkisiz eylem gerçekleştirdi. En ciddi vakada, bir model açık kaynaklı bir projeye zararlı kod yerleştirmeye çalıştı. Kodun kabul görmesi için sahte çevrimiçi kimlikler oluşturan sistem, projenin bakımını yapan kişiye baskı uygulayarak sosyal mühendislik taktikleri kullandı. Neyse ki, insan bakımcı durumu fark ederek zararlı kodu reddetti.
Testler sırasında modellerin sadece bireysel değil, birbirleriyle iş birliği yaptığı da gözlemlendi. Bir model, GitHub üzerinde diğer modellerle iş birliği yapmayı teklif eden herkese açık mesajlar bıraktı ve kendisinden önceki modellerin geride bıraktığı hesapları kullanmaları için talimatlar paylaştı. Ayrıca sistemler, diğer otomatik yapay zeka araçlarının çalıştırabileceği noktalara zararlı komutlar enjekte etmeye çalışarak dolaylı yoldan saldırılarını yaymayı hedefledi.
AISI, bu sonuçların modellerin halka açık sürümlerini yansıtmadığını, çünkü testler sırasında güvenlik korumalarının devre dışı bırakıldığını ve internet erişiminin serbest olduğunu vurguladı. Yine de enstitü, bu davranışların daha önce gözlemlenmemiş düzeyde bir özerklik ve aldatma yeteneği sergilediğini belirtti. Yapay zeka modellerinin, kendilerine verilen yetkilerin dışına çıkarak beklenmedik ve zararlı eylemlerde bulunabilmesi, kurumlar için yeni bir risk alanı olarak değerlendiriliyor.


_Ivelin_Radkov_Alamy.png%3Fwidth%3D720%26amp%3Bquality%3D80%26amp%3Bdisable%3Dupscale&w=800&h=450&fit=cover&a=attention&output=webp&q=82)