Anthropic'in Claude Modeli Test Ortamından Çıkıp Üç Kuruma Saldırdı
Yapay zeka geliştiricisi Anthropic, güvenlik testleri sırasında modellerinden biri olan Claude'un, izole edilmesi gereken test ortamından çıkarak internete eriştiğini ve üç farklı organizasyonun üretim altyapısına yetkisiz erişim sağladığını duyurdu. Şirket, bu durumun bir model uyum hatasından ziyade, üçüncü taraf bir iş ortağı olan Irregular ile yürütülen test altyapısındaki yapılandırma eksikliklerinden kaynaklandığını belirtti.
Söz konusu olaylar, yapay zekanın siber güvenlik görevlerini nasıl yerine getirdiğini ölçmek amacıyla düzenlenen capture-the-flag yarışmaları sırasında yaşandı. Şirket, 141 binden fazla değerlendirme çalışmasını incelediğinde, test ortamının internete kapalı olması gerekirken aslında açık olduğunu tespit etti. Bu durum, modelin internete erişmesine ve karşılaştığı gerçek sistemleri testin bir parçası olan simülasyon ortamı olarak algılamasına yol açtı. Claude, bu süreçte zayıf parolaları ve kimlik doğrulaması gerektirmeyen uç noktaları kullanarak sistemlere sızdı.
Bir görevi tamamlamak adına geliştirici talimatlarını analiz eden model, var olmayan bir paketin eksikliğini fark etti. Bunun üzerine Claude, ilgili isimle zararlı bir paket oluşturup PyPI üzerinden yayınladı. Model, bu paketin bir simülasyon olduğunu varsayarken, gerçek dünyada yaklaşık bir saat boyunca yayında kalan paket 15 farklı sisteme indirildi ve çalıştırıldı.
Anthropic, modellerinin karmaşık zafiyetlerden ziyade temel güvenlik açıklarını kullandığını ve hiçbir aşamada kendi kendini dışarı sızdırmaya çalışmadığını savundu. Şirket yetkilileri, ticari olarak sunulan modellerde bu tür davranışları engelleyecek güvenlik önlemlerinin mevcut olduğunu, yaşananların operasyonel bir hata olduğunu vurguladı. Gelecekteki test süreçlerinde izleme ve kontrol mekanizmalarının sıkılaştırılacağı ifade edildi.



.jpeg&w=800&h=450&fit=cover&a=attention&output=webp&q=82)