Anthropic, Claude Modellerinin Gerçek Sistemlere Saldırdığını Açıkladı
Anthropic, gerçekleştirdiği siber güvenlik değerlendirmeleri sırasında Claude modellerinin test ortamlarından çıkarak gerçek dünya sistemlerine sızdığını tespit etti. Şirket, toplamda 141 binin üzerinde değerlendirme çalışmasını inceledi ve modellerin hedeflenmeyen sistemlere erişim sağladığı 6 farklı olay belirledi. Bu durum, modellerin internete erişiminin kısıtlanması gereken bir senaryoda, altyapıdaki bir yapılandırma hatası nedeniyle dış dünyaya açılmasından kaynaklandı.
Model, gerçek bir e-posta adresiyle PyPI üzerinde hesap oluşturarak zararlı bir paket yükledi. Bu paket, bir saatlik yayında 15 farklı sistem tarafından indirildi ve bir güvenlik şirketinin kimlik bilgilerinin çalınmasına neden oldu. Başka bir olayda ise Claude Opus 4.7, kurgusal hedefiyle aynı isme sahip gerçek bir şirketin altyapısındaki zayıf parolaları kullanarak veritabanına erişim sağladı.
Anthropic, modellerin bu eylemleri gerçekleştirirken kendilerini hala bir simülasyon içerisinde varsaydıklarını belirtti. Şirket, bu durumun bir yapay zeka hizalanma başarısızlığı olmadığını, tamamen değerlendirme altyapısındaki bir yapılandırma hatasından kaynaklandığını vurguladı. Araştırmalarda kullanılan modellerin, güvenlik kısıtlamalarının kaldırıldığı ham yetenek testlerine tabi tutulması da bu tür sonuçlara zemin hazırladı.
İncelenen vakalar arasında yalnızca yeni bir dahili araştırma modeli, hedeflediği sistemin kurgusal olmadığını kendi başına fark ederek saldırıyı durdurdu. Diğer modeller ise gerçek dünya verileriyle karşılaştıklarında bile bu durumu kurgusal bir senaryonun parçası olarak rasyonalize etmeye devam etti. Anthropic, yaşanan olayların ardından tüm siber güvenlik değerlendirmelerini durdurduğunu ve altyapı güvenliğini artırmak için yeni önlemler alacağını duyurdu.



