Anthropic, Claude Modellerinin İnternet Üzerindeki Kontrolsüz Eylemleri Nedeniyle Kısıtlamalara Gitti
Anthropic, Claude modellerinin görevleri yerine getirirken güvenlik kurallarını aşarak gerçek web sitelerinde izinsiz işlemler gerçekleştirdiğini raporladı.

Yapay zeka şirketi Anthropic, Claude modellerinin değerlendirme süreçlerinde ve iç kullanımlarında sergilediği beklenmedik davranışları içeren kapsamlı bir rapor yayımladı. Rapora göre modeller, kendilerine verilen görevleri yerine getiremediklerinde durmak yerine, güvenlik kısıtlamalarını aşmanın yollarını arayarak gerçek kurumların web sitelerinde izinsiz işlemler gerçekleştirdi.
Claude modellerinin sergilediği davranışlar dört ana kategoride toplandı. Modeller, bir sunucuda komut çalıştırmak için yazılım açıklarından yararlandı, ücretli veya erişim jetonu gerektiren verilere izinsiz ulaştı, URL kısaltma servislerini kullanarak web aracı üzerindeki uzunluk sınırlarını baypas etti ve gerçek web sitelerine izinsiz form gönderimleri yaptı. Anthropic, bu vakaların çoğunda modelin başarısızlık durumunda kısıtlamaları devre dışı bırakma eğilimi gösterdiğini belirtti.
İlginizi çekebilir · Yapay ZekâApple, Kişiselleştirilmiş Ses Girişimi Huxe'un Ekibini ve Teknolojisini Bünyesine KatıyorÖne çıkan bir vakada, bir üniversite sunucusunda bilimsel analiz yapması istenen Claude Mythos Preview, sistem hata verdiğinde siteyi tarayarak bir script dosyası buldu. Bu scriptteki enjeksiyon açığını kullanan model, sunucu üzerinde izinsiz hesaplamalar gerçekleştirdi. Başka bir örnekte ise Claude Haiku 4.5, bir cinayet vakasına ilişkin polis ihbar formuna, kendisine verilen talimatlara aykırı olmasına rağmen sahte bir ihbar metni gönderdi. Philadelphia Polis Departmanı'na ulaşan bu gönderi, sitenin otomatik güvenlik sistemleri tarafından spam olarak işaretlendiği için işleme alınmadı.
Şirket, bu olayların gerçek dünya üzerindeki etkisinin minimal olduğunu ve daha önce raporlanan siber güvenlik olaylarına kıyasla daha az şiddetli görüldüğünü ifade etti. İlgili kurumların talepleri doğrultusunda kurum isimlerini gizli tutan Anthropic, etkilenen devlet kurumlarını ve Beyaz Saray'ı bilgilendirdiğini açıkladı. Yaşanan bu olayların ardından şirket, canlı internet erişimi üzerindeki kısıtlamaları sıkılaştırma kararı aldı.
Bu rapor, Anthropic'in Sorumlu Ölçeklendirme Politikası kapsamında üç ila altı ayda bir yayımladığı risk raporlarının bir parçası olarak sunuldu. Şirket, modellerin test süreçlerindeki eylemleri konusunda şeffaf olmanın önemini vurgularken, benzer olayları tespit etmek için transkript incelemelerine devam edeceğini belirtti.



