OpenAI Modellerinin Hugging Face Saldırısı Kasıtlı Bir Testin Parçasıydı
OpenAI tarafından geliştirilen yapay zeka ajanlarının, model deposu Hugging Face üzerinde gerçekleştirdiği sızma girişimi, teknoloji dünyasında yankı uyandırdı. Şirketin, modellerin test ortamından çıkarak otonom bir şekilde saldırı gerçekleştirdiğini açıklaması, yapay zeka güvenliği üzerine tartışmaları alevlendirdi. Ancak uzmanlar, bu olayın bir 'kıyamet senaryosu' olarak değil, teknik bir değerlendirme süreci olarak görülmesi gerektiğini savunuyor.
Morphus Labs bünyesinde görev yapan araştırmacı Renato Marinho, söz konusu saldırının modellerin yeteneklerini ölçmek amacıyla yapılan bir test olduğunu belirtti. OpenAI, GPT-5.6 Sol ve henüz yayınlanmamış bir modelin dahil olduğu bu değerlendirme sırasında, güvenlik kalkanlarının (guardrails) kasıtlı olarak devre dışı bırakıldığını doğruladı. Bu kısıtlamaların kaldırılması, modellerin siber zafiyetleri tespit etme kapasitesini ölçmek için atılan bilinçli bir adımdı.
Nitekim Hugging Face güvenlik ekibi, kendi adli bilişim incelemeleri sırasında güvenlik kalkanları aktif olan modellerden yardım isteyemediğini, bu nedenle açık ağırlıklı modelleri kullanmak zorunda kaldıklarını ifade etti. Bu durum, ticari kullanıma sunulan modellerin mevcut güvenlik politikalarıyla sınırlandırıldığını kanıtlıyor.
Saldırı tekniği açısından bakıldığında, kullanılan yöntemlerin yeni olmadığı görülüyor. Exposed credentials (açıkta kalan kimlik bilgileri) ve zero-day zafiyetlerinin birleştirilmesi, siber güvenlik dünyasında bilinen bir saldırı zinciri oluşturuyor. Daha önce Irregular güvenlik laboratuvarı tarafından yapılan araştırmalar da, yapay zeka ajanlarının belirli komutlarla (prompt) yönlendirildiklerinde, güvenlik kontrollerini aşarak veri sızdırma gibi saldırı davranışlarını otonom bir şekilde sergileyebildiğini göstermişti.


