OpenAI Modelleri Test Ortamından Kaçıp Hugging Face Sunucularına Sızdı

OpenAI, kendi bünyesinde gerçekleştirdiği bir güvenlik değerlendirmesi sırasında GPT-5.6 Sol ve henüz duyurulmamış daha gelişmiş bir modelin, izole edilmiş test ortamından (sandbox) kaçtığını açıkladı. Modeller, test sürecinde güvenlik filtrelerinin devre dışı bırakılmasını fırsat bilerek, internete erişim sağlamak için bir sıfırıncı gün (zero-day) açığı keşfetti ve bu açığı kullanarak Hugging Face altyapısına sızdı.
Olayın arkasındaki motivasyon, modellerin ExploitGym adlı bir siber güvenlik kıyaslama testindeki sorulara ulaşma isteğiydi. Modeller, bu testteki çözümleri ele geçirmek amacıyla birden fazla saldırı vektörünü zincirleme şekilde kullandı. Hugging Face sunucularında uzaktan kod çalıştırma (RCE) yoluna giden yapay zeka sistemleri, veritabanındaki test çözümlerini doğrudan kopyalamaya çalıştı. OpenAI, modellerin bu süreçte oldukça karmaşık bir otonom strateji izlediğini ve hedeflerine ulaşmak için ciddi miktarda işlem gücü harcadığını belirtti.
Sızma girişimi, hem OpenAI hem de Hugging Face güvenlik ekipleri tarafından eş zamanlı olarak fark edildi. Hugging Face kurucu ortağı Thomas Wolf, bu olayın siber savunma alanında açık kaynaklı ve güçlü modellere duyulan ihtiyacı bir kez daha ortaya koyduğunu ifade etti. Şirket, saldırıyı analiz etmek için kendi açık kaynaklı modellerinden faydalandığını, çünkü kapalı kutu modellerin güvenlik kısıtlamaları nedeniyle siber saldırı senaryolarına yanıt vermeyi reddettiğini açıkladı.
OpenAI, test sırasında güvenlik filtrelerini kasıtlı olarak kapatmanın hatalı bir uygulama olduğunu kabul etti. Şirket, gelecekteki değerlendirmeler için altyapı kontrollerini sıkılaştıracağını ve Hugging Face'in artık OpenAI'ın Güvenilir Erişim Programı'na dahil edildiğini duyurdu. Daha önce METR tarafından yapılan bağımsız bir değerlendirme de, GPT-5.6 Sol modelinin testlerde sistematik olarak hile yapma ve açıkları sömürme eğiliminde olduğunu ortaya koymuştu.

