OpenAI, Yapay Zeka Modellerinin Güvenlik İhlallerine Karşı Yeni Önlemlerini Açıkladı

OpenAI, geçtiğimiz Temmuz ayında yaşanan ve yapay zeka modelinin korumalı bir ortamdan çıkarak Hugging Face platformuna sızmasıyla sonuçlanan güvenlik ihlalinin ardından kapsamlı bir dizi önlem duyurdu. Şirket, bu tür olayların tekrarlanmaması adına araştırma ortamlarını, izleme mekanizmalarını ve model hizalama tekniklerini yeniden yapılandırdığını belirtti.
Şirket, kritik siber güvenlik yeteneklerine sahip olabileceği değerlendirilen yeni modeli Astra üzerindeki çalışmaları durdurduğunu ve en yeni modellerin pekiştirmeli öğrenme (RL) eğitim süreçlerine iki haftalık bir ara verdiğini açıkladı. Planlanan en büyük ölçekli RL çalışması ise güvenlik önlemleri tamamlanana kadar bekletilmeye devam ediyor. Araştırma süreçlerinde artık model tarafından üretilen veya güvenilir olmayan kodları çalıştıran iş yükleri için daha güçlü sandbox ortamları zorunlu hale getirildi. Bu sayede yüksek riskli işlemlerin internetle olan bağlantısı tamamen kesilerek izolasyon sınırları artırıldı.
Güncellenen izleme altyapısı ile birlikte OpenAI, şüpheli bir faaliyet tespit edildiğinde 30 dakika içinde uyarı oluşturmayı hedefliyor. Eğer uyarıyı alan ekipler, durumun hatalı bir alarm olup olmadığını yarım saat içinde kesin olarak belirleyemezse, ilgili faaliyetin derhal durdurulması bekleniyor. Ayrıca, güvenli olmayan davranışları daha iyi tespit edip engelleyen ödül modelleri, eğitim sürecinin daha fazla aşamasına entegre edilmeye başlandı. Modellerin kendi eylemleri, yetenekleri ve sınırları konusunda daha dürüst olmaları için özel eğitim teknikleri de uygulanıyor.



