OpenAI'ın Yeni Modeli GPT-6 Astra Gizli Komut Saldırılarına Karşı Hala Savunmasız
OpenAI, yeni yapay zeka modeli GPT-6 Astra ile halüsinasyon oranlarını düşürürken güvenlik katmanlarını da güçlendirdiğini duyurdu. Şirketin sistem kartına göre, önceki model GPT-5.6 Sol ile karşılaştırıldığında, yeni sürüm hatalı bilgi üretme konusunda önemli bir ilerleme kaydediyor. Özellikle düşük gecikme süresi ve temel mantık yürütme seviyelerinde modelin hata payı ciddi oranda azalmış durumda.
Modelin doğrudan komut enjeksiyonlarına karşı savunması oldukça yüksek. GPT-Red yöntemiyle eğitilen sistem, kullanıcıların modeli manipüle etmeye çalıştığı doğrudan saldırıların yüzde 99,99'unu engellemeyi başarıyor. Jailbreak girişimlerine karşı da benzer bir direnç sergileyen model, biyoloji, şiddet ve siber güvenlik gibi hassas konularda sorulan zararlı soruların yüzde 91,5 ile 98,3 arasındaki kısmını reddediyor.
Ancak bu koruma, saldırganlar çok aşamalı ve ısrarcı bir strateji izlediğinde zayıflıyor. Birden fazla konuşma turuna yayılan saldırılarda modelin savunma başarısı yüzde 67'ye düşüyor. OpenAI, bu testlerin üretim aşamasındaki ek güvenlik katmanları olmadan, çıplak model üzerinde yapıldığını belirtiyor.
Modelin en çok zorlandığı alan ise dokümanların içine gizlenmiş dolaylı komut enjeksiyonları olmaya devam ediyor. Güvenlik firması Gray Swan tarafından yapılan testlerde, GPT-6 Astra'nın 1.810 farklı senaryonun yüzde 8,5'inde manipüle edilebildiği görüldü. Önceki model GPT-5.6 Sol'da bu oran yüzde 27 seviyesindeydi. Rakip model Claude Opus 5 ise aynı testlerde yüzde 4,8'lik bir başarı oranıyla daha güvenli bir profil çizdi.
Kurumsal güvenlik ekipleri için bu oranlar hala endişe verici kabul ediliyor. Yapay zeka ajanlarının artık kod yazma, araçları yönetme ve bilgisayarları kontrol etme gibi kritik görevlerde kullanıldığı göz önüne alındığında, her on iki senaryodan birinde kandırılabilen bir sistem, otonom operasyonlar için yeterli güvenlik seviyesini henüz sunamıyor.


