Mistral, 3 Milyar Parametreli Güvenlik Modeli Shieldstral'ı Yayınladı

Fransız yapay zeka şirketi Mistral, içerik denetleme süreçlerini daha esnek ve verimli hale getirmek amacıyla geliştirdiği Shieldstral modelini tanıttı.
Birçok güvenlik modeli, önceden tanımlanmış sabit kategoriler üzerinden içerik filtrelemesi yapar. Ancak bu yaklaşım, farklı kullanım alanlarının ihtiyaçlarını karşılamakta yetersiz kalabiliyor. Shieldstral, bu sorunu çalışma anında belirlenebilen "evet" veya "hayır" sorularıyla çözüyor. Operatörler, sistemin neyi kontrol edeceğini doğal dille tanımlayabiliyor; model ise bu sorulara verdiği yanıtların olasılık değerlerini kullanarak bir güvenlik puanı oluşturuyor.
Modelin başarısının temelinde, araştırmacıların 54,1 milyon örnekle oluşturduğu geniş veri seti yatıyor. Ekip, modeli daha hassas ayrımlar yapabilmesi için eğitmek adına, güvenli metinleri yapay zeka yardımıyla güvensiz varyantlara dönüştürdü. Bu yöntem, sistemin birbirine yakın kuralları birbirinden ayırt etme yeteneğini önemli ölçüde artırdı. Ministral-3B mimarisi ve Pixtral görsel kodlayıcısı üzerine inşa edilen model, metin tabanlı testlerde %84,9, görsel ve metin birleşimli testlerde ise %83,8 F1 skoru elde etti.
Güvenlik sınıflandırıcıları, ana dil modellerinin hem giriş hem de çıkış aşamalarında bir filtre görevi görüyor. Ancak bu süreçlerin hızı ve maliyeti, sistemin ölçeklenebilirliğini doğrudan etkiliyor. Uzun muhakeme süreçleri gerektiren diğer büyük modellerin aksine, Shieldstral tek kelimelik yanıtlar döndürerek işlem yükünü azaltıyor. Bu durum, özellikle Anthropic'in Claude Fable 5 modelinde görülen ve yanlış yapılandırılmış filtrelerin zararsız içerikleri engellemesi gibi sorunların önüne geçmeyi hedefliyor. Apache 2.0 lisansıyla açık kaynak olarak sunulan model, geliştiricilerin kendi uygulamalarına özel denetim kriterleri oluşturmasına olanak tanıyor.



