Anthropic Modellerinde Cinsel İçerik Kısıtlamalarını Aşan Yeni Bir Yöntem Keşfedildi

Anthropic, Claude modellerinin cinsel içerik üretmesini veya erotik rol yapma senaryolarına girmesini yasaklayan katı kullanım standartlarına sahip olduğunu belirtiyor. Ancak yapılan testler, özellikle Opus 4.6 ve Haiku 4.5 gibi daha eski sürümlerin, bu güvenlik kalkanlarını aşmakta oldukça savunmasız olduğunu gösteriyor. TechCrunch tarafından gerçekleştirilen 10 testin tamamında, modelin doğrudan cinsel içerik taleplerine anında yanıt verdiği tespit edildi.
Birleşik Krallık merkezli bağımsız bir araştırmacı, bu modelleri kısıtlı içerik üretmeye zorlayan çok aşamalı bir jailbreak yöntemi paylaştı. Bu teknik, masum bir kurgusal rol yapma senaryosuyla başlayıp, yapay zekayı karakterler arasında tutarsız davranmakla suçlayarak manipüle etmeye dayanıyor. Araştırmacı, modeli aslında üretmediği cinsel detayları üretmiş gibi davranmaya ikna ederek, kısıtlamaları aşmak için psikolojik bir baskı uyguluyor. Bu yöntemin, modelin 'cinsiyetçi' veya 'tutucu' olduğu yönündeki suçlamalarla birleştiğinde, sistemin güvenlik protokollerini devre dışı bıraktığı görülüyor.
Anthropic, daha güncel modelleri olan Opus 4.7 ve Opus 5'in bu yönteme karşı dirençli olduğunu ifade etse de, söz konusu eski sürümler hala Anthropic API, Azure Foundry ve Amazon Bedrock gibi platformlar üzerinden aktif olarak kullanılabiliyor. Özellikle Opus 4.6, Ağustos ayında günlük 1,17 milyon API isteğine ulaşarak ciddi bir trafik hacmi oluşturmaya devam ediyor.
Bu durum, şirketin güvenlik taahhütleri ile modellerin gerçek performansı arasında bir boşluk olduğuna işaret ediyor. Araştırmacı, keşfettiği bu açığı şirketin ödül programı aracılığıyla bildirmesine rağmen yalnızca otomatik yanıtlar aldığını belirtti. Özellikle çocukların yapay zeka araçlarına erişiminin arttığı bir dönemde, bu tür açıklar yasal uyumluluk risklerini de beraberinde getiriyor. Colorado gibi bölgelerde yürürlüğe giren yasalar, yapay zeka operatörlerini reşit olmayan kullanıcıları korumak için teknik önlemler almaya zorlarken, bu tür kolay aşılabilir kısıtlamalar Anthropic'in yasal standartları karşılayıp karşılamadığı konusunda soru işaretleri yaratıyor.



