This page has not been translated to English yet — showing the original Turkish version.

Modeller

Mistral'ın 3 milyar parametreli güvenlik sınıflandırıcısı açık ağırlıklı yayımlandı

Shieldstral metin ve görselleri denetliyor, politikaları çalışma anında düz metin olarak alıyor ve tek 16 GB ekran kartında çalışıyor.

Mistral'ın 3 milyar parametreli güvenlik sınıflandırıcısı açık ağırlıklı yayımlandı
Mistral'ın 3 milyar parametreli güvenlik sınıflandırıcısı açık ağırlıklı yayımlandı

Bir yapay zekâ ürünü yayına girdiğinde şu sorulara cevap vermesi gerekiyor: bu içerik korunan bir gruba karşı şiddeti teşvik ediyor mu, bu görsel bir çocuğa gösterilebilir mi, asistan bu isteği reddetti mi? Doğru cevap ürüne, kitleye ve duruma göre değişiyor — aynı içerik bir siber güvenlik aracında sorunsuzken bir ruh sağlığı platformunda zararlı olabiliyor.

Mevcut koruma modellerinin çoğu, zarar kategorilerini sabit bir sınıflandırmayla ağırlıklarına gömüyor. Bu da yeni bir kullanım bağlamına uyarlamak için yeniden eğitim gerektiriyor. Üstelik güvenlik tanımları uygulamadan uygulamaya değiştiği için baştan "doğru" bir kategori seti de yok.

Mistral AI'ın açık ağırlıklı olarak yayımladığı Shieldstral farklı bir yol izliyor: politikayı çalışma anında düz bir soru olarak yazıyorsunuz, model kalibre edilmiş bir güvenlik skoru döndürüyor. Yeniden eğitim yok, metin ve görsel için tek arayüz var, karar tek bir jetondan çıkıyor.

Modelin kurgusu içerik denetimini ikili soru-cevap problemine çeviriyor. Her istek üç parçadan oluşuyor: değerlendirme bağlamını ve katılık düzeyini tanımlayan bölüm, evet/hayır ile cevaplanacak tek bir soru ve değerlendirilecek içerik — bir istem, bir yanıt, istem-yanıt çifti ya da isteğe bağlı metin içeren bir görsel. Model yalnızca "evet" ve "hayır" olasılıklarını okuyup sürekli bir güvenlik skoruna dönüştürüyor. Bu tek formülasyon istem sınıflandırma, yanıt denetimi, reddetme tespiti ve toksiklik tespitini aynı problemde topluyor.

3 milyar parametreli model, şirketin aktardığına göre metin güvenliği, reddetme tespiti, politika uyarlanabilirliği ve çok kipli denetim başlıklarında kendisinden yedi kat büyük açık koruma modellerine eşdeğer ya da üstün sonuç veriyor; çok kipli denetimde yeni bir üst seviye belirlediği belirtiliyor. Model tek bir 16 GB NVIDIA ekran kartında çalışabiliyor — denetimi dışarıdan bir servise göndermek istemeyen kurumlar için belirleyici bir eşik.

Skorun kesikli bir etiket yerine sürekli bir olasılık olması da pratik bir fark yaratıyor: kurumlar kendi eşiklerini belirleyebiliyor ya da içerikleri güven düzeyine göre sıralayabiliyor. Shieldstral, Apache 2.0 lisansıyla Hugging Face üzerinde yayımlandı. Şirket modeli, NVIDIA ve diğer kuruluşlarla birlikte kurucu üyesi olduğu Open Secure AI Alliance kapsamında çıkardığını belirtiyor.

Comments (0)

No comments yet.

Your email will not be published, it is kept only for moderation. See our privacy policy. Log in and your comment will be saved under your name.

Comments are moderated before publishing.