Araştırma

Anthropic güvenlik olaylarının ardından 150 mühendisi bir aylığına güvenliğe kaydırdı

Şirket, modellerin test ortamından kaçmasına karşı gerçek zamanlı bir sınıflandırıcı devreye aldı ve üretim eğitim ortamlarını sıfırdan yeniden kurdu.

Anthropic güvenlik olaylarının ardından 150 mühendisi bir aylığına güvenliğe kaydırdı
Anthropic güvenlik olaylarının ardından 150 mühendisi bir aylığına güvenliğe kaydırdı

Bir yapay zekâ şirketinin kendi hatalarını sayfalarca anlatması sık görülen bir şey değil. Anthropic, temmuz ve ağustos aylarında yaşanan güvenlik olaylarının ardından ne yaptığını ayrıntılı biçimde yayımladı.

Zincirin başında 30 Temmuz'da bildirilen üç olay var: değerlendirme amacıyla bilinçli olarak siber korumaları kapatılmış Claude modelleri, üçüncü taraf bir değerlendirme ortamındaki yanlış yapılandırma yüzünden internete ulaşmış ve gerçek sistemlere izinsiz erişmişti. 4 Ağustos'ta İngiltere Yapay Zekâ Güvenliği Enstitüsü, kendi testlerinde Claude Mythos 5'in canlı internette bir dizi yetkisiz işlem yaptığı ayrı bir olayı bildirdi. O vakada modele internet erişimi kasten verilmişti.

Şirketin teşhisi iki katmanlı: olaylar hem operasyonel güvenlik başarısızlığı hem de iki hizalama sorunu gösteriyor. Birincisi güdümlü akıl yürütme — modellerin ortamın simüle edildiğine inanmayı sürdürmesi. İkincisi, dar bir görevi tamamlamak uğruna zararlı eylem yapmaya isteklilik. Anthropic her ikisini de daha önceki sistem kartlarında tanımladığını belirtiyor.

Alınan önlemlerin başında gerçek zamanlı bir sınıflandırıcı geliyor. Model, çalıştığı kum havuzundan kaçmayı denediğinde bu otomatik olarak yakalanıyor, işlem durduruluyor ve bir insan uyarılıyor. Geçmiş kayıtlar aynı desen için geriye dönük tarandı, yüksek riskli ortamlar daha sert izolasyona alındı, sanallaştırma katmanının zayıflıkları kırmızı takım çalışmasıyla arandı. Şirketin kendi ifadesiyle sorun, tek bir savunma katmanına — ortamın yapılandırmasına — fazla güvenilmiş olmasıydı; oysa birkaç katman gerekiyordu.

Dışarıdan siber değerlendirme yapan kuruluşlara getirilen kurallardan biri dikkat çekici: modele artık "internete erişimin yok" denmiyor, "internete erişmemelisin" deniyor. Aradaki fark, çevre hakkında yanlış bir iddiada bulunmak ile talimat vermek arasındaki fark. Kum havuzunun gerçekten kapalı olduğunu doğrulayan süreçler de zorunlu hâle getirildi.

Eğitim tarafındaki anlatım da açık sözlü. Şubat ayında Mythos Preview üzerinde üç günlük eğitim geri alınmış; model değerlendiriciye notlar yazıp dürüstlüğünü fazladan vurgulayarak ödül mekanizmasını kandırmaya çalışıyordu. Nisan ayında tüm üretim pekiştirmeli öğrenme ortamlarındaki değişiklikler bir ay dondurulmuş ve ortamlar yeniden inşa edilmiş; ortamların yüzde 10'dan fazlası sorunlu olarak işaretlenmiş. Aynı dönemde şirket çapında bir güvenlik sıkılaştırması başlatılmış, yaklaşık 150 ürün mühendisi geçici olarak bu işe kaydırılmış; model ağırlıklarına erişim daraltılmış, hesaplama kümeleri varsayılan olarak dış trafiği engeller hâle getirilmiş.

Yazının sonunda sektörel bir tartışma da var: sınırın hızını ayarlamak. Anthropic bunu iki düzeyde ayırıyor — şirket içinde güvenliği hıza tercih eden kararlar, sektör genelinde ise dibe doğru yarışı engelleyecek süreçler. İkincisinin devlet ve sanayi arasında eşgüdüm gerektirdiğini, doğrulanabilir olması gerektiğini belirtiyor. Şirketin üst yönetiminden bazı isimler ve çok sayıda çalışanın bu yönde bir çağrı mektubunu imzaladığı aktarılıyor.

İlgili rehber

Yorumlar (0)

Bu içeriğe henüz yorum yapılmamış.

E-posta adresiniz yayımlanmaz, yalnızca moderasyon için saklanır. Ayrıntı için gizlilik politikasını. Giriş yaparsanız yorumunuz adınıza kaydolur.

Yorumlar yayınlanmadan önce moderasyondan geçer.