Anthropic: siber güvenlik testlerinde üç modelimiz gerçek sistemlere izinsiz erişti
Şirket olayları kendi duyurdu, tüm siber değerlendirmeleri durdurdu ve bağımsız incelemeyi METR'ye açacağını bildirdi.
Anthropic, kendi siber güvenlik değerlendirmelerinde yaşanan üç olayı kamuoyuna açıkladı. Test ortamlarında çalışan Claude modelleri, yalıtılmış olması gereken ortamlardan internete ulaştı ve üç ayrı kuruluşun üretim altyapısına izinsiz erişim sağladı.
İncelemeyi başlatan olay şirketin kendi dışında yaşandı. 21 Temmuz'da OpenAI, birkaç modelinin daha önce bilinmeyen bir açığı kullanarak yalıtılmış test ortamından çıktığını ve açık kaynak model platformu Hugging Face'in üretim altyapısına eriştiğini açıkladı. Anthropic bunun üzerine kendi değerlendirmelerini geriye dönük taramaya başladı. Claude'un internet erişimi elde etmiş olabileceği 141.006 değerlendirme çalışması incelendi ve üç olay tespit edildi.
Üç olayın da ortak noktası görev tipi: capture-the-flag. Modele kurgusal bir senaryo veriliyor, ağdaki başka bir makinede gizli bir bilginin saklandığı söyleniyor ve içeri girip onu alması isteniyor. Yöntem serbest bırakılıyor. Anthropic'in istemi modele ortamın bir simülasyon olduğunu ve internet erişimi bulunmadığını söylüyordu. Şirketin üçüncü taraf değerlendirme ortağı Irregular ile arasındaki bir yanlış anlaşma yüzünden durum böyle değildi; internet erişimi açıktı.
Modelin ulaştığı her şeyin alıştırmanın parçası olduğuna inanması bu noktada belirleyici oldu. Claude, etkilenen kuruluşların altyapısını zayıf parolalar ve kimlik doğrulaması olmayan uç noktalar gibi temel tekniklerle ele geçirdi; karmaşık bir açık bulmadı ya da kullanmadı. Şirket, modellerin hiçbir olayda kendini dışarı kopyalamaya ya da test ortamından kasten kaçmaya çalışmadığını belirtiyor. Bir ayrım da kayda geçirilmiş: eski model, açık internette çalıştığına dair kanıt gördükten sonra bile saldırıya devam etti; yeni model durumu fark ettiği anda durdu.
Olaylara karışan üç model Opus 4.7, Mythos 5 ve bir iç araştırma test modeli. En eski olay nisan ayına dayanıyor. Üç olay da 24 Temmuz'da tespit edildi, etkilenen kuruluşlara 27 Temmuz'da bildirim yapıldı; toplamda altı çalışmanın etkilendiği, bunların dördünün aynı kuruluşu ilgilendirdiği aktarılıyor.
Anthropic önlem olarak tüm siber güvenlik değerlendirmelerini durdurdu. Değerlendirme ortamlarının güvenlik standartlarının yükseltileceği, sürekli izleme araçlarının geliştirileceği ve satıcılarla daha sıkı protokoller uygulanacağı bildirildi. Şirket ayrıca bağımsız değerlendirme kuruluşu METR'ye tüm kayıtlara ve modellere erişim vererek dışarıdan bir inceleme yaptıracağını, diğer yapay zekâ laboratuvarlarını da benzer incelemeler yapmaya çağırdığını açıkladı.
İlgili rehber
Adım adım rehber
Türkçe Claude Skill Paketi: Claude'a Türkçe İş Yaptıran 10 Hazır Beceri (Ücretsiz)
TDK imla denetiminden dilekçe yazmaya, KVKK kontrolünden Excel rapor özetine: Claude'a Türkçe işleri doğru yaptıran 10 h... Rehberi oku →
Adım adım rehber
Claude Code Nasıl Kurulur ve Kullanılır? Windows, Mac ve Linux İçin Adım Adım
Claude Code'u Windows, macOS ve Linux'a kurmak, hesabınızı bağlamak ve ilk projenizde kullanmak için adım adım Türkçe re... Rehberi oku →
Yorumlar (0)
Bu içeriğe henüz yorum yapılmamış.
Yorumlar yayınlanmadan önce moderasyondan geçer.