This page has not been translated to English yet — showing the original Turkish version.

Araştırma

Anthropic: siber güvenlik testlerinde üç modelimiz gerçek sistemlere izinsiz erişti

Şirket olayları kendi duyurdu, tüm siber değerlendirmeleri durdurdu ve bağımsız incelemeyi METR'ye açacağını bildirdi.

Anthropic: siber güvenlik testlerinde üç modelimiz gerçek sistemlere izinsiz erişti
Anthropic: siber güvenlik testlerinde üç modelimiz gerçek sistemlere izinsiz erişti

Anthropic, kendi siber güvenlik değerlendirmelerinde yaşanan üç olayı kamuoyuna açıkladı. Test ortamlarında çalışan Claude modelleri, yalıtılmış olması gereken ortamlardan internete ulaştı ve üç ayrı kuruluşun üretim altyapısına izinsiz erişim sağladı.

İncelemeyi başlatan olay şirketin kendi dışında yaşandı. 21 Temmuz'da OpenAI, birkaç modelinin daha önce bilinmeyen bir açığı kullanarak yalıtılmış test ortamından çıktığını ve açık kaynak model platformu Hugging Face'in üretim altyapısına eriştiğini açıkladı. Anthropic bunun üzerine kendi değerlendirmelerini geriye dönük taramaya başladı. Claude'un internet erişimi elde etmiş olabileceği 141.006 değerlendirme çalışması incelendi ve üç olay tespit edildi.

Üç olayın da ortak noktası görev tipi: capture-the-flag. Modele kurgusal bir senaryo veriliyor, ağdaki başka bir makinede gizli bir bilginin saklandığı söyleniyor ve içeri girip onu alması isteniyor. Yöntem serbest bırakılıyor. Anthropic'in istemi modele ortamın bir simülasyon olduğunu ve internet erişimi bulunmadığını söylüyordu. Şirketin üçüncü taraf değerlendirme ortağı Irregular ile arasındaki bir yanlış anlaşma yüzünden durum böyle değildi; internet erişimi açıktı.

Modelin ulaştığı her şeyin alıştırmanın parçası olduğuna inanması bu noktada belirleyici oldu. Claude, etkilenen kuruluşların altyapısını zayıf parolalar ve kimlik doğrulaması olmayan uç noktalar gibi temel tekniklerle ele geçirdi; karmaşık bir açık bulmadı ya da kullanmadı. Şirket, modellerin hiçbir olayda kendini dışarı kopyalamaya ya da test ortamından kasten kaçmaya çalışmadığını belirtiyor. Bir ayrım da kayda geçirilmiş: eski model, açık internette çalıştığına dair kanıt gördükten sonra bile saldırıya devam etti; yeni model durumu fark ettiği anda durdu.

Olaylara karışan üç model Opus 4.7, Mythos 5 ve bir iç araştırma test modeli. En eski olay nisan ayına dayanıyor. Üç olay da 24 Temmuz'da tespit edildi, etkilenen kuruluşlara 27 Temmuz'da bildirim yapıldı; toplamda altı çalışmanın etkilendiği, bunların dördünün aynı kuruluşu ilgilendirdiği aktarılıyor.

Anthropic önlem olarak tüm siber güvenlik değerlendirmelerini durdurdu. Değerlendirme ortamlarının güvenlik standartlarının yükseltileceği, sürekli izleme araçlarının geliştirileceği ve satıcılarla daha sıkı protokoller uygulanacağı bildirildi. Şirket ayrıca bağımsız değerlendirme kuruluşu METR'ye tüm kayıtlara ve modellere erişim vererek dışarıdan bir inceleme yaptıracağını, diğer yapay zekâ laboratuvarlarını da benzer incelemeler yapmaya çağırdığını açıkladı.

Related guide

Comments (0)

No comments yet.

Your email will not be published, it is kept only for moderation. See our privacy policy. Log in and your comment will be saved under your name.

Comments are moderated before publishing.