Araştırma

Anthropic biyoloji filtresini gevşetti: zararsız sorulara gelen ret yüzde 85 azaldı

Şirket, Fable 5'in güvenlik sınıflandırıcısını yeniden eğitti; biyoloji sorularında yanlış yere verilen retlerin büyük bölümü ortadan kalktı.

Anthropic biyoloji filtresini gevşetti: zararsız sorulara gelen ret yüzde 85 azaldı
Anthropic biyoloji filtresini gevşetti: zararsız sorulara gelen ret yüzde 85 azaldı

Bir yapay zekâ modelinin güvenlik filtresi fazla sıkı ayarlandığında ortaya çıkan sorun görünürdür: model, tehlikeli olmayan soruları da reddetmeye başlar ve meşru kullanıcıyı kaybeder. Anthropic, Claude Fable 5'in biyoloji tarafındaki korumalarını bu yönde elden geçirdiğini açıkladı.

Sistemin çalışma biçimi tam bir reddetme değil, "geri düşme" üzerine kurulu: biyolojiyle ilgili bir soru geldiğinde sistem daha az yetenekli bir modele geçiyor. Şirketin testlerinde bu geri düşmelerin ürün yüzeyleri genelinde yaklaşık yüzde 85 azaldığı bildiriliyor. Pratikte kullanıcılar, laboratuvar sonuçlarını yorumlama, belirtileri anlama ve eğitim amaçlı biyoloji soruları gibi günlük sağlık ve öğrenme konularında çok daha az engelle karşılaşacak; sağlık profesyonelleri klinik görevlerde Fable 5'ten daha fazla destek alabilecek.

Anthropic'in filtreyi baştan sıkı kurma gerekçesi modelin yetenek seviyesi. Şirketin değerlendirmelerine göre Fable 5 bazı karmaşık biyolojik görevlerde uzmanları geçebiliyor ve başkalarında operasyonel destek verebiliyor. Bu, yeni bir tedavi geliştiren araştırmacıya gerçek katkı sağladığı anlamına geliyor — ama aynı yetenekler kötü niyetli birinin elinde biyolojik silah geliştirmede kullanılabilir. Şirketin kapasite değerlendirmeleri, modelin böyle bir aktöre başka hiçbir yerde bulamayacağı kabiliyetler sunabileceğini gösteriyor.

İşi zorlaştıran şey, biyolojide yararlı ile zararlı kullanımın çoğu zaman aynı bilgiye dayanması. Bir hastalığın tedavisini araştırmak, bazen o hastalığa yol açan tehlikeli bileşikleri üretmeyi gerektiriyor. En açık örnek canlı aşılar: bilim insanlarının önlemeyi hedefledikleri patojenin kendisini üretmeleri gerekiyor. Tansiyon ilacı captopril de benzer bir hikâyeye sahip — geliştirilmesi için yılan zehrinin insanlarda kan basıncını düşüren toksik bileşenlerinin yalıtılması gerekmişti.

Şirket, kötü niyetli aktörlerin tam da bu belirsizliği kullanarak tehlikeli görevleri sıradan araştırma gibi gösterdiğini belirtiyor ve ABD İstihbarat Topluluğu'nun 2026 Yıllık Tehdit Değerlendirmesi'ne atıf yapıyor: sentetik biyoloji ve genom düzenlemedeki ilerlemeler yeni biyolojik tehditlere yol açabilir ve birçok devlet aktörünün etkin saldırı amaçlı biyolojik ve kimyasal silah programı sürdürdüğü değerlendiriliyor.

Yapılan iş, sınıflandırıcının kurallarını tanımlayan metnin yeniden yazılması ve yeni eğitim verisiyle sınıflandırıcının yeniden eğitilmesi oldu; iç ve dış uzmanlardan geri bildirim alındı. Bir kısıt yerinde duruyor: viroloji, toksikoloji ve moleküler tasarım gibi çift kullanımlı sayılan istekler hâlâ Opus 5'e yönlendiriliyor, yani model profesyonel biyoloji araştırması ve ilaç geliştirme için henüz kullanılabilir değil.

İlgili rehber

Yorumlar (0)

Bu içeriğe henüz yorum yapılmamış.

E-posta adresiniz yayımlanmaz, yalnızca moderasyon için saklanır. Ayrıntı için gizlilik politikasını. Giriş yaparsanız yorumunuz adınıza kaydolur.

Yorumlar yayınlanmadan önce moderasyondan geçer.