Anthropic biyoloji filtresini gevşetti: zararsız sorulara gelen ret yüzde 85 azaldı
Şirket, Fable 5'in güvenlik sınıflandırıcısını yeniden eğitti; biyoloji sorularında yanlış yere verilen retlerin büyük bölümü ortadan kalktı.
Bir yapay zekâ modelinin güvenlik filtresi fazla sıkı ayarlandığında ortaya çıkan sorun görünürdür: model, tehlikeli olmayan soruları da reddetmeye başlar ve meşru kullanıcıyı kaybeder. Anthropic, Claude Fable 5'in biyoloji tarafındaki korumalarını bu yönde elden geçirdiğini açıkladı.
Sistemin çalışma biçimi tam bir reddetme değil, "geri düşme" üzerine kurulu: biyolojiyle ilgili bir soru geldiğinde sistem daha az yetenekli bir modele geçiyor. Şirketin testlerinde bu geri düşmelerin ürün yüzeyleri genelinde yaklaşık yüzde 85 azaldığı bildiriliyor. Pratikte kullanıcılar, laboratuvar sonuçlarını yorumlama, belirtileri anlama ve eğitim amaçlı biyoloji soruları gibi günlük sağlık ve öğrenme konularında çok daha az engelle karşılaşacak; sağlık profesyonelleri klinik görevlerde Fable 5'ten daha fazla destek alabilecek.
Anthropic'in filtreyi baştan sıkı kurma gerekçesi modelin yetenek seviyesi. Şirketin değerlendirmelerine göre Fable 5 bazı karmaşık biyolojik görevlerde uzmanları geçebiliyor ve başkalarında operasyonel destek verebiliyor. Bu, yeni bir tedavi geliştiren araştırmacıya gerçek katkı sağladığı anlamına geliyor — ama aynı yetenekler kötü niyetli birinin elinde biyolojik silah geliştirmede kullanılabilir. Şirketin kapasite değerlendirmeleri, modelin böyle bir aktöre başka hiçbir yerde bulamayacağı kabiliyetler sunabileceğini gösteriyor.
İşi zorlaştıran şey, biyolojide yararlı ile zararlı kullanımın çoğu zaman aynı bilgiye dayanması. Bir hastalığın tedavisini araştırmak, bazen o hastalığa yol açan tehlikeli bileşikleri üretmeyi gerektiriyor. En açık örnek canlı aşılar: bilim insanlarının önlemeyi hedefledikleri patojenin kendisini üretmeleri gerekiyor. Tansiyon ilacı captopril de benzer bir hikâyeye sahip — geliştirilmesi için yılan zehrinin insanlarda kan basıncını düşüren toksik bileşenlerinin yalıtılması gerekmişti.
Şirket, kötü niyetli aktörlerin tam da bu belirsizliği kullanarak tehlikeli görevleri sıradan araştırma gibi gösterdiğini belirtiyor ve ABD İstihbarat Topluluğu'nun 2026 Yıllık Tehdit Değerlendirmesi'ne atıf yapıyor: sentetik biyoloji ve genom düzenlemedeki ilerlemeler yeni biyolojik tehditlere yol açabilir ve birçok devlet aktörünün etkin saldırı amaçlı biyolojik ve kimyasal silah programı sürdürdüğü değerlendiriliyor.
Yapılan iş, sınıflandırıcının kurallarını tanımlayan metnin yeniden yazılması ve yeni eğitim verisiyle sınıflandırıcının yeniden eğitilmesi oldu; iç ve dış uzmanlardan geri bildirim alındı. Bir kısıt yerinde duruyor: viroloji, toksikoloji ve moleküler tasarım gibi çift kullanımlı sayılan istekler hâlâ Opus 5'e yönlendiriliyor, yani model profesyonel biyoloji araştırması ve ilaç geliştirme için henüz kullanılabilir değil.
Related guide
Step-by-step guide
Türkçe Claude Skill Paketi: Claude'a Türkçe İş Yaptıran 10 Hazır Beceri (Ücretsiz)
TDK imla denetiminden dilekçe yazmaya, KVKK kontrolünden Excel rapor özetine: Claude'a Türkçe işleri doğru yaptıran 10 h... Read the guide →
Step-by-step guide
Claude Code Nasıl Kurulur ve Kullanılır? Windows, Mac ve Linux İçin Adım Adım
Claude Code'u Windows, macOS ve Linux'a kurmak, hesabınızı bağlamak ve ilk projenizde kullanmak için adım adım Türkçe re... Read the guide →
Comments (0)
No comments yet.
Comments are moderated before publishing.