Bilim

Makine öğrenmesi araştırma ajanları neden ezberlemiyor?

Yeni bir çalışma, yapay zekâ ajanlarının verinin sıkıştırılabilir modellerini öğrendiğini ve ezberlemeye yer kalmadığını öne sürüyor.

Makine öğrenmesi araştırma ajanları neden ezberlemiyor?
Makine öğrenmesi araştırma ajanları neden ezberlemiyor?

Makine öğrenmesinin özü genellemedir, ezberleme değil. Bir modelin eğitildiği veride iyi ama yeni veride kötü sonuç vermesine aşırı öğrenme deniyor ve bunun standart savunması verinin bir kısmını ayırıp eğitimde kullanmamak.

Ancak bu güvencenin bir koşulu var: ayrılan kümenin gerçekten görülmemiş kalması. Performansı orada ölçüp sonuca göre eğitimi değiştirir, tekrar ölçer ve daha iyi sayılar peşinde koşarsanız, o küme artık görülmemiş değil — eğitim sürecinin parçası hâline gelmiş olur.

Makine öğrenmesi araştırma ajanları neden ezberlemiyor?
Görsel: Amazon Science

Buradan bir bulmaca doğuyor. Gerçek makine öğrenmesi araştırması tam olarak böyle işliyor: herkes yıllarca değişmeyen bir avuç kıyaslama veri kümesiyle performans ölçüyor. Topluluk devasa ve dağıtık bir döngüyü tekrarlıyor — modeli kıyaslamada değerlendir, eğitimi revize et, yeniden değerlendir, yayımla ve bir sonraki grup biraz daha iyileştirsin. Ders kitabına göre bu süreç aşırı öğrenmeyi patlatmalıydı; sıralamalar kıyaslamada iyi görünen ama gerçekte işe yaramayan modellerle dolmalıydı. Öyle olmuyor.

Amazon araştırmacılarının önerdiği açıklama sıkıştırılabilirlik üzerine kurulu: ajanların bulduğu başarılı stratejiler son derece sıkıştırılabilir oluyor ve bu yapılarda ezberlemeye yer kalmıyor.

Bunu sınamak için kurdukları deney çarpıcı. Başarılı bir ajanın stratejisi bir bilgi darboğazından geçiriliyor — 16 jeton kadar dar bir alandan. Ardından hiçbir hafızası olmayan yeni bir ajana yalnızca bu sıkıştırılmış özet veriliyor. Yeni ajan, orijinalin performansını yeniden üretebiliyor. Bu da stratejinin veriyi ezberlemek yerine gerçek bir yapı yakaladığı anlamına geliyor.

Yöntem aynı zamanda bir tanı aracı sunuyor: gerçekten aşırı öğrenen stratejiler sıkıştırma testini geçemiyor. Bu stratejilerin doğrulama kümesine özgü kazanımları, darboğazdan geçirildiklerinde kayboluyor.

Çalışmanın bir yan sonucu da dil modellerinin neden bu kadar yetenekli olduğuna dair bir açıklama sunuyor: büyük dil modelleri güçlü sıkıştırma çözücüleri. Taşıdıkları geniş dünya bilgisi sayesinde, uzmanların kısaltılmış notlarına benzeyen son derece kısa istemlerden eksiksiz makine öğrenmesi hatlarını yeniden kurabiliyorlar.

Yorumlar (0)

Bu içeriğe henüz yorum yapılmamış.

E-posta adresiniz yayımlanmaz, yalnızca moderasyon için saklanır. Ayrıntı için gizlilik politikasını. Giriş yaparsanız yorumunuz adınıza kaydolur.

Yorumlar yayınlanmadan önce moderasyondan geçer.