GitHub, yapay zekâ kod inceleme araçları için açık benchmark ReviewBench'i yayınladı
GitHub, gerçek pull request'ler üzerine kurulu, kalibre edilmiş değerlendirme sunan açık kaynaklı ReviewBench benchmark'ını duyurdu.
GitHub, yapay zekâ destekli kod inceleme (code review) araçlarını ölçmek için geliştirilen açık bir benchmark olan ReviewBench'i yayınladı. Platform, GitHub Blog'daki duyurusunda yeni aracın gerçek GitHub pull request'lerinden oluşan bir veri kümesi, çok kaynaklı doğruluk verisi (ground truth), kalibre edilmiş değerlendirme yöntemi ve gerçek üretim ortamına hizalanmış metrikler üzerine kurulu olduğunu açıkladı.
Benchmark'ın amacı, kod inceleme yapan yapay zekâ ajanlarının performansını standart bir ölçek üzerinden karşılaştırılabilir kılmak. Son dönemde GitHub Copilot benzeri araçların yanında çok sayıda bağımsız kod inceleme ajanı piyasaya sürüldü; ancak bu araçların ne kadar iyi çalıştığını gösteren ortak ve güvenilir bir ölçüt eksikliği sektörün sık dile getirdiği sorunlardan biriydi. ReviewBench, sentetik ya da el yapımı test senaryoları yerine temsil gücü yüksek gerçek pull request'ler kullanarak bu boşluğu doldurmayı hedefliyor.
Çok kaynaklı doğruluk verisi yaklaşımı, bir pull request'teki bir sorunun gerçekten hata olup olmadığının tek bir kaynağa değil, birden fazla sinyale dayanarak belirlenmesi anlamına geliyor. Bu yöntem, değerlendirme sonuçlarının tek bir yorumcunun görüşüne göre şekillenmesini engelliyor. Kalibre edilmiş değerlendirme ise modellerin ürettiği uyarıların ne kadarının gerçekten doğru, ne kadarının gereksiz olduğunu ayrıştırmayı mümkün kılıyor.
ReviewBench'in açık bir benchmark olarak yayınlanması, geliştiricilerin ve araştırmacıların kendi kod inceleme ajanlarını aynı veri kümesi ve metriklerle test edip sonuçları karşılaştırabileleri anlamına geliyor. Bu yönüyle duyuru özellikle yapay zekâ geliştirme araçları üreten ekipleri ve bu araçları seçmek durumunda olan mühendislik ekiplerini ilgilendiriyor.
Comments (0)
No comments yet.
Comments are moderated before publishing.