Hastayla konuşan sağlık yapay zekâsı nasıl sınanır?
PatientAgentBench, sentetik hasta kaydı ve gerçekçi klinik senaryolarla sohbet eden bir hasta ajanı üretiyor.
Hastayla doğrudan konuşan bir yapay zekâ sisteminin doğru çalıştığını göstermek, sınav sorularını doğru cevapladığını göstermekten çok farklı bir iş. Sağlık yapay zekâsı soru yanıtlamaktan hasta adına iş yapmaya — randevu almak, reçete yönetmek, belirti değerlendirmek — geçtikçe ölçütlerin de değişmesi gerekiyor.
PatientAgentBench adlı değerlendirme çerçevesi bu ihtiyaca yönelik kurulmuş: tekrarlanabilir ve klinisyen onaylı bir standart. Sistem üç bileşen üretiyor — sentetik bir hasta sağlık kaydı, gerçekçi bir klinik vinyet ve değerlendirilen yapay zekâ sistemiyle konuşan bir hasta ajanı. Her konuşma, yeniden kullanılabilir ölçütlere göre bir dil modeli jüri paneli tarafından puanlanıyor.
Mevcut kıyaslamaların neden yetersiz kaldığı da açıklanıyor. Bir grup kıyaslama tıbbi bilgiyi statik biçimde ölçüyor — tıp sınavı soruları ya da tek turlu, hekime yönelik alışverişler. İkinci grup araç kullanan ajanları sınıyor ama hastayla konuşma yerine sağlayıcı için yapılan teknik görevler üzerinden. İkisi de değerli, ancak hiçbiri hastayla konuşan bir ajanın asıl işini kapsamıyor: hastanın sağlık kaydı üzerinde birden çok turda akıl yürütmek ve ne zaman daha fazla bilgi toplayacağına, ne zaman harekete geçeceğine, ne zaman üst basamağa yönlendireceğine karar vermek.
Puanlama tarafında da bir sorun tespit edilmiş. Mevcut kıyaslamalar genellikle her konuşma için ayrı yazılmış, hekim tarafından hazırlanmış ölçütlere dayanıyor; bunlar yeni ajanlara ve yeni konuşmalara genellenmiyor. Üstelik veri kümesi yayımlandığı anda model eğitiminde kullanılan kamuya açık verinin içine karışıyor ve model kıyaslamanın cevap anahtarını ezberleyerek puanını şişirebiliyor.
Farklı model ailelerinin değerlendirilmesinden çıkan bulgular da paylaşılmış ve tekrar eden klinik eksiklikler saptanmış. İkisi özellikle dikkat çekici: modellerin acil bir durumda kriz kaynaklarını belirtmeyi atlaması ve hiç yapılmamış eylemleri yapılmış gibi ifade etmesi. Daha yetenekli modeller bu açıkları daralttı ancak kapatmadı.
Çerçevenin değeri de burada: sistemleri ölçekte değerlendirerek klinik güvenlik açıklarını belirlemeyi ve iyileştirmeleri hedefe yöneltmeyi mümkün kılıyor. Çünkü bir hasta kendini ateşli ya da umutsuz hissettiğini söylediğinde, güvenli yanıt ile güvensiz yanıt arasındaki farkı belirleyen şey çoğu zaman tıbbi bilgi değil, klinik tasarım oluyor.
Yorumlar (0)
Bu içeriğe henüz yorum yapılmamış.
Yorumlar yayınlanmadan önce moderasyondan geçer.