// YAPAY ZEKÂ
Halüsinasyonu ölçmek: eval seti nasıl kurulur?
7 dk okumanijitech
“Model bazen uyduruyor” bir gözlem, ölçüm değil. Ölçemediğiniz bir sorunu düzelttiğinizi de iddia edemezsiniz. Değerlendirme seti kurmanın pratik yolu.
Yazının tamamı
Yapay zekâ projelerinde en sık duyulan cümlelerden biri şudur: “model bazen uyduruyor”. Bu bir gözlem; ölçüm değil. Ne sıklıkla uydurduğunu, hangi tür sorularda uydurduğunu ve dün yaptığınız değişikliğin bunu artırıp azaltmadığını söylemiyor.
Ölçemediğiniz bir sorunu düzelttiğinizi de iddia edemezsiniz. Değerlendirme seti — kısaca eval — bu boşluğu kapatan şeydir: önceden bilinen sorular ve beklenen cevaplardan oluşan, her değişiklikten sonra çalıştırılan bir test kümesi.
1. Örnekler gerçek olmalı, temsili değil
Eval setinin ilk hatası genellikle burada yapılır: sorular masa başında uydurulur. Oysa sette olması gereken şey, sistemin gerçekten karşılaştığı girdilerdir — kullanıcıların yazdığı gerçek sorular, gelen gerçek belgeler, yaşanan gerçek uç durumlar.
İyi bir sette bulunması gerekenler
- Sık karşılaşılan normal durumlar — hacmin çoğu burada
- Bilinen uç durumlar: eksik alan, beklenmedik format, çok uzun girdi
- Daha önce hata verdiği bilinen örnekler — her düzeltilen hata sete girer
- Cevabı “bilmiyorum” olması gereken sorular
Son madde en çok atlanan ve en çok işe yarayan olanıdır. Bir modelin ne zaman susması gerektiğini bilmesi, doğru cevap vermesi kadar önemlidir.
2. Beklenen cevap yazılmalı
Her örnek için doğru cevabın ne olduğu önceden yazılır. Serbest metin üreten sistemlerde bu zor görünür ama çoğu durumda cevabın tamamı değil, içermesi ve içermemesi gereken unsurlar tanımlanabilir: “şu rakamı vermeli”, “şu kaynağa atıf yapmalı”, “fiyat taahhüdünde bulunmamalı”.
3. Puanlama tek sayıya inmemeli
Tek bir başarı yüzdesi rahatlatıcıdır ama yanıltır. Yüzde doksan başarı, kalan yüzde onun hangi tür sorularda toplandığını söylemez. Set kategorilere ayrılıp her kategori ayrı puanlandığında, düşüşün nerede olduğu görünür hâle gelir.
Halüsinasyon için ayrı bir ölçüt tutmak gerekir: kaynağı olmayan bir bilgi üretildi mi? Bu, “cevap yanlıştı” ile aynı şey değildir. Yanlış cevap bir doğruluk sorunudur; kaynaksız cevap bir güven sorunudur.
4. Set her değişiklikten sonra çalışmalı
Eval setinin asıl değeri ilk çalıştırmada değil, ikincisinde ortaya çıkar. Model değiştiğinde, istem güncellendiğinde ya da bağlam kırpıldığında set yeniden koşar ve hangi kategorinin gerilediğini söyler.
Bu, yazılımdaki regresyon testinin aynısıdır. Fark şu: yazılımda aynı girdi aynı çıktıyı verir, modelde vermeyebilir. Bu yüzden eşik tek bir çalıştırmaya değil, tekrarlı çalıştırmaların ortalamasına bakmalıdır.
Nereden başlamalı
İlk hafta yapılabilecekler
- Son bir ayın gerçek girdilerinden otuz örnek toplayın
- Her biri için beklenen cevabın içermesi ve içermemesi gerekenleri yazın
- Örnekleri üç-dört kategoriye ayırın
- Bir kez koşun; bu sayı iyi ya da kötü değil, sadece başlangıç noktanız
Otuz örnek az görünür ama sıfırdan sonsuz kere daha iyidir. Asıl kazanç, ikinci çalıştırmada başlar.
Bu yazıda geçen ürünler
Sözlükten: Halüsinasyon · Değerlendirme seti (eval)