Daha yüksek skor sınırı hangi yanıtları çıkarıyor?

AI pilotunda yanıt seçim eşiğini 0,80’den 0,90’a yükseltiyorsunuz. Daha az yanıt verileceğini biliyorsunuz; kalanların daha doğru olacağını da varsayıyorsunuz. Ancak skor sıralamasının gerçek hataları her aşamada doğru ayırdığı garanti değildir. Aradan çıkan kayıtlar doğru yanıtlarsa, aynı yanlışlar daha küçük bir paydada kalabilir. Eşik daha yüksek olduğu halde yanıtlananlar içindeki hata oranı artar. Bu olasılığı toplam yüzdeye bakarak değil, eşikler arasında çıkan kayıtları izleyerek sınayabilirsiniz.

Mevcut kapsam ve doğruluk hesabını bu kez sabit bir skor sıralamasına uygulayacağız. Özgün katkı, her geçişte çıkarılan doğru ve yanlış yanıtları sayıp oran değişiminin nedenini hesaplamaktır. Sekiz sentetik kaydın yanıtı ve doğruluk anahtarı değişmez. Bir model yeniden eğitilmez; farklı model ayarlarının ürettiği farklı yanıtlar karşılaştırılmaz. Yalnız sunulacak yanıtları seçen eşik değişir.

Skoru, anahtarı ve seçim kuralını sabitleyin

Sentetik çevrim dışı sonuç kaydı
KimlikSeçim skoruHazır yanıt doğru mu?
K10,951
K20,900
K30,851
K40,801
K50,750
K60,701
K70,650
K80,601

Skorlar sıralama amacı taşır; kalibre edilmiş doğru olma olasılığı oldukları varsayılmaz. Doğruluk anahtarında bir doğruyu, sıfır yanlışı gösterir. Bütün hazır yanıtlar çevrim dışı kontrol edilmiş kabul edilir. Canlı akışta yanıtsız sorunun doğruluğunun kendiliğinden bilindiği söylenmiyor. Seçim kuralı skor>=t olarak tanımlıdır; eşik değerinin kendisi dahildir. Böylece 0,90 eşiğinde K2 listede kalır.

Seçici sınıflandırmada kapsam, seçilen örneklerin bütün kümedeki payı; seçilmiş risk ise seçim koşulundaki kayıpla ilişkilidir. Geifman ve El-Yaniv’in çalışmasının bu tanımlarını, burada sıfır/bir hata sayımına uyguluyoruz. Dolayısıyla hata oranı yanlış yanıt sayısının seçilen yanıt sayısına bölümüdür. Çalışmanın risk garantisi sağlayan algoritması uygulanmaz; aşağıdaki eşik denemeleri böyle bir garanti taşımaz.Kaynak: Geifman ve El-Yaniv — Selective classification for deep neural networks

İlk artışta yanlışlar daha yoğun bir gruptan çıkar

0,60 eşiğinde sekiz yanıtın tamamı seçilir. K2, K5 ve K7 yanlıştır; hata oranı 3/8=%37,5’tir. Eşiği 0,80’e yükseltince K5–K8 çıkar. Çıkan dört kayıtta iki yanlış ve iki doğru vardır; bu alt kümenin hata oranı yüzde 50’dir. Başlangıç grubundan daha yüksek hata payı taşıyan bölüm çıkarıldığı için kalan dört yanıtta hata oranı 1/4=%25 olur.

Elle hazırlanmış eşik sonuçları
EşikSeçilenYanlışKapsamHata oranı
0,6083%100%37,5
0,8041%50%25
0,9021%25%50
1,0000%0Tanımsız

Hatanın düşmesi yeni bir doğru yanıt üretildiği anlamına gelmez. Kalan K1–K4’ün içeriği aynıdır. Seçim bazı doğru yanıtları da dışarıda bırakmıştır. Bu yüzden oran değişimini, modelin aynı görevi daha iyi çözmesi diye raporlamayın. Burada gösterilen şey belirli sabit sonuçlar üzerinde eleme yapıldığında pay ve paydanın nasıl değiştiğidir.

İkinci artış iki doğru yanıtı çıkarıyor

Özgün geçiş izi
GeçişÇıkan kimliklerÇıkan doğruÇıkan yanlışÇıkan grubun hata oranı
0,60 → 0,80K5, K6, K7, K822%50
0,80 → 0,90K3, K420%0

0,80’den 0,90’a geçerken K3 ve K4 çıkar. İkisi de doğrudur. K2’nin yanlış yanıtı ise 0,90 skoruyla kalır. Yeni grupta iki yanıt ve bir yanlış vardır; hata yüzde 50’ye yükselir. Yanlış sayısı artmadığı halde oran artmıştır. Başlangıçta yanlış olan bir yanıtı düzeltmekle, iki doğru yanıtı seçimden çıkarmanın sonuçlarını bu iz açıkça ayırır.

Yükselen eşik seçilen kümeyi küçültür; bu bir küme ilişkisi sonucudur. Aynı yönde her adımda düşen hata oranı ise ayrıca doğru bir skor sıralaması gerektirir. Bu küçük örnek, belirli bir eşik artışının kaliteyi mutlaka yükselteceği iddiasına karşı örnektir. Bütün gerçek sistemlerde eşik artışı kötüleşir diye de genellenmez. Hangi kayıtların çıktığı incelenmeden yalnız eşik sayısından sonuç çıkarılamaz.

Oranın yönünü pay ve paydadan türetin

Özgün oran karşılaştırması
Başlangıç: n seçilen yanıt, E yanlış; hata E/n.
Çıkarılan: k yanıt, r yanlış; 0<k<n.
Kalan hata: (E−r)/(n−k).
Çıkan grubun hata oranı r/k, başlangıç E/n’den küçükse kalan hata oranı yükselir; büyükse düşer; eşitse aynı kalır.

İkinci geçişte n=4, E=1, k=2 ve r=0’dır. Çıkan grubun hata oranı 0/2=0, başlangıç oranı 1/4=0,25’tir. Daha temiz alt küme çıkarılınca kalan oran (1−0)/(4−2)=0,50 olur. Birinci geçişte ise 2/4=0,50, başlangıç 3/8=0,375’ten büyüktür; kalan oran düşer. Bu ilişki verilen sayılardan türetilmiş aritmetiktir, istatistiksel güven sınırı değildir.

Hiç kayıt çıkmıyorsa k=0 olur ve iki seçilmiş oran aynıdır; çıkarılan grubun oranını hesaplamaya gerek yoktur. Bütün kayıtlar çıkarsa k=n olur ve kalan hata paydası sıfırlanır. 1,00 eşiğindeki sıfır yanlış, sıfır hata oranı olarak yazılmaz: yanıt yok, oran tanımsızdır. Formülün koşullarını açık tutmak, sınır durumlarında uydurulmuş bir kalite sayısını önler.

AI’dan oran yönünün gerekçesini isteyin

Kopyalanabilir eşik geçişi denetimi
K1–K8 skorları 0,95/0,90/0,85/0,80/0,75/0,70/0,65/0,60; doğruluk sırası 1/0/1/1/0/1/0/1. Skor>=t ile 0,60→0,80→0,90 geçişlerini izle. Her geçişte kalan ve çıkan kimlikleri, yanlış sayılarını ve hata oranlarını yaz. Çıkan grubun hata oranını başlangıçla karşılaştırarak değişimin yönünü açıkla. Yanıtları veya skorları değiştirme. Eşik artışını otomatik kalite artışı sayma; 1,00 eşiğinde oranı tanımsız bırak.

Kontrolde eski seçilen kümenin, çıkan ve kalan iki ayrık kümenin birleşimine eşit olduğunu doğrulayın. Doğru ve yanlış sayıları da aynı şekilde korunmalıdır. Bu kontrol yalnız yüzdeleri yeniden hesaplamaktan farklıdır; yanlış kimliklerin çıkarılmasını yakalar. Sonuçlara bakıp en hoş eşiği seçerek gelecekte aynı performansı beklemeyin. Gerçek karar için önceden belirlenmiş kapsam ve hata koşullarıyla ayrı değerlendirme verisi gerekir.

Aradaki eşiği kendiniz hesaplayın

Başlangıç eşiği yine 0,80 olsun; bu kez yalnız 0,85’e yükseltin. Skorları değiştirmeden hangi kayıt çıkar, kalan hata oranı ne olur? Sonra geçiş formülündeki n, E, k ve r değerlerini yazın. Eşik dahil kuralını özellikle koruyun; 0,85 skorundaki kaydı yanlışlıkla çıkarmayın.

Alıştırmanın cevabı
Yalnız K4 çıkar; K1/K2/K3 kalır. n=4, E=1, k=1, r=0. Kalan hata 1/3≈%33,3; kapsam 3/8=%37,5. K3 tam eşikte olduğu için kalır. Doğru bir yanıt çıkarıldı, yanlış sayısı 1 kaldı ve hata oranı yükseldi.

Eşik değişikliği raporuna eski ve yeni yüzdeyle birlikte çıkan kimliklerin hata dağılımını ekleyin. Böylece ekip değişimin nedenini inceleyebilir ve yanlış bir kalite iddiasını ayırabilir. Bu uygulamanın teslimi en iyi eşik değildir; aynı yöndeki eşik değişimlerinin neden farklı hata yönleri üretebildiğini açıklayan yeniden hesaplanabilir bir kayıt zinciridir.

Kaynaklar ve doğrulama

İlgili okumalar

Yöneticiler İçin Yapay Zekâ

Yöneticiler İçin Yapay Zekâ eğitimine eşik değişiminden önce ve sonra seçilen görev kimliklerini getirebilirsiniz. Hangi doğru ve yanlış yanıtların çıktığını izlemek, daha yüksek eşiğin neden otomatik kalite garantisi olmadığını tartışmayı sağlar.

  • Kuruma özel planlanır