Hiç hata bulmayan sistem de yüzde 95’e ulaşabilir

Bir pilot raporunda ‘Doğruluk yüzde 95’ yazıyor. Bu oranı yorumlamak için önce testte kaç hatalı örnek bulunduğunu sormak gerekir. Bin örneğin yalnızca ellisi hatalıysa, bütün örneklere normal diyen basit bir kural 950 doğru karar verir. Hataların tamamını kaçırdığı halde genel doğruluğu yüzde 95 olur. Yüksek görünen sayı, kontrol etmek istediğiniz davranışı temsil etmeyebilir.

Google’ın sınıflandırma rehberi, genel doğruluğun dengesiz sınıflarda tek başına yanıltıcı olabileceğini ve ölçüt seçiminin farklı hataların sonuçlarına bağlı olduğunu açıklar. Burada pozitif sınıfı ‘baskı hatası var’ olarak tanımlıyoruz. Bu tanımı baştan yazmak önemlidir; farklı ekipler pozitifi normal ürün olarak kullanırsa aynı terimler farklı olayları anlatmaya başlar.Kaynak: Google Machine Learning Crash Course — Accuracy, recall, precision

Aşağıdaki sayılar, demo etiketlerindeki baskı bozulmasını sınıflandıran tamamen sentetik bir test içindir. Güvenlik açısından kritik ürün kabulü veya gerçek hat kontrolü için eşik önerisi değildir. Amaç bir model eğitmek değil, bir pilot tablosundan hangi sonucun çıkarılabileceğini ve hangi bilginin eksik kaldığını görmektir.

Önce dört hücreyi doğru adlandırın

A ayarı · sentetik testteki 1.000 etiket
Model kararıGerçekte hatalıGerçekte normalSatır toplamı
Hatalı dedi403070
Normal dedi10920930
Gerçek sınıf toplamı509501000

Modelin hatalı dediği ve gerçekten hatalı olan 40 kayıt doğru yakalamadır: TP. Hatalı olduğu halde normal dediği 10 kayıt kaçırmadır: FN. Normal olduğu halde hatalı dediği 30 kayıt yanlış alarmdır: FP. Normal olup normal dediği 920 kayıt ise doğru negatif karardır: TN. Satır ve sütun toplamları aynı bin kayda dönmelidir; dışarıda kalan örnek varsa ayrıca gösterilmelidir.

Gerçek sınıf dediğimiz etiketin de nasıl oluşturulduğunu kontrol edin. İki değerlendiricinin anlaşamadığı kayıtlar sessizce normal yapılmamalıdır. Test parçaları geliştirme örneklerinden ayrılmalı; aynı fiziksel etiketin benzer fotoğrafları iki tarafta bulunarak sonucu kolaylaştırmamalıdır. Işık, ürün çeşidi veya çekim düzeni eksikse, bu tabloyu görünmeyen koşullara genellemek mümkün değildir.

Her oran farklı bir soruyu cevaplar

A ayarı için bağımsız hesap
ÖlçütHesapSonuçYanıtladığı soru
Doğruluk · accuracy(40 + 920) / 1000%96Bütün kararların kaçı doğru?
Yakalama · recall40 / (40 + 10)%80Gerçek hataların kaçı bulundu?
Pozitif tahmin isabeti · precision40 / (40 + 30)%57,1Hatalı denenlerin kaçı gerçekten hatalı?
İnceleme adayı40 + 3070 etiketHer alarm incelenecekse kaç kayıt var?

Bu tanımlar Google’ın rehberindeki sınıflandırma ölçütleriyle uyumludur. Paydaları birbirinin yerine kullanmayın: 10 kaçırmayı bin örneğe bölmek yüzde 1 verir, fakat hatalı elli ürün içindeki kaçırma oranı yüzde 20’dir. İkisi aynı olayı farklı paydalarla anlatır. Karar toplantısında yalnızca yüzdeyi değil, payı ve paydayı da göstermek bu karışıklığı önler.Kaynak: Google Machine Learning Crash Course — Accuracy, recall, precision

Pilot sonuçlarını yorumlama promptu
Bağlam: Baskı hatası sınıflandırma pilotunu değerlendiriyorum. Pozitif sınıf hatalı etikettir.
Girdi: [A matrisi] ve [B ayarının sayıları].
Görev: TP, FN, FP ve TN toplamlarını kontrol et. Doğruluk, recall, precision ve alarm sayısını ayrı hesapla.
Kısıtlar: Genel doğruluğu tek başına başarı ilan etme. Verilmeyen maliyet, güven aralığı veya üretim kazancı uydurma.
Çıktı: Hesap tablosu ve hangi iş kararının eksik olduğunu gösteren kısa not.
Kontrol: Her oran kendi paydasına dayanmalı; modelin hatalı dediği sayı gerçek hatalı sayısıyla karışmamalı.

Daha yüksek doğruluk, daha fazla kaçırma anlamına gelebilir

Aynı sentetik test kümesinde iki ayar
AyarTPFNFPTNDoğrulukRecallPrecision
A401030920%96%80%57,1
B302010940%97%60%75

B ayarında model daha az alarm üretiyor: 40 etiket. Pozitif tahmin isabeti yükseliyor ve genel doğruluk yüzde 97’ye çıkıyor. Buna karşılık kaçırılan hata 10’dan 20’ye çıkıyor. Bu yüzden ‘B daha iyi’ demek için hangi hatanın iş açısından ne anlama geldiğini bilmek gerekir. Bu tablo bir eşik değişiminin olası etkisini göstermek için hazırlanmıştır; gerçek model skorlarından çıkarılmış deney sonucu değildir.

Her alarmın insan incelemesi için 20 saniye gerektirdiğini varsayalım. A için 70 × 20 = 1.400 saniye, yani 23 dakika 20 saniye; B için 40 × 20 = 800 saniye, yani 13 dakika 20 saniye gerekir. On dakikalık fark, kaçırılan ek on hatanın kabul edilebilir olduğunu göstermez. Ayrıca bunlar yalnızca alarm inceleme süreleridir; normal denen ürünlerin örnek kontrolü ve diğer süreç işleri dahil değildir.

Elle hazırlanmış pilot yorum notu
A ve B’nin toplam doğrulukları sırasıyla yüzde 96 ve 97. B daha az inceleme adayı üretirken gerçek hataları yakalama oranını yüzde 80’den yüzde 60’a düşürüyor. Hata kaçırma sınırı, yanlış alarm yükü ve insan inceleme düzeni önceden belirlenmeden ayar seçimi yapılmayacak. Test kümesinin gerçek üretim koşullarını temsili ayrıca değerlendirilecek.

Raporun sorumlusu hangi soruları cevaplamalı?

  • Pozitif sınıf ve insan etiketleme kuralı açık mı?
  • Geliştirme ve test örnekleri ayrılmış mı; testte dışarıda bırakılan kayıt var mı?
  • Işık ve ürün grupları ayrı incelendiğinde aynı sorun sürüyor mu?
  • Yanlış alarm ve kaçırma sayıları, ilgili paydalarıyla birlikte gösteriliyor mu?
  • İnsan inceleme kapasitesi ve kabul sınırı kimin kararıyla belirlendi?

Az sayıda hatalı örnekle bulunan oranların belirsizliğini de görünür tutun. Bu yazının bin örneği, gerçek pilotunuz için yeterli örneklem sayısı önerisi değildir. Örnek sayısı, hedeflenen hata türleri ve kabul kararının sonuçları birlikte değerlendirilmelidir. Model veya çekim düzeni değiştiğinde eski oranı yeni sürümün sonucu gibi kullanmayın; karşılaştırma koşullarını yeniden kurun.

Küçük alıştırma: A matrisinde normal kabul edilen ve modelin de normal dediği beş örneğin gerçekte hatalı olduğu anlaşılsın. Yeni değerler TP 40, FN 15, FP 30 ve TN 915 olur. Toplam yine bindir; doğruluk yüzde 95,5, yakalama yaklaşık yüzde 72,7’dir. Model değişmeden etiket düzeltmesi sonucu değiştirmiştir. Bu yüzden değerlendirme verisinin sürümü de raporun parçasıdır.

Bir sonraki pilot toplantısında tek bir doğruluk yüzdesi yerine dört hücreyi ve karar notunu yan yana getirin. Hangi hatanın azaldığını, hangisinin arttığını ve bu farkı kimin değerlendireceğini açık yazdığınızda sayıların iş kararına katkısı daha net hale gelir.

Kaynaklar ve doğrulama

İlgili okumalar

Üretimde Yapay Zekâ

Üretimde Yapay Zekâ programında kalite problemini veri, test koşulları ve insan kararıyla birlikte tanımlayabilirsiniz. Bu ölçüm tablosunu, pilot değerlendirme şablonundaki kabul ve durdurma koşullarını somutlaştırmak için kullanın.

  • Kuruma özel planlanır