Hiç hata bulmayan sistem de yüzde 95’e ulaşabilir
Bir pilot raporunda ‘Doğruluk yüzde 95’ yazıyor. Bu oranı yorumlamak için önce testte kaç hatalı örnek bulunduğunu sormak gerekir. Bin örneğin yalnızca ellisi hatalıysa, bütün örneklere normal diyen basit bir kural 950 doğru karar verir. Hataların tamamını kaçırdığı halde genel doğruluğu yüzde 95 olur. Yüksek görünen sayı, kontrol etmek istediğiniz davranışı temsil etmeyebilir.
Google’ın sınıflandırma rehberi, genel doğruluğun dengesiz sınıflarda tek başına yanıltıcı olabileceğini ve ölçüt seçiminin farklı hataların sonuçlarına bağlı olduğunu açıklar. Burada pozitif sınıfı ‘baskı hatası var’ olarak tanımlıyoruz. Bu tanımı baştan yazmak önemlidir; farklı ekipler pozitifi normal ürün olarak kullanırsa aynı terimler farklı olayları anlatmaya başlar.Kaynak: Google Machine Learning Crash Course — Accuracy, recall, precision
Aşağıdaki sayılar, demo etiketlerindeki baskı bozulmasını sınıflandıran tamamen sentetik bir test içindir. Güvenlik açısından kritik ürün kabulü veya gerçek hat kontrolü için eşik önerisi değildir. Amaç bir model eğitmek değil, bir pilot tablosundan hangi sonucun çıkarılabileceğini ve hangi bilginin eksik kaldığını görmektir.
Önce dört hücreyi doğru adlandırın
| Model kararı | Gerçekte hatalı | Gerçekte normal | Satır toplamı |
|---|---|---|---|
| Hatalı dedi | 40 | 30 | 70 |
| Normal dedi | 10 | 920 | 930 |
| Gerçek sınıf toplamı | 50 | 950 | 1000 |
Modelin hatalı dediği ve gerçekten hatalı olan 40 kayıt doğru yakalamadır: TP. Hatalı olduğu halde normal dediği 10 kayıt kaçırmadır: FN. Normal olduğu halde hatalı dediği 30 kayıt yanlış alarmdır: FP. Normal olup normal dediği 920 kayıt ise doğru negatif karardır: TN. Satır ve sütun toplamları aynı bin kayda dönmelidir; dışarıda kalan örnek varsa ayrıca gösterilmelidir.
Gerçek sınıf dediğimiz etiketin de nasıl oluşturulduğunu kontrol edin. İki değerlendiricinin anlaşamadığı kayıtlar sessizce normal yapılmamalıdır. Test parçaları geliştirme örneklerinden ayrılmalı; aynı fiziksel etiketin benzer fotoğrafları iki tarafta bulunarak sonucu kolaylaştırmamalıdır. Işık, ürün çeşidi veya çekim düzeni eksikse, bu tabloyu görünmeyen koşullara genellemek mümkün değildir.
Her oran farklı bir soruyu cevaplar
| Ölçüt | Hesap | Sonuç | Yanıtladığı soru |
|---|---|---|---|
| Doğruluk · accuracy | (40 + 920) / 1000 | %96 | Bütün kararların kaçı doğru? |
| Yakalama · recall | 40 / (40 + 10) | %80 | Gerçek hataların kaçı bulundu? |
| Pozitif tahmin isabeti · precision | 40 / (40 + 30) | %57,1 | Hatalı denenlerin kaçı gerçekten hatalı? |
| İnceleme adayı | 40 + 30 | 70 etiket | Her alarm incelenecekse kaç kayıt var? |
Bu tanımlar Google’ın rehberindeki sınıflandırma ölçütleriyle uyumludur. Paydaları birbirinin yerine kullanmayın: 10 kaçırmayı bin örneğe bölmek yüzde 1 verir, fakat hatalı elli ürün içindeki kaçırma oranı yüzde 20’dir. İkisi aynı olayı farklı paydalarla anlatır. Karar toplantısında yalnızca yüzdeyi değil, payı ve paydayı da göstermek bu karışıklığı önler.Kaynak: Google Machine Learning Crash Course — Accuracy, recall, precision
Bağlam: Baskı hatası sınıflandırma pilotunu değerlendiriyorum. Pozitif sınıf hatalı etikettir. Girdi: [A matrisi] ve [B ayarının sayıları]. Görev: TP, FN, FP ve TN toplamlarını kontrol et. Doğruluk, recall, precision ve alarm sayısını ayrı hesapla. Kısıtlar: Genel doğruluğu tek başına başarı ilan etme. Verilmeyen maliyet, güven aralığı veya üretim kazancı uydurma. Çıktı: Hesap tablosu ve hangi iş kararının eksik olduğunu gösteren kısa not. Kontrol: Her oran kendi paydasına dayanmalı; modelin hatalı dediği sayı gerçek hatalı sayısıyla karışmamalı.
Daha yüksek doğruluk, daha fazla kaçırma anlamına gelebilir
| Ayar | TP | FN | FP | TN | Doğruluk | Recall | Precision |
|---|---|---|---|---|---|---|---|
| A | 40 | 10 | 30 | 920 | %96 | %80 | %57,1 |
| B | 30 | 20 | 10 | 940 | %97 | %60 | %75 |
B ayarında model daha az alarm üretiyor: 40 etiket. Pozitif tahmin isabeti yükseliyor ve genel doğruluk yüzde 97’ye çıkıyor. Buna karşılık kaçırılan hata 10’dan 20’ye çıkıyor. Bu yüzden ‘B daha iyi’ demek için hangi hatanın iş açısından ne anlama geldiğini bilmek gerekir. Bu tablo bir eşik değişiminin olası etkisini göstermek için hazırlanmıştır; gerçek model skorlarından çıkarılmış deney sonucu değildir.
Her alarmın insan incelemesi için 20 saniye gerektirdiğini varsayalım. A için 70 × 20 = 1.400 saniye, yani 23 dakika 20 saniye; B için 40 × 20 = 800 saniye, yani 13 dakika 20 saniye gerekir. On dakikalık fark, kaçırılan ek on hatanın kabul edilebilir olduğunu göstermez. Ayrıca bunlar yalnızca alarm inceleme süreleridir; normal denen ürünlerin örnek kontrolü ve diğer süreç işleri dahil değildir.
A ve B’nin toplam doğrulukları sırasıyla yüzde 96 ve 97. B daha az inceleme adayı üretirken gerçek hataları yakalama oranını yüzde 80’den yüzde 60’a düşürüyor. Hata kaçırma sınırı, yanlış alarm yükü ve insan inceleme düzeni önceden belirlenmeden ayar seçimi yapılmayacak. Test kümesinin gerçek üretim koşullarını temsili ayrıca değerlendirilecek.
Ölçütleri sorumlu bir kabul kararına bağlayın
A ve B sayılarını bir karar tablosuna taşıyalım. Yalnız bu sentetik etiket örneğinde en fazla 15 kaçırma ve 25 dakika alarm inceleme kapasitesi koşulu seçilsin. Bu eşikler gerçek üretim önerisi değildir. Ayrıca kayıtların yalnız gündüz çekimlerini temsil ettiği, gece koşulunun henüz sınanmadığı varsayılsın. Sayısal koşulu karşılamak ile bütün üretim ortamına uygunluk ayrı sonuçlardır.
| Ayar | Kaçırma ≤15 | İnceleme ≤25 dk | Koşul kapsamı | Karar |
|---|---|---|---|---|
| A | 10; geçer | 23 dk 20 sn; geçer | Yalnız gündüz | Gündüz kapsamı için aday; geceye genişletme yok |
| B | 20; geçmez | 13 dk 20 sn; geçer | Yalnız gündüz | Kaçırma koşulu sağlanmadı |
Kalite sorumlusu hata tanımını ve kaçırma sınırını, operasyon sorumlusu inceleme kapasitesini, pilot sahibi test kapsamını doğrular. Önce kapsam, ardından ayrılmış test, sonra bu karar tablosu okunur. Mevcut görsel kalite pilotu örneği ilk aşamayı gösterir. Oradaki metal kapak ve burada kullanılan baskı etiketi farklı senaryolardır; eşikleri veya örnek sayılarını birbirine taşımayın. Model, belge veya çekim koşulu değişirse ilgili kabul kanıtı yeniden üretilmelidir.
Raporun sorumlusu hangi soruları cevaplamalı?
- Pozitif sınıf ve insan etiketleme kuralı açık mı?
- Geliştirme ve test örnekleri ayrılmış mı; testte dışarıda bırakılan kayıt var mı?
- Işık ve ürün grupları ayrı incelendiğinde aynı sorun sürüyor mu?
- Yanlış alarm ve kaçırma sayıları, ilgili paydalarıyla birlikte gösteriliyor mu?
- İnsan inceleme kapasitesi ve kabul sınırı kimin kararıyla belirlendi?
Az sayıda hatalı örnekle bulunan oranların belirsizliğini de görünür tutun. Bu yazının bin örneği, gerçek pilotunuz için yeterli örneklem sayısı önerisi değildir. Örnek sayısı, hedeflenen hata türleri ve kabul kararının sonuçları birlikte değerlendirilmelidir. Model veya çekim düzeni değiştiğinde eski oranı yeni sürümün sonucu gibi kullanmayın; karşılaştırma koşullarını yeniden kurun.
Küçük alıştırma: A matrisinde normal kabul edilen ve modelin de normal dediği beş örneğin gerçekte hatalı olduğu anlaşılsın. Yeni değerler TP 40, FN 15, FP 30 ve TN 915 olur. Toplam yine bindir; doğruluk yüzde 95,5, yakalama yaklaşık yüzde 72,7’dir. Model değişmeden etiket düzeltmesi sonucu değiştirmiştir. Bu yüzden değerlendirme verisinin sürümü de raporun parçasıdır.
Bir sonraki pilot toplantısında tek bir doğruluk yüzdesi yerine dört hücreyi ve karar notunu yan yana getirin. Hangi hatanın azaldığını, hangisinin arttığını ve bu farkı kimin değerlendireceğini açık yazdığınızda sayıların iş kararına katkısı daha net hale gelir.
Kaynaklar ve doğrulama
- Google Machine Learning Crash Course — Accuracy, recall, precision
Doğruluk, yakalama oranı ve pozitif tahmin isabetinin tanımları; sınıf dengesizliği ve eşik değişimindeki ödünleşmeler. Sayılar özgün sentetik örnektir.
Erişim ve kontrol:
Üretimde Yapay Zekâ
Üretimde Yapay Zekâ programında kalite problemini veri, test koşulları ve insan kararıyla birlikte tanımlayabilirsiniz. Bu ölçüm tablosunu, pilot değerlendirme şablonundaki kabul ve durdurma koşullarını somutlaştırmak için kullanın.
- Kuruma özel planlanır