Önce yüzde seksenin neyin olasılığı olduğunu yazın
Model bir bilgi kartına 0,8 olasılık verdi. Ekip bu skoru “yüzde seksen doğru” diye okuyor. Fakat skor kartın doğruluğunu değil, ilk incelemede düzeltme gerektirme olasılığını temsil ediyor olabilir. Sayıyı yorumlamadan önce hangi olayın olasılığının tahmin edildiğini bilmeniz gerekir. Aynı yüzde, pozitif sınıfın tanımı değiştiğinde farklı bir iş anlamı taşır; genel bir güven veya garanti etiketi değildir.
Bu yazıda yirmi sentetik kart kullanıyoruz. Pozitif olay, kartın ilk inceleme turunda en az bir düzeltme gerektirmesidir. Her kartın aynı tanımlı incelemesi tamamlanmış ve sonucu kaydedilmiştir. p bu olayın tahmin olasılığı, y ise gerçekleşen sonuçtur: düzeltme gerekiyorsa 1, gerekmiyorsa 0. Model çağrısı, gerçek kart incelemesi veya yeni kalibrasyon eğitimi yapılmıyor.
| Kimlikler | Her kartın p değeri | Her kartın y değeri | Adet |
|---|---|---|---|
| P01, P02, P03, P04, P05 | 0,8 | 1 | 5 |
| P06, P07, P08, P09, P10 | 0,8 | 0 | 5 |
| Q01, Q02 | 0,2 | 1 | 2 |
| Q03, Q04, Q05, Q06, Q07, Q08, Q09, Q10 | 0,2 | 0 | 8 |
Tablo aynı p ve y değerini taşıyan kimlikleri yer kazanmak için birlikte gösterir. Bunlar dört gözlem değildir; beş, beş, iki ve sekiz karttan oluşan yirmi gözlemdir. Hesaplarda kimlik sayıları kullanılacaktır. İncelemesi tamamlanmamış bir kart olsaydı y=0 diye doldurulmazdı; bu örneğin kapanmış sonuç kümesinden ayrı gösterilirdi.
Benzer olasılıkları gerçekleşen oranla karşılaştırın
Kalibrasyon, benzer olasılık verilen örneklerde pozitif olayın hangi sıklıkta gerçekleştiğini incelemektir. scikit-learn, iyi kalibre edilmiş ikili bir sınıflandırıcıda yaklaşık 0,8 olasılık alan örneklerin yaklaşık yüzde sekseninin pozitif sınıfa ait olması gerektiğini açıklar. Bu bir tekil kart garantisi değildir; tanımlanmış olayın benzer tahminler arasındaki oranına ilişkin bir yorumdur.Kaynak: scikit-learn — Probability calibration
| Tahmin grubu | Kart | Pozitif sonuç | Gözlenen oran | p − gözlenen |
|---|---|---|---|---|
| p=0,8 | 10 | 5 | 0,5 | 0,3 |
| p=0,2 | 10 | 2 | 0,2 | 0 |
Yüksek grupta 5/10 = 0,5 gözlenmiştir. Tahmin ile bu örnek oranı arasındaki fark 0,3, yani otuz yüzde puandır. Düşük grupta 2/10 = 0,2 bulunur ve örnek farkı sıfırdır. Bu sonuçlar aynı küçük tablonun betimlemesidir. Düşük gruptaki eşitlik, gelecekteki bütün kartlar için kusursuz kalibrasyon kanıtı oluşturmaz.
Tahminlerin pozitif olay sayısına katkısı yüksek grupta 10 × 0,8 = 8, düşük grupta 10 × 0,2 = 2 eder. Toplam tahmin katkısı on, gözlenen pozitif sonuç yedidir. Beklenen katkı ile gerçekleşen sayının aynı olmak zorunda olmadığını koruyun. Bu küçük grupta üç fark görülmesi, modelin bütün kullanım evrenindeki hatasını kesin ölçmez.
Düşük pozitif olasılık düşük doğruluk değildir
Şimdi yalnız açıklama amacıyla bir sınıflandırma eşiği ekleyelim: p en az 0,5 ise “düzeltme gerekir”, daha düşükse “gerekmez” denilsin. Yüksek gruptaki bütün kartlara pozitif karar verilir; beşi doğru, beşi yanlış olur. Düşük grupta bütün kartlara negatif karar verilir; sekizi doğru, ikisi yanlıştır. Bunlar olasılık kalibrasyonundan ayrı bir karar hesabıdır.
| Grup | Karar | Doğru karar | Doğruluk | Kalibrasyonda karşılaştırılan oran |
|---|---|---|---|---|
| p=0,8 | Pozitif | 5 / 10 | 0,5 | Pozitif oranı 0,5 |
| p=0,2 | Negatif | 8 / 10 | 0,8 | Pozitif oranı 0,2 |
Düşük grupta 0,2 tahmini ile 0,8 doğruluğu yan yana koyup “model kendine az güveniyor” demek yanlış olur. p pozitif olayın olasılığıdır; negatif kararın doğru olma olasılığı değildir. Kalibrasyon kontrolünde bu grubun 0,2 tahmini, yine pozitif olay oranı olan 0,2 ile karşılaştırılır. Önce olayı sabitlemek bu anlam kaymasını engeller.
Yüksek grupta gözlenen pozitif oran düşük gruptan büyüktür: 0,5 karşısında 0,2. Bu örnekte gruplar arasında bir sıralama ayrımı görülürken yüksek grubun olasılık düzeyi gözlenen oranla uyuşmaz. Sıralama becerisi ile olasılık değerlerinin uyumu bu nedenle farklı sorulardır. İyi bir aday sıralaması, yüzdelerin doğrudan planlama girdisi olarak doğru olduğunu tek başına göstermez.
Raporu olay, grup ve kapsamla kurun
Pozitif olay: bilgi kartının ilk incelemede düzeltme gerektirmesi. P01–P10 p=0,8; ilk beşte y=1, son beşte y=0. Q01–Q10 p=0,2; ilk ikide y=1, kalan sekizde y=0. Bütün sonuçlar kapanmış ve sentetik. Gruplarda n, pozitif adet, gözlenen oran ve tahmin farkını hesapla. Eşik p>=0,5 ile sınıflandırma doğruluğunu ayrıca göster. p değerini genel doğruluk veya tek kart garantisi diye sunma.
Toplam 20 kart, 7 pozitif sonuç. Tahmin katkısı 8+2=10. Yüksek grup: p=0,8, gözlenen pozitif oranı 0,5, fark 0,3. Düşük grup: p=0,2, gözlenen oran 0,2. 0,5 karar eşiğinde doğru kararlar 5+8=13; genel doğruluk 13/20=%65. Bu %65, tek tek p değerlerinin kalibrasyon karşılığı değildir.
Gerçek değerlendirme planında model sürümü, tahmin zamanı, sonuç tanımı ve gözlem penceresi birlikte tutulmalıdır. Tahmin verildikten sonra sonuç ortaya çıkmalıdır; sonuca bakarak geçmiş tahmini değiştirmeyin. Aynı kartın tekrar kayıtlarını bağımsız yeni gözlemler gibi saymak da grup oranını yanıltabilir. Bu örnekte her kimlik bir kez yer alır ve p değerleri sabittir.
- Skorun hangi olayın olasılığı olduğunu doğrulayın.
- Tahmin gruplarını ve sonuç penceresini incelemeden önce belirleyin.
- Her grupta örnek sayısını oranla birlikte verin.
- Kalibrasyon tablosunu sınıflandırma doğruluğundan ayrı tutun.
Onar kartlık gruplar, kalıcı performans hakkında güçlü bir hüküm vermek için yeterli sayılmaz. Daha geniş ve temsili gözlemler, sürüm değişimleri ve farklı görev koşulları ayrıca incelenmelidir. Bu tabloyu kullanarak eşikleri otomatik değiştirmek veya aynı sonuçlarla yeni kalibrasyon öğrenip yine aynı sonuçlarda başarı ilan etmek bu çalışmanın kapsamı değildir.
Pozitif sonuç sayısı değişirse
Bağımsız bir ikinci sentetik sonuç kümesinde yüksek gruptaki pozitif kart sayısı beş yerine yedi olsun. Düşük grupta iki pozitif kalsın; bütün p değerleri aynı olsun. Yüksek grubun gözlenen oranını, tahmin farkını, toplam pozitif sayısını ve 0,5 eşiğindeki genel doğruluğu hesaplayın. Bu yeni tabloyu ilk gözlemin üstüne yazmayın.
Yüksek grup gözlenen oranı 7/10=0,7; tahmin farkı 0,8−0,7=0,1. Toplam pozitif 7+2=9, tahmin katkısı yine 10. Doğru karar 7+8=15; genel doğruluk %75. Örnek uyum iyileşmiş görünür, fakat küçük sentetik küme gelecekteki performansı kanıtlamaz.
Teslim notunda olasılığın olay tanımını ilk satıra koyun; ardından grup oranını, kart sayısını ve belirsiz kalan yorumu gösterin. Böylece yüzdelik bir model çıktısı, karar toplantısında içeriği belirsiz bir güven puanı olarak dolaşmak yerine kontrol edilebilir bir iddia haline gelir.
Kaynaklar ve doğrulama
- scikit-learn — Probability calibration
Benzer tahmin olasılıklarını gerçekleşen pozitif sınıf oranıyla karşılaştırma; olasılık kalibrasyonu ile ayırt etme gücü farklıdır.
Erişim ve kontrol:
Yöneticiler İçin Yapay Zekâ
Yöneticiler İçin Yapay Zekâ programına model skorunun neyin olasılığı olduğunu açıklayan bir örnekle hazırlanabilirsiniz. Tahmin ve gerçekleşen sonucu aynı kayıt üzerinde göstermek, yüzdeyle ifade edilen iddiayı denetlemeyi sağlar.
- Kuruma özel planlanır