Gözlemde sıfır hata, gerçek olasılıkta sıfır demek değildir
Ekibiniz bilgi kartı hazırlayan bir asistanı on görevle sınadı. Tanımladığınız hatalardan hiçbirini görmediniz. Rapor “yüzde 100 güvenilir” diyorsa gözlem ile genelleme birbirine karışmıştır. Bildiğiniz şey bu on görevde hata gözlenmediğidir. Görmediğiniz bütün görevler hakkında aynı kesinliği söylemek için örneklemin nasıl seçildiğini ve ne kadar belirsizlik kaldığını incelemek gerekir.
NIST’in tam binom güven sınırları açıklaması, küçük örneklem veya az hata durumunda kullanılan simetrik yaklaşık sınırların yetersiz kalabileceğini belirtir; tek ve çift taraflı sınırları ayırır. Bu yazıda yalnızca sıfır hata özel durumu için tek taraflı bir üst sınır hesaplayacağız. Bir modelin gerçek başarısı ölçülmez; bütün kayıtlar ve örneklem senaryoları açıklama amacıyla hazırlanmıştır.Kaynak: NIST Dataplot — Exact Binomial
Hata tanımını önce sabitleyin. Bu alıştırmada gerekli alanı eksik bırakma veya verilen kaynak kodunu yanlış aktarma, görev için hata kabul edilir. Bir görevde iki hata olsa da ikili sonuç bir hatalı görevdir. İncelenen şey hata sayısının toplamı değil, rastgele seçilen bir görevin bu tanıma göre hatalı olma olasılığıdır.
Hesap ancak tanımlı bir örnekleme koşulunda anlam taşır
p: Sabit görev evreninde bir görevin hatalı olma olasılığı. n: Sonuçlara bakılmadan önce belirlenmiş bağımsız deneme sayısı. Her denemede aynı hata tanımı ve aynı sistem sürümü kullanılır. Denemeler aynı p ile değerlendirilir; seçilme yolu hedef evreni temsil eder. Bu yazının üç ayrı senaryosunda gözlenen hatalı görev sayısı 0’dır. Hesap: tek taraflı %95 üst güven sınırı; iki taraflı aralık değildir.
Aynı soruyu küçük sözcük değişiklikleriyle on kez vermek bağımsız on iş kanıtı olmayabilir. Aynı belgeden gelen görevler ortak bir güçlük taşıyabilir. Sadece kolay soruları seçmek de gerçek kullanım evrenini temsil etmez. Sayısal formül bu tasarım sorunlarını onaramaz. Varsayımlar sağlanmıyorsa elde edilen üst sınır gerçek kullanıma doğrudan taşınmamalıdır.
Sistem sürümünü de sonuçlardan ayrı kaydedin. Beş testten sonra istemi değiştirip sonraki beş sonucu aynı sabit p varsayımına eklemek açıklanmamış bir karışım yaratır. Hata tanımını sonradan daraltmak da sıfır gözlemi kolaylaştırabilir. Bu alıştırmada sürüm ve hata kuralı değişmediği varsayılmıştır; gerçek çalışmada bunlar test kaydında görünür olmalıdır.
| Senaryo | Önceden belirlenmiş n | Hatalı görev | Gözlenen oran |
|---|---|---|---|
| A | 10 | 0 | %0 |
| B | 30 | 0 | %0 |
| C | 100 | 0 | %0 |
Tablodaki üç oran da sıfırdır, fakat içerdiği bilgi aynı değildir. C senaryosu aynı varsayımlar altında daha fazla gözlem taşır. A, B ve C ayrı örnek planlarıdır; sayıları toplayıp tek bir 140 görevli test yapılmış gibi raporlamıyoruz. Bu ayrım, öğretim için yan yana konan senaryoların gerçek veri kaydı sanılmasını önler.
Sıfır hatanın sınırını adım adım hesaplayın
Bir denemede hata olmama olasılığı 1−p ise bağımsız n denemede hiç hata görmeme olasılığı (1−p)^n olur. Tek taraflı yüzde 95 üst sınır için bu sıfır hata olasılığını 0,05’e eşitleyip p’yi çözeriz. Böylece üst sınır pÜ = 1−0,05^(1/n) çıkar. Kullanılan 0,05 kuyruk olasılığıdır; gözlenen hata oranı değildir.
(1 − pÜ)^10 = 0,05 1 − pÜ = 0,05^(1/10) pÜ = 1 − 0,05^(1/10) pÜ ≈ 0,258866 Yüzde olarak üst sınır ≈ %25,89 Gözlenen hata oranı ise 0/10 = %0 olarak kalır.
| n | Hatalı görev | pÜ hesabı | Yüzde gösterimi |
|---|---|---|---|
| 10 | 0 | 1 − 0,05^(1/10) | %25,89 |
| 30 | 0 | 1 − 0,05^(1/30) | %9,50 |
| 100 | 0 | 1 − 0,05^(1/100) | %2,95 |
Yüzde 25,89, testte bu kadar hata bulunduğu anlamına gelmez. On testte yine sıfır hata gözlenmiştir. Bu değer, belirtilen model ve örnekleme koşulları altında kullanılan üst güven sınırıdır. Yüzde 95 güven de bu tek testten sonra sabit p’nin yüzde 95 olasılıkla aralıkta olduğu şeklinde okunmamalıdır; güven düzeyi tekrarlanan örneklem yöntemiyle ilgilidir.
Üst sınır n büyüdükçe daralır, ancak bu yalnızca aynı varsayımlar korunduğunda daha çok gözlemin etkisini gösterir. Yüz yanlış seçilmiş veya güçlü biçimde ilişkili görev, on temsil edici bağımsız görevin otomatik yerine geçmez. Sonuç cümlesinde örnek sayısının yanına görev kapsamını ve sınırlamaları da koymak gerekir.
A/B/C sentetik planlarını kullan. n=10,30,100 ve her birinde sıfır hatalı görev var. Tek taraflı %95 üst sınırı 1−0,05^(1/n) ile hesapla; gözlenen %0 oranını değiştirme. İki taraflı aralık kullanma. Bağımsızlık, sabit sürüm, sabit hata tanımı ve önceden belirlenmiş n varsayımlarını yaz. Çıktı: hesap tablosu ve düzeltilmiş rapor cümlesi. Gerçek performans, kusursuzluk veya canlı kullanım onayı üretme.
Sınırı bir yayın iznine dönüştürmeyin
Önceden tanımlı bu on bağımsız sentetik denemede hatalı görev gözlenmedi. Gözlenen oran %0’dır. Sabit hata olasılığı modelinde tek taraflı %95 üst güven sınırı yaklaşık %25,89’dur. Bu sonuç gerçek kullanımda sıfır hata garantisi vermez; görev temsili ve hata türlerinin kapsamı ayrıca değerlendirilmelidir.
Küçük alıştırma: n=20 ve sıfır hata için aynı hesabı yapın. Üst sınır yaklaşık yüzde 13,91 olur; gözlenen oran yine sıfırdır. Bu değer on denemelik sınırdan küçük, otuz denemelik sınırdan büyüktür. Ara sonuç bu sıraya uymuyorsa yüzde dönüşümünü, üssü ve kullanılan kuyruk olasılığını yeniden kontrol edin.
Bir hata bulunduğunda sıfır hata için türetilen kısa formül kullanılmaz. Genel binom sınırı veya uygun başka değerlendirme yöntemi gerekir. Ayrıca sonuca her yeni görevden sonra bakıp sınır yeterince küçülünce durmak, burada varsaydığımız sabit örneklem planından farklıdır. Böyle bir izleme planı ayrıca tasarlanmalıdır; aynı yüzdeyi otomatik kullanmayın.
Kabul kararında hata türlerinin önemi ve kullanım kapsamı bu hesabın dışında kalır. Bu nedenle tabloya bir sınır eklemek, güvenlik veya hizmet gerekliliklerini kendiliğinden karşılamaz. Tesliminiz gözlem, hesap ve varsayım kaydından oluşsun. Böylece karar veren kişi küçük bir testin sağladığı kanıtı, sağlamadığı garantilerle karıştırmadan değerlendirebilir.
Kaynaklar ve doğrulama
- NIST Dataplot — Exact Binomial
Küçük örneklemde tam binom güven sınırları ve tek/çift taraf ayrımı; sıfır hata kapalı formu örnekte türetilir.
Erişim ve kontrol:
Yöneticiler İçin Yapay Zekâ
Yöneticiler İçin Yapay Zekâ programındaki değerlendirme çalışmalarına, yalnızca başarı yüzdesi yerine deneme sayısını ve seçilme koşulunu da taşıyan bir test kaydı getirebilirsiniz.
- Kuruma özel planlanır