Tek parlak sonuç bütün denemeleri saklamamalı

Ekip yirmi farklı prompt karşılaştırması yaptı. Birinin p değeri 0,04 olunca sunuma yalnız o karşılaştırma girdi ve “yüzde beş hata düzeyinde fark bulundu” yazıldı. Her testin kendi hesabı geçerli olsa bile, birçok karşılaştırmadan en dikkat çekeni seçmek başka bir hata sorusu oluşturur. Bütün test ailesinde en az bir yanlış alarm verme olasılığını, tek testin yanlış alarm düzeyiyle aynı saymayın.

Bu makalede yeni bir istatistik testi hesaplamıyoruz. Geçerli testlerden geldiği varsayılan p değerleri ve basit bir olasılık modeliyle aile tanımını inceliyoruz. Veriler sentetiktir; gerçek bir AI pilotunda etki bulunduğu iddia edilmez. Değerlendirmenin ilk işi test ailesini sonuçları görmeden tanımlamaktır: hangi görevler, hangi ayarlar, hangi ölçüler ve kaç karşılaştırma aynı kararın parçası olacak?

Bağımsızlık varsayımını açık tutun

Özgün öğretim modelimizde yirmi sıfır hipotezinin tamamı doğrudur. Her test tam 0,05 olasılıkla yanlış alarm verir ve bu alarm olayları birbirinden bağımsızdır. Bir testin alarm vermeme olasılığı 0,95’tir. Yirminin de alarm vermemesi 0,95 üzeri 20 olur. En az bir alarm bunun tamamlayıcısıdır. Bu özel modelin hesabını, gerçek testlerin bağımsız olduğu doğrulanmadan doğrudan pilotunuza atamayın.

Elle hazırlanmış aile hesabı
P(hiç yanlış alarm yok)=0,95^20≈0,358486.
P(en az bir yanlış alarm)=1−0,95^20≈0,641514.
Yaklaşık %64,15, bütün yirmi sıfır hipotezinin doğru ve alarm olaylarının bağımsız olduğu model içindir.

Her test için en fazla yüzde beş deniyorsa tam eşitlik varsayımı da değişir; formül artık otomatik olarak gerçekleşen olasılığı vermez. Testler aynı görevleri paylaşıyorsa bağımsızlık da bozulabilir. Sonuçta yüzde 64,15, yirmi test yapmanın her ortamda değişmez cezası değildir. Bu sayı, tek test düzeyini aile düzeyiyle karıştırmanın ne kadar farklı bir soruya yol açabileceğini somutlaştırır.

Aile için önceden sınır seçin

NIST’in Bonferroni açıklaması, önceden seçilmiş sonlu karşılaştırma ailesinde toplam hata sınırını korumak için ayrı karşılaştırmalara bölünmüş hata payı yaklaşımını anlatır. Bu yaklaşımın temelindeki eşitsizlik, olayların birleşim olasılığını ayrı olasılıkların toplamıyla sınırlar; bağımsızlık gerektirmez. Aile hata payı 0,05 ve karşılaştırma sayısı 20 ise her test için 0,05/20=0,0025 sınırı kullanılabilir.Kaynak: NIST — Bonferroni’s method

Özgün hata bütçesi karşılaştırması
PlanTest sayısıTest başına sınırAile hakkında söylenebilen
Ayrı %5 testler200,05Bağımsız tam modelde ≈%64,15 alarm
Bonferroni planı200,0025Geçerli testler altında en fazla %5 aile hatası
Dört testlik ayrı plan40,0125Aile önceden dört olarak tanımlanmışsa

Bonferroni sınırının her veri düzeninde tam yüzde beş sonuç verdiğini söylemeyin; bir üst sınır sağlar ve daha tutucu olabilir. Ayrıca bu yöntem gerçek etkinin büyüklüğünü göstermez. Küçük bir p değeri iş bakımından yararlı bir kazanç bulunduğunu, büyük bir p değeri ise iki yaklaşımın eşdeğer olduğunu tek başına kanıtlamaz. Süre farkı, kalite koşulu ve belirsizlik raporu karar tablosunda ayrı kalmalıdır.

Aynı p değerlerini iki farklı soruda okuyun

Sentetik seçilmiş sonuçlar · aile toplam 20 test
Karşılaştırmap değeri0,05 ile0,0025 ile
T10,001Sınır altındaSınır altında
T20,004Sınır altındaSınır üstünde
T30,040Sınır altındaSınır üstünde
T4…T20Her biri en az 0,10Sınır üstündeSınır üstünde

Tablodaki ilk üç testin yalnız biri aile için seçilen sınırın altında kalır. T2 ve T3’ü kayıttan silmeyin; sonuçları ve ailenin büyüklüğünü koruyun. Yalnız olumlu görünen T1’i raporlayıp “bir test yaptık” demek, seçim sürecini gizler. T4 ile T20 arasındaki on yedi karşılaştırmanın sonuçları ayrıntılı raporda bulunmalıdır; bu küçük tablo onların yalnız sınır kararını özetler.

Açıklama için hazırlanmış rapor cümlesi
Önceden tanımlı 20 karşılaştırmada aile hata payı 0,05 seçildi; Bonferroni sınırı 0,0025. Sentetik p değerlerinde yalnız T1 bu sınır altında. Diğer testlerin sınırı aşması eşdeğerlik kanıtı değildir. Etki büyüklüğü ve kalite koşulları ayrıca değerlendirilir.

Modelden test ailesini küçültmemesini isteyin

Çoklu karşılaştırma için denetim istemi
Önceden 20 karşılaştırma planlandı. p değerleri T1=.001, T2=.004, T3=.04, kalan 17 testin her biri en az .10. Aile hata düzeyi .05. Bonferroni test sınırını hesapla ve bütün karşılaştırmaları kapsamda tut. Ayrı öğretim modelinde yirmi bağımsız, doğru sıfır hipotezinin her testinde tam .05 alarm olasılığı için en az bir alarmı hesapla. İki varsayım kümesini karıştırma; test geçerliliği, gerçek etki veya üretim onayı iddia etme.

Sonuçları gördükten sonra yeni ölçüler eklemek veya bir alt grubu seçmek aileyi yeniden tanımlama sorunu yaratır. Böyle bir incelemeyi keşif olarak kaydedip sonraki doğrulama planını yeni veri üzerinde önceden kurabilirsiniz. Bir yöntemin adını rapora yazmak, sonuç seçme sürecinin tamamını kendiliğinden düzeltmez. Hangi kararların veriyi görmeden, hangilerinin gördükten sonra alındığı ayrıca görünür olmalıdır.

  • Karşılaştırma ailesi önceden belirlenmiş mi?
  • Bütün testler, sonuçları elverişsiz olsa da kayıtlı mı?
  • Bağımsızlık yalnız gerektiği hesapta kullanılmış mı?
  • İstatistiksel sınır ile işte yararlı etki ayrı mı?

Dört testlik yeni plan kurun

Bağımsız bir planın ailesi başlangıçtan itibaren dört karşılaştırma olsun. Aile hata payı 0,05; p değerleri 0,009, 0,020, 0,040 ve 0,200. Bonferroni sınırını ve sınır altında kalan testi bulun. Sonra dört doğru ve bağımsız sıfır hipotezi için ayrı testlerin her biri tam 0,05 alarm verirse en az bir alarm olasılığını hesaplayın. Önceki yirmi testten dördünü sonradan seçtiğinizi varsaymayın.

Alıştırmanın cevabı
Bonferroni sınırı 0,05/4=0,0125; yalnız p=0,009 sınır altında. Ayrı bağımsız modelde 1−0,95^4=0,18549375, yaklaşık %18,55. Bu ikinci sayı düzeltilmiş planın aile hatası değildir.

Pilot raporunun yanında karşılaştırma ailesi, karar zamanı ve kullanılan sınır saklandığında tek bir dikkat çekici sonucun nasıl seçildiği görülebilir. AI’dan beklenen katkı, en küçük p değerini parlatması değil, bütün denemelerin aynı karar içindeki yerini ve varsayımlarını açık tutmasıdır.

Kaynaklar ve doğrulama

  • NIST — Bonferroni’s method

    Önceden belirlenmiş sonlu karşılaştırma ailesinde Bonferroni eşitsizliği ile ortak hata sınırını koruma.

    Erişim ve kontrol:

İlgili okumalar

Yöneticiler İçin Yapay Zekâ

Yöneticiler İçin Yapay Zekâ eğitimine pilotunuzun karşılaştırma listesini getirebilirsiniz. Beklenen kazanımı, test ailesini ve devam kararını aynı değerlendirme kartında buluşturun.

  • Kuruma özel planlanır