Doğru yanıt oranının paydasını sorun
Asistanın yeni ayarı yüzde 100 doğru yanıt verdi. Bu iyi görünüyor; fakat yirmi sorunun yalnızca onunu cevaplamışsa kalan işler hâlâ tamamlanmayı bekliyor. Yanıtlananlardaki doğruluk ile bütün görevlerin ne kadarının karşılandığı aynı ölçü değildir. Bir ayarı değerlendirirken cevap vermeme seçeneğini görünür tutmak, yüksek oranın hangi iş yükü karşılığında elde edildiğini anlamanızı sağlar.
Bu uygulamada A, B ve C adlı üç kurgusal ayar aynı yirmi soruda karşılaştırılır. Tablo sonuçları sentetiktir; gerçek asistan veya model çalıştırması yapılmaz. Doğru ve yanlış etiketleri öğretim girdisi olarak verilmiştir. Gerçek değerlendirmede bu etiketlerin kaynak, ölçüt ve uygun insan incelemesiyle ayrıca oluşturulması gerekir. Burada etiket üretimini değil, verilmiş sonuçlardan hangi oranların hesaplanabileceğini inceleyeceğiz.
Geifman ve El-Yaniv’in 2017 çalışması, bir sınıflandırıcının bazı örneklerde karar vermemesiyle kapsanan örnek payı ve hata arasındaki ilişkiyi ele alır. Çalışmadaki görüntü sınıflandırma sonuçlarını bugünkü dil modellerinin başarısı gibi aktarmıyoruz. Kapsamı ayrıca raporlama fikrini, aşağıdaki özgün soru-cevap sayımına uyarlıyoruz; herhangi bir olasılık veya hata garantisi üretmiyoruz.Kaynak: Geifman ve El-Yaniv — Selective Classification for Deep Neural Networks (2017)
Yanıtsız soruları tablodan çıkarmayın
| Soru kimlikleri | Adet | A | B | C |
|---|---|---|---|---|
| Q01–Q10 | 10 | Doğru | Doğru | Doğru |
| Q11–Q14 | 4 | Doğru | Yanıtsız | Doğru |
| Q15 | 1 | Doğru | Yanıtsız | Yanlış |
| Q16–Q18 | 3 | Yanlış | Yanıtsız | Yanıtsız |
| Q19–Q20 | 2 | Yanıtsız | Yanıtsız | Yanıtsız |
Satırlar aynı sonuca sahip soru kimliklerini birlikte gösterir; toplam 10 + 4 + 1 + 3 + 2 = 20’dir. Yanıtsız, bu örnekte tamamlanmış bir asistan cevabı bulunmaması demektir. Açıklama isteme veya insana yönlendirme yararlı davranışlar olabilir, fakat bu tabloda doğru cevap olarak sayılmaz. Kullanıcı işi daha sonra insanla tamamlarsa bu sonuç ayrı bir süreç ölçümünde izlenmelidir.
Yanlış yanıt ile yanıtsızlık aynı maliyet veya risk anlamına gelmez. Yanlış yanıt fark edilmeden kullanılabilir; yanıtsız soru ise ek iş oluşturabilir. Hangi sonucun kabul edilebilir olduğu görevin bağlamına bağlıdır. Bu nedenle ikisini tek bir başarısızlık toplamında gizlemek yerine ayrı sayacağız. Ayrıca burada bütün sorular izinli ve görev kapsamındadır; cevaplanmaması gereken yetkisiz sorular başka bir test grubu olur.
Kapsam, koşullu doğruluk ve doğru tamamlama
| Ayar | Doğru / yanlış / yanıtsız | Yanıt kapsamı | Yanıtlananlarda doğruluk | Tüm sorularda doğru yanıt |
|---|---|---|---|---|
| A | 15 / 3 / 2 | 18 / 20 = %90 | 15 / 18 ≈ %83,3 | 15 / 20 = %75 |
| B | 10 / 0 / 10 | 10 / 20 = %50 | 10 / 10 = %100 | 10 / 20 = %50 |
| C | 14 / 1 / 5 | 15 / 20 = %75 | 14 / 15 ≈ %93,3 | 14 / 20 = %70 |
Yanıt kapsamı, bir cevap üretilmiş soruların bütün sorulara oranıdır. Yanıtlananlardaki doğruluk ise yalnızca bu cevapların kaçının doğru olduğunu söyler. İkinci oran koşulludur: cevap verilmiş olması koşuluyla hesaplanır. B’nin yüzde 100 değeri bu dar kümede doğrudur. On yanıtsız sorunun da çözüldüğünü veya B’nin bütün işlerde en yararlı ayar olduğunu göstermez.
Bütün sorulardaki doğru yanıt payı üçüncü bir bakıştır. A bu ölçütte yüzde 75 ile daha yüksek görünür, fakat üç yanlış cevabı da vardır. C daha az soruyu doğru tamamlar ama yalnızca bir yanlış üretmiştir. Bu iki bilgiden tek bir kazanan kendiliğinden çıkmaz. Sonuç yorumunda görev kapsamı, hata toleransı ve insan tarafından tamamlanacak iş birlikte ele alınmalıdır.
Hiç cevap vermeyen bir ayarın yanıtlananlardaki doğruluğu sıfıra bölme nedeniyle tanımsız olur. Böyle bir durumda yüzde 100 veya yüzde 0 yazarak oranı doldurmayın; “hesaplanamaz, yanıt yok” deyin. Kapsamı ise sıfırdır. Bu sınır durumu, boş kümeyi yüksek kalite etiketiyle ödüllendirmemek için değerlendirme sözleşmesinde açıkça yer almalıdır.
İki sınırı birlikte uygulayın
Bu yirmi soruluk eğitim kümesinde devam adayı olmak için: 1. Yanıt kapsamı en az %70 olmalı. 2. Yanlış cevap sayısı en fazla 1 olmalı. İki koşul birlikte aranır. Bu eşikler gerçek bir kurumun güvenlik, hizmet veya yayın standardı değildir; yalnızca karar hesabını öğretir.
| Ayar | Kapsam koşulu | Hata koşulu | Bu örnekte karar |
|---|---|---|---|
| A | Geçer: %90 | Kalır: 3 yanlış | Devam adayı değil |
| B | Kalır: %50 | Geçer: 0 yanlış | Devam adayı değil |
| C | Geçer: %75 | Geçer: 1 yanlış | Yalnızca bu örnek koşulları altında aday |
C’nin aday olması canlıya alınması gerektiği anlamına gelmez. Yirmi sentetik soru gerçek kullanımın çeşitliliğini temsil etmez; hata türlerinin ağırlığı da bu basit tabloda eşit sayılmıştır. Gerçek bir kararda kritik hata koşulları ayrıca bulunabilir. Eşikleri sonuçları gördükten sonra sevdiğiniz ayarı geçirmek için değiştirmek yerine, hangi görevi ve iş yükünü kabul edeceğinizi önceden belirleyin.
İnsana devredilen iş miktarı yalnızca yanıtsız soru sayısı da olmayabilir. Cevaplanan soruların bir kısmı da kontrol gerektiriyorsa toplam inceleme yükü daha fazladır. Bu yazının tablosu iki, on ve beş yanıtsız işi gösterir; bunları doğrudan dakika veya kişi sayısına çevirmiyoruz. Böyle bir dönüşüm için gerçek işlem süreleri ve inceleme kuralı gerekir.
Yüksek yüzdeyi tamamlanan işle aynı cümlede açıklayın
Bağlam: Üç sentetik asistan ayarını aynı Q01–Q20 kümesinde karşılaştırıyorum. Girdi: sonuç tablosu ve %70 kapsam/en fazla 1 yanlış kuralı. Doğru, yanlış ve yanıtsız sayıları ayrı topla. Kapsamı bütün yirmi soru üzerinden, cevap doğruluğunu yalnızca yanıtlananlar üzerinden hesapla. Çıktı: üç ölçüt, koşul bazlı karar ve insan işi için açık kalan bilgi. Kontrol: her ayarın üç sayısı yirmi etmeli; yüzde 100 doğruluk bütün işlerin bittiği anlamına gelmemeli.
B, yanıtladığı on sorunun tamamında doğrudur; ancak yirmi sorunun yarısını yanıtsız bırakır. C, on beş soruya cevap verir; on dört doğru, bir yanlış ve beş yanıtsız sonuç üretmiş varsayılır. C verilen iki eğitim koşulunu sağlar; gerçek kullanım kararı için daha geniş kaynaklı değerlendirme gerekir.
- Bütün ayarlarda aynı soru kümesi mi var?
- Yanıtsız kayıtlar toplamda tutuluyor mu?
- Her yüzdenin pay ve paydası açık mı?
- Sıfır cevap durumunda tanımsız oran korunuyor mu?
- Kabul koşulu kaliteyi ve karşılanan iş kapsamını birlikte mi ele alıyor?
Küçük alıştırma: C’deki Q15 yanlış cevabı yanıtsız hale gelsin; başka kayıt değişmesin. C artık 14 doğru, sıfır yanlış ve altı yanıtsız sonuç taşır. Kapsam 14/20 = yüzde 70, yanıtlananlardaki doğruluk 14/14 = yüzde 100 olur. Verilen eşikleri yine sağlar; fakat doğru tamamlanan soru sayısı hâlâ on dörttür. Yüzdenin yükselmesi yeni doğru cevap üretildiğini göstermez.
Değerlendirme kaydınızda yanıt verme kararını, cevabın doğruluğunu ve işin sonunda kim tarafından tamamlandığını ayrı tutun. Böylece yapay zekânın daha az cevap vermesiyle daha iyi cevap vermesi arasındaki fark görünür kalır. Yönetim raporunun değeri tek bir yüksek yüzdeden değil, o yüzdenin hangi görev kapsamı altında elde edildiğini açıklamasından gelir.
Kaynaklar ve doğrulama
- Geifman ve El-Yaniv — Selective Classification for Deep Neural Networks (2017)
Yanıt vermeme seçeneğiyle kapsanan örnek payı ve hata arasındaki ilişki. Çalışmanın görüntü sınıflandırma sonuçları LLM başarısı gibi aktarılmaz; soru tablosu özgündür.
Erişim ve kontrol:
Yöneticiler İçin Yapay Zekâ
Yöneticiler İçin Yapay Zekâ programına ilişkin talebinizde, asistanın cevap vermediği işleri bugün kimin tamamladığını belirtin. Kapsam, doğruluk ve insan iş yükünü birlikte ele alan bir değerlendirme hazırlayabilirsiniz.
- Kuruma özel planlanır