Aynı görev, aynı ayarlar, farklı sonuçlar
Bir ajanı aynı görevde üç kez çalıştırdınız. Birinci denemede yanlış dosyayı seçti, ikinci denemede kontrolü atladı, üçüncü denemede doğru çıktı verdi. Sunumda yalnızca üçüncü sonucu gösterirseniz görev yapılabilir görünür. Kullanıcı ise her çalıştırmada kabul edilebilir sonuç bekliyor olabilir. Bu iki beklenti aynı başarı oranıyla anlatılamaz; denemeleri nasıl saydığınızı belirtmeniz gerekir.
Bu yazıda dört sentetik görevi, her biri için önceden belirlenmiş üç denemeyle değerlendireceğiz. Bir, kabul koşullarının tamamının karşılandığını; sıfır, en az birinin karşılanmadığını gösteriyor. Hiçbir gerçek model veya ürün çalıştırılmadı. Sayılar bir pilotun gelecekteki performansını tahmin etmek için değil, farklı başarı tanımlarının aynı kayıtta nasıl ayrıldığını görmek için hazırlanmıştır.
| Görev | Deneme 1 | Deneme 2 | Deneme 3 |
|---|---|---|---|
| T1 | 1 | 1 | 1 |
| T2 | 1 | 1 | 0 |
| T3 | 1 | 0 | 0 |
| T4 | 0 | 0 | 0 |
Burada her sütun aynı görevin yeniden başlatılmış bir çalıştırmasıdır. Sütunlar aynı çalıştırmanın üç adımı değildir. Ayrıca farklı sürümler de karşılaştırılmıyor: Görev tanımı, model ve araç ayarları, başlangıç verisi ve kabul koşulları sabit tutuluyor. Değişmeyen koşullarda sonuçların ne kadar tekrarlandığını incelemek istiyoruz.
Deneme sayısını sonucu görmeden belirleyin
Anthropic’in ajan değerlendirmeleri açıklaması, k denemeden en az birinin başarılı olması ile bütün denemelerin başarılı olmasını ayrı ele alır. İlki iyi bir sonuç bulabilme, ikincisi tekrarlar boyunca tutarlılık hakkında farklı sorular sorar. Buradaki küçük tabloyu bu ayrımı öğrenmek için kullanıyoruz; araştırma terimlerinden hareketle model başarısı veya bağımsızlık varsayımı üretmiyoruz.Kaynak: Anthropic — Demystifying evals for AI agents
Üç denemeyi de çalıştırmayı baştan kararlaştırın. İlk başarıda durursanız T1, T2 ve T3 için sonraki hataları gözleyemezsiniz. T4’e sonuç alıncaya kadar sınırsız hak verirseniz de görevler eşit deneme bütçesine sahip olmaz. Deneme düzeni sonuca göre değiştiğinde, aynı başlık altında karşılaştırdığınız oranlar farklı süreçleri temsil etmeye başlar.
- Her görevin başlangıç verisini ve araç durumunu yeniden kurun. Önceki denemenin oluşturduğu dosya veya kayıt sonraki çalıştırmayı kolaylaştırmasın.
- İlk denemenin cevabını sonraki denemeye ipucu olarak vermeyin. Prompt veya araç ayarı değişirse bunu ayrı bir deney olarak kaydedin.
- Başarı ölçütünü sonuçları görmeden yazın. Güzel biçimlendirilmiş ama yanlış içerikli çıktı bir başarıya dönüşmesin.
- Başarısız denemeleri ve harcanan süreyi kayıtta tutun. Yalnızca seçilmiş en iyi çıktının maliyetini raporlamayın.
Bu düzen, denemelerin istatistiksel olarak bağımsız olduğunu kanıtlamaz. Aynı görevler ve araçlar ortak hata nedenleri taşıyabilir. Dört görevden oluşan liste de gerçek iş yükünü temsil ediyor olmayabilir. Bu nedenle aşağıda hesaplanan oranları yalnızca bu sabit değerlendirme kaydının gözlenen sayımları olarak okuyacağız.
Aynı tablodan dört ayrı ölçü çıkarın
Önce bütün hücreleri sayın: T1 üç, T2 iki, T3 bir ve T4 sıfır başarı içerir. Toplam altı başarılı deneme, on iki denemenin yarısıdır. Burada paydanın birimi denemedir. Sonra görev satırlarına geçin. En az bir başarı taşıyan üç görev vardır; üç denemenin tamamında başarılı olan ise yalnızca T1’dir.
| Ölçü | Pay | Payda | Sonuç |
|---|---|---|---|
| Bütün denemelerde başarı | 6 başarılı deneme | 12 deneme | %50 |
| En az bir başarı olan görev | 3 görev: T1, T2, T3 | 4 görev | %75 |
| Üç denemede de başarılı görev | 1 görev: T1 | 4 görev | %25 |
| İlk denemede başarılı görev | 3 görev: T1, T2, T3 | 4 görev | %75 |
Son iki yüzde 75 değeri farklı tanımlardan gelir. Bu tabloda ilk denemede geçen görevler ile herhangi bir denemede geçen görevler aynı olduğu için sayılar eşittir. Bu eşitlik genel bir kural değildir. Bir görev yalnızca üçüncü denemede geçse, en az bir başarı oranı yükselirken ilk deneme oranı aynı kalır. Alıştırmada bunu göreceksiniz.
Dört görev ve üç denemelik sentetik tabloyu kullan. 1 başarı, 0 başarısızlık demektir. Toplam başarılı deneme oranını, en az bir başarı içeren görev oranını, üç denemenin tamamında başarılı görev oranını ve ilk deneme başarısını ayrı hesapla. Her ölçünün payını, paydasını ve dahil olan görevlerini açıkla. Denemeleri aynı işin adımları sayma. Gelecek performansını veya bağımsızlık varsayımıyla olasılık tahmini üretme.
12 denemenin 6’sı geçti: gözlenen deneme başarısı %50. T1, T2 ve T3 en az bir kez geçti: 3/4 = %75. Yalnız T1 üç kez de geçti: 1/4 = %25. İlk sütunda T1, T2 ve T3 geçti: 3/4 = %75. En iyi denemeleri seçmek, her çalıştırmada tutarlı sonuç alındığını göstermez.
Bu hesap, daha büyük bir deneme havuzundan örnekleme yapan özel bir pass@k tahminleyicisi değildir. Önümüzdeki üç sabit gözlemi doğrudan sayıyoruz. Ayrıca yüzde 50’yi kendisiyle üç kez çarpıp gelecekte üç başarının olasılığını hesaplamıyoruz. Böyle bir çıkarım için burada gösterilmeyen ek varsayımlar gerekir.
Kullanım biçimine uygun ölçüyü seçin
Bir taslak üretim sürecinde insan üç adayı karşılaştırıp doğru olanı güvenilir biçimde seçebiliyorsa en az bir kabul edilebilir çıktı bulunması anlamlı olabilir. Ancak seçimi yapacak kişinin doğru cevabı bilmediği bir işte, seçeneklerden birinin doğru olması yeterli değildir. Hangi çıktının kullanılacağını ayırt etmenin maliyeti ve doğruluğu da değerlendirmeye eklenmelidir.
Tek seferlik bir otomatik hizmette kullanıcıya üç denemenin yalnızca en iyisini göstereceğinizi varsayamazsınız. Tek çalıştırma başarısı, hata etkisi ve tekrarların tutarlılığı daha doğrudan önem taşır. Bununla birlikte üçte üç geçen bir görevi de artık hatasız ilan etmeyin. T1 yalnızca üç gözlemde geçmiştir; başka girdiler ve gelecekteki çalıştırmalar hakkında kesinlik sağlamaz.
Yönetim notunda kullanım biçimini, deneme bütçesini ve bütün ölçüleri aynı tabloda sunun. “Başarı yüzde 75” yerine “dört görevin üçünde, önceden ayrılmış üç denemeden en az biri başarılıydı” cümlesi daha açık bir karar zemini sağlar. Tutarsız T2 ve T3 sonuçları için hata nedenlerini ayrıca inceleyin; ortalama değer bu incelemenin yerini tutmaz.
Son hücreyi değiştirin
T4’ün üçüncü denemesini başarılı kabul edin; bu satır artık 0, 0, 1 olsun. Diğer on bir hücre değişmesin. Dört ölçüyü yeniden hesaplayın ve hangilerinin aynı kaldığını açıklayın. Sonucu yalnızca bir yüzdeyle anlatmaya çalıştığınızda hangi bilginin kaybolduğunu da not edin.
Başarılı deneme: 7/12 ≈ %58,33. En az bir başarı olan görev: T1, T2, T3, T4; 4/4 = %100. Üç denemede de başarılı görev: yalnız T1; 1/4 = %25, değişmedi. İlk deneme başarısı: T1, T2, T3; 3/4 = %75, değişmedi. Bütün görevlerin bir kez geçmesi, bütün denemelerin geçtiği anlamına gelmez.
Kendi pilotunuzda bu tabloyu görev kimliği, deneme numarası, sonuç ve hata nedeni alanlarıyla kurabilirsiniz. Aynı görev için tekrarların açıkça görünmesi, en başarılı ekran görüntüsünün bütün değerlendirmeyi temsil etmesini önler. Önce hangi kullanıcı deneyimini sağlamayı amaçladığınızı yazın; sonra o deneyime karşılık gelen payda ile karar verin.
Kaynaklar ve doğrulama
- Anthropic — Demystifying evals for AI agents
K denemeden en az bir başarı ile bütün denemelerde başarı ayrımı; dört görevlik sayımlar özgün gözlem örneğidir.
Erişim ve kontrol:
Yöneticiler İçin Yapay Zekâ
Yöneticiler İçin Yapay Zekâ programında pilot sonuçlarının kullanıcı deneyimine ne kadar karşılık geldiğini tartışabilirsiniz. Eğitim talebine görev başına kaç deneme yaptığınızı eklemek, başarı ölçümünü daha açık hale getirir.
- Kuruma özel planlanır