Dört yüzde aynı işi tarif etmeyebilir
Ajan değerlendirme ekranında kaynak seçimi yüzde 90, hesap yüzde 90, biçim yüzde 90 ve kayıt adımı yüzde 90 görünüyor. Yönetici doğal olarak “İşlerin yüzde 90’ı tamamlanıyor” diyebilir. Oysa bu dört adımın hangi görevlerde başarısız olduğunu bilmiyorsanız, tamamlanmış iş oranını henüz hesaplayamazsınız. Aynı başarısızlıklar tek görevde toplanmış veya farklı görevlere dağılmış olabilir.
Bu yazıdaki iki değerlendirme kümesi sentetiktir. Gerçek ajan çağrısı veya dış sistem kaydı yapılmamıştır. Her kümede on görev ve her görev için dört denetim sonucu bulunur. K koşulu doğru kaynağın seçilmesi, H doğru hesap, B beklenen biçim, R hedef test kaydının doğru olmasıdır. Tam başarı için dört koşulun aynı görevde birlikte geçmesi gerekir. Her görev eşit ağırlıktadır; kısmi başarı puanı vermiyoruz.
Tablolar, bütün koşulların değerlendirilebildiği açıklayıcı bir test düzenini temsil eder. Bir koşulun kalması diğer koşulların mutlaka değerlendirilemeyeceği anlamına gelmez. Gerçek akış ilk hatada duruyorsa sonraki adımları “çalışmadı” olarak kaydedin; onlara ölçülmemiş bir başarı puanı vermeyin. Bu ayrım, örnekteki tam gözlem tablosunu gerçek üretim verisine taşırken korunmalıdır.
A kümesinde dört ayrı görev etkileniyor
| Görev | K | H | B | R |
|---|---|---|---|---|
| A1 | 0 | 1 | 1 | 1 |
| A2 | 1 | 0 | 1 | 1 |
| A3 | 1 | 1 | 0 | 1 |
| A4 | 1 | 1 | 1 | 0 |
| A5 | 1 | 1 | 1 | 1 |
| A6 | 1 | 1 | 1 | 1 |
| A7 | 1 | 1 | 1 | 1 |
| A8 | 1 | 1 | 1 | 1 |
| A9 | 1 | 1 | 1 | 1 |
| A10 | 1 | 1 | 1 | 1 |
Her sütunda dokuz geçiş vardır; adım oranlarının her biri 9/10, yani yüzde 90’dır. Fakat A1, A2, A3 ve A4 farklı koşullarda kalmıştır. Dört koşulu birlikte sağlayanlar A5–A10 arasındaki altı görevdir. Tamamlanmış iş oranı 6/10, yani yüzde 60 olur. Sütun toplamlarına bakmak bu kesişimi göstermez; görev kimlikleriyle satırları birlikte değerlendirmek gerekir.
| Görev | K | H | B | R |
|---|---|---|---|---|
| B1 | 0 | 0 | 0 | 0 |
| B2 | 1 | 1 | 1 | 1 |
| B3 | 1 | 1 | 1 | 1 |
| B4 | 1 | 1 | 1 | 1 |
| B5 | 1 | 1 | 1 | 1 |
| B6 | 1 | 1 | 1 | 1 |
| B7 | 1 | 1 | 1 | 1 |
| B8 | 1 | 1 | 1 | 1 |
| B9 | 1 | 1 | 1 | 1 |
| B10 | 1 | 1 | 1 | 1 |
B kümesinde de bütün sütunlar yüzde 90’dır. Bu kez dört başarısız koşul aynı görevde, B1’de toplanmıştır. B2–B10 arasındaki dokuz görev bütün koşulları sağlar; tamamlanma yüzde 90 olur. A ile B’nin adım oranları aynı, iş sonuçları farklıdır. Bu farkı açıklamak için yeni bir araç puanı değil, aynı görev üzerindeki sonuç ilişkisi gerekir.
Dört oranı ne zaman çarpabilirsiniz?
0,9 × 0,9 × 0,9 × 0,9 = 0,6561, yani yüzde 65,61 hesabı aritmetik olarak doğrudur. Ancak dört marjinal başarı oranını çarparak iş başarısı tahmin etmek, gerekli bağımsızlık varsayımı olmadan geçerli değildir. Tablolarımız bu varsayımı sağlamaz. Gözlenmiş A sonucu yüzde 60, B sonucu yüzde 90’dır; yüzde 65,61 bu iki tablonun sonucu olarak raporlanamaz.
Sıralı bir süreçte koşullu oranlar farklıdır: ikinci adımın, birinci geçmişken başarı olasılığı gibi. Uygun koşullu olasılıklar zincir halinde çarpılabilir; bunlar bütün görevlerden hesaplanan dört ayrı sütun oranıyla aynı şey değildir. Gerçek testte en anlaşılır başlangıç, tamamlanan görev kimliklerini saymaktır. Sonra adım oranlarını arızanın nerede toplandığını anlamak için kullanabilirsiniz.
A ve B tablolarındaki her satır tek görev, K/H/B/R dört zorunlu başarı koşulu. 1 geçti, 0 kaldı. Her sütunun başarı oranını ve bütün koşulları birlikte geçen görevlerin oranını ayrı hesapla. Tam geçen kimlikleri listele. Dört yüzde 90 değerini bağımsızlık varsayımı olmadan çarpıp sonuç ilan etme. Kısmi görevi tamamlanmış sayma. Çalıştırılmamış adımlara ait veri verilirse onları ölçülmüş başarıya çevirme.
A: her adım 9/10 = %90; tam geçenler A5, A6, A7, A8, A9, A10; iş başarısı 6/10 = %60. B: her adım 9/10 = %90; tam geçenler B2–B10; iş başarısı 9/10 = %90. Bağımsızlık varsayımıyla %65,61 hesabı bu gözlemlerin yerine kullanılamaz.
Anthropic’in ajan değerlendirme açıklaması, işlem izinde söylenenlerle ortamda gerçekten oluşan sonucu ayırır. Bizim R koşulumuz da yalnızca ajanın “kaydettim” demesine bağlı değildir; hedef test durumunun beklenen kayıtla eşleşmesini gerektirir. Buradaki tablolar böyle bir kontrolün tasarımıdır, gerçek veritabanı kanıtı olarak sunulmaz.Kaynak: Anthropic — Demystifying evals for AI agents
Tamamlandı tanımını denemeden önce yazın
Bir görev için kaynak doğru ama tutar yanlışsa kullanıcıya teslim edilebilir çıktı oluşmuş olmayabilir. Biçim doğru, kayıt yanlış hedefe gitmişse de tamamlanma koşulu karşılanmaz. Hangi koşulların zorunlu olduğunu denemeden önce belirleyin. Sonuçlar düşük çıktığında bir koşulu kaldırmak, aynı ölçümde iyileşme değildir; başarı tanımını değiştirmiş olursunuz. Eski ve yeni tanımlar ayrı raporlanmalıdır.
- Her görevin bütün denetimlerini aynı kimlikle birleştirin.
- Tamamlandı koşulunu kaynak, içerik ve hedef durum bakımından açık yazın.
- Başarısız, çalışmadı ve sonucu bilinmiyor durumlarını ayrı tutun.
- Adım oranlarının hangi paydadan hesaplandığını belirtin.
- Kısmi başarıyı ayrıca ölçebilirsiniz; tam başarı sayısına sessizce eklemeyin.
İnceleme ekibine yalnızca yüzde tablosu vermek yerine başarısız görev örneklerini de gösterin. A kümesinde dört farklı koşul dört ayrı işi etkilerken B kümesinde tek görev bütün sorunları taşır. Düzeltme öncelikleri bu nedenle farklı olabilir. Ancak küçük sentetik örnekten hangi sistemin canlı ortamda daha güvenilir olduğu sonucu çıkmaz; gerçek görev kapsamıyla yeni test gerekir.
A2’deki hesap hatasını A1’e taşıyın
Alıştırmada A2’nin H koşulu 1 olsun, A1’in H koşulu 0 olsun. Diğer hücreler değişmesin. Sütun başarı oranlarını ve tam geçen görev sayısını yeniden hesaplayın. İki hücre değiştiği halde toplam başarısız koşul sayısının aynı kaldığını kontrol edin. Sonra bu değişimin iş tamamlanmasına neden etki ettiğini açıklayın.
Her sütun yine 9/10 = %90. A1 iki koşulda kalır; A3 ve A4 kalmaya devam eder. A2 artık tam geçer. Tam geçenler A2 ve A5–A10: 7/10 = %70. Başarısız koşullar daha az göreve toplandığı için tamamlanan görev sayısı artmıştır.
Kendi ajanınız için aynı tabloyu küçük bir görev kümesiyle kurabilirsiniz. Her satırın sonuna hedef sistemdeki kontrol sonucunu ekleyin. Teslim edeceğiniz rapor, araçların tek tek iyi göründüğünü söylemekle kalmasın; kullanıcının istediği işin kaç kez bütün zorunlu koşullarla tamamlandığını da açıkça göstersin.
Kaynaklar ve doğrulama
- Anthropic — Demystifying evals for AI agents
İşlem izi ile ortamda oluşan gerçek sonucun ayrılması; başarı kesişimi tabloları özgün hesaptır.
Erişim ve kontrol:
AI Ajanları ve İş Akışı Otomasyonu
AI Ajanları ve İş Akışı Otomasyonu eğitimi talebinde tamamlanmış işin nasıl anlaşılacağını tanımlayabilirsiniz. Araç sayılarının yanına gerçek sonuç koşulunu eklemek, eğitimde kurulacak testleri daha anlamlı hale getirir.
- Kuruma özel planlanır