Dört yüzde aynı işi tarif etmeyebilir

Ajan değerlendirme ekranında kaynak seçimi yüzde 90, hesap yüzde 90, biçim yüzde 90 ve kayıt adımı yüzde 90 görünüyor. Yönetici doğal olarak “İşlerin yüzde 90’ı tamamlanıyor” diyebilir. Oysa bu dört adımın hangi görevlerde başarısız olduğunu bilmiyorsanız, tamamlanmış iş oranını henüz hesaplayamazsınız. Aynı başarısızlıklar tek görevde toplanmış veya farklı görevlere dağılmış olabilir.

Bu yazıdaki iki değerlendirme kümesi sentetiktir. Gerçek ajan çağrısı veya dış sistem kaydı yapılmamıştır. Her kümede on görev ve her görev için dört denetim sonucu bulunur. K koşulu doğru kaynağın seçilmesi, H doğru hesap, B beklenen biçim, R hedef test kaydının doğru olmasıdır. Tam başarı için dört koşulun aynı görevde birlikte geçmesi gerekir. Her görev eşit ağırlıktadır; kısmi başarı puanı vermiyoruz.

Tablolar, bütün koşulların değerlendirilebildiği açıklayıcı bir test düzenini temsil eder. Bir koşulun kalması diğer koşulların mutlaka değerlendirilemeyeceği anlamına gelmez. Gerçek akış ilk hatada duruyorsa sonraki adımları “çalışmadı” olarak kaydedin; onlara ölçülmemiş bir başarı puanı vermeyin. Bu ayrım, örnekteki tam gözlem tablosunu gerçek üretim verisine taşırken korunmalıdır.

A kümesinde dört ayrı görev etkileniyor

Sentetik A kümesi · 1 geçti, 0 kaldı
GörevKHBR
A10111
A21011
A31101
A41110
A51111
A61111
A71111
A81111
A91111
A101111

Her sütunda dokuz geçiş vardır; adım oranlarının her biri 9/10, yani yüzde 90’dır. Fakat A1, A2, A3 ve A4 farklı koşullarda kalmıştır. Dört koşulu birlikte sağlayanlar A5–A10 arasındaki altı görevdir. Tamamlanmış iş oranı 6/10, yani yüzde 60 olur. Sütun toplamlarına bakmak bu kesişimi göstermez; görev kimlikleriyle satırları birlikte değerlendirmek gerekir.

Sentetik B kümesi · aynı adım oranları, farklı kesişim
GörevKHBR
B10000
B21111
B31111
B41111
B51111
B61111
B71111
B81111
B91111
B101111

B kümesinde de bütün sütunlar yüzde 90’dır. Bu kez dört başarısız koşul aynı görevde, B1’de toplanmıştır. B2–B10 arasındaki dokuz görev bütün koşulları sağlar; tamamlanma yüzde 90 olur. A ile B’nin adım oranları aynı, iş sonuçları farklıdır. Bu farkı açıklamak için yeni bir araç puanı değil, aynı görev üzerindeki sonuç ilişkisi gerekir.

Dört oranı ne zaman çarpabilirsiniz?

0,9 × 0,9 × 0,9 × 0,9 = 0,6561, yani yüzde 65,61 hesabı aritmetik olarak doğrudur. Ancak dört marjinal başarı oranını çarparak iş başarısı tahmin etmek, gerekli bağımsızlık varsayımı olmadan geçerli değildir. Tablolarımız bu varsayımı sağlamaz. Gözlenmiş A sonucu yüzde 60, B sonucu yüzde 90’dır; yüzde 65,61 bu iki tablonun sonucu olarak raporlanamaz.

Sıralı bir süreçte koşullu oranlar farklıdır: ikinci adımın, birinci geçmişken başarı olasılığı gibi. Uygun koşullu olasılıklar zincir halinde çarpılabilir; bunlar bütün görevlerden hesaplanan dört ayrı sütun oranıyla aynı şey değildir. Gerçek testte en anlaşılır başlangıç, tamamlanan görev kimliklerini saymaktır. Sonra adım oranlarını arızanın nerede toplandığını anlamak için kullanabilirsiniz.

Kopyalanabilir görev başarısı incelemesi
A ve B tablolarındaki her satır tek görev, K/H/B/R dört zorunlu başarı koşulu. 1 geçti, 0 kaldı. Her sütunun başarı oranını ve bütün koşulları birlikte geçen görevlerin oranını ayrı hesapla. Tam geçen kimlikleri listele. Dört yüzde 90 değerini bağımsızlık varsayımı olmadan çarpıp sonuç ilan etme. Kısmi görevi tamamlanmış sayma. Çalıştırılmamış adımlara ait veri verilirse onları ölçülmüş başarıya çevirme.
Elle hesaplanan karşılaştırma
A: her adım 9/10 = %90; tam geçenler A5, A6, A7, A8, A9, A10; iş başarısı 6/10 = %60.
B: her adım 9/10 = %90; tam geçenler B2–B10; iş başarısı 9/10 = %90.
Bağımsızlık varsayımıyla %65,61 hesabı bu gözlemlerin yerine kullanılamaz.

Anthropic’in ajan değerlendirme açıklaması, işlem izinde söylenenlerle ortamda gerçekten oluşan sonucu ayırır. Bizim R koşulumuz da yalnızca ajanın “kaydettim” demesine bağlı değildir; hedef test durumunun beklenen kayıtla eşleşmesini gerektirir. Buradaki tablolar böyle bir kontrolün tasarımıdır, gerçek veritabanı kanıtı olarak sunulmaz.Kaynak: Anthropic — Demystifying evals for AI agents

Tamamlandı tanımını denemeden önce yazın

Bir görev için kaynak doğru ama tutar yanlışsa kullanıcıya teslim edilebilir çıktı oluşmuş olmayabilir. Biçim doğru, kayıt yanlış hedefe gitmişse de tamamlanma koşulu karşılanmaz. Hangi koşulların zorunlu olduğunu denemeden önce belirleyin. Sonuçlar düşük çıktığında bir koşulu kaldırmak, aynı ölçümde iyileşme değildir; başarı tanımını değiştirmiş olursunuz. Eski ve yeni tanımlar ayrı raporlanmalıdır.

  • Her görevin bütün denetimlerini aynı kimlikle birleştirin.
  • Tamamlandı koşulunu kaynak, içerik ve hedef durum bakımından açık yazın.
  • Başarısız, çalışmadı ve sonucu bilinmiyor durumlarını ayrı tutun.
  • Adım oranlarının hangi paydadan hesaplandığını belirtin.
  • Kısmi başarıyı ayrıca ölçebilirsiniz; tam başarı sayısına sessizce eklemeyin.

İnceleme ekibine yalnızca yüzde tablosu vermek yerine başarısız görev örneklerini de gösterin. A kümesinde dört farklı koşul dört ayrı işi etkilerken B kümesinde tek görev bütün sorunları taşır. Düzeltme öncelikleri bu nedenle farklı olabilir. Ancak küçük sentetik örnekten hangi sistemin canlı ortamda daha güvenilir olduğu sonucu çıkmaz; gerçek görev kapsamıyla yeni test gerekir.

A2’deki hesap hatasını A1’e taşıyın

Alıştırmada A2’nin H koşulu 1 olsun, A1’in H koşulu 0 olsun. Diğer hücreler değişmesin. Sütun başarı oranlarını ve tam geçen görev sayısını yeniden hesaplayın. İki hücre değiştiği halde toplam başarısız koşul sayısının aynı kaldığını kontrol edin. Sonra bu değişimin iş tamamlanmasına neden etki ettiğini açıklayın.

Alıştırmanın cevap anahtarı
Her sütun yine 9/10 = %90. A1 iki koşulda kalır; A3 ve A4 kalmaya devam eder. A2 artık tam geçer. Tam geçenler A2 ve A5–A10: 7/10 = %70. Başarısız koşullar daha az göreve toplandığı için tamamlanan görev sayısı artmıştır.

Kendi ajanınız için aynı tabloyu küçük bir görev kümesiyle kurabilirsiniz. Her satırın sonuna hedef sistemdeki kontrol sonucunu ekleyin. Teslim edeceğiniz rapor, araçların tek tek iyi göründüğünü söylemekle kalmasın; kullanıcının istediği işin kaç kez bütün zorunlu koşullarla tamamlandığını da açıkça göstersin.

Kaynaklar ve doğrulama

İlgili okumalar

AI Ajanları ve İş Akışı Otomasyonu

AI Ajanları ve İş Akışı Otomasyonu eğitimi talebinde tamamlanmış işin nasıl anlaşılacağını tanımlayabilirsiniz. Araç sayılarının yanına gerçek sonuç koşulunu eklemek, eğitimde kurulacak testleri daha anlamlı hale getirir.

  • Kuruma özel planlanır