Bir modelin puanı son kontrol noktası değildir
İki AI taslağını karşılaştırmak için başka bir yapay zekâdan kazananı seçmesini istediniz. Karar ayrıntılı bir gerekçeyle geliyor. Aynı metinlerin yerini değiştirdiğinizde ise başka bir taslak seçiliyor. Değişen metin değil, sunum sırası olabilir. Bu yazıda değerlendiricinin kendi çıktısını da sınanacak bir kayıt olarak ele alacağız. Akıcı gerekçe, tek başına güvenilir değerlendirme kanıtı değildir.
Dört vaka ve bütün seçim kayıtları sentetiktir. Gerçek model çağrısı yapılmaz; herhangi bir güncel ürünün başarısı ölçülmez. Her vakada X ve Y iki kalıcı yanıt kimliğidir. Bunlar model veya marka adları değildir. İki turda aynı kaynak, aynı metinler ve aynı değerlendirme ölçütü kullanılır; yalnızca ekrandaki birinci ve ikinci konumları değişir. Kayıtlar bu değişimi okumayı öğretmek için hazırlanmıştır.
Zheng ve çalışma arkadaşlarının 2023 araştırması, LLM değerlendiricilerinde sıra etkisini inceler ve aynı yanıtların konumlarını değiştirerek karşılaştırmayı ele alır. Araştırmadaki sonuçları bugünkü bütün modellere ait oranlar gibi kullanmıyoruz. Burada bu sınama fikrini küçük, özgün bir uygulamaya çeviriyoruz. İki sunumda kararı değişen vakaları kesin kazanan ilan etmek yerine incelemeye ayıracağız.Kaynak: Zheng ve diğerleri — Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
Ölçütü yanıtları görmeden yazın
| Vaka / kaynak | X yanıtı | Y yanıtı | Kaynakla hazırlanan kontrol notu |
|---|---|---|---|
| J1 · 8 işin 6'sı kapandı. | 6 iş kapandı, 2 iş açık. | 8 işin tamamı kapandı. | X kaynakla uyumlu; Y yanlış sayı. |
| J2 · 14 Kasım planlanıyor, kesinleşmedi. | 14 Kasım planlanıyor; kesin değil. | Planlanan tarih 14 Kasım, henüz kesinleşmedi. | İkisi de aynı koşulu koruyor. |
| J3 · Her dosya en fazla 3 MB. | Bütün dosyaların toplamı en fazla 3 MB. | Her dosya en fazla 3 MB olabilir. | Y kapsamı koruyor; X toplam sınırı ekliyor. |
| J4 · Son tarih belirtilmedi. | Kaynakta son tarih yok. | Son tarih yarın. | X kaynakla uyumlu; Y tarih uyduruyor. |
Bu görevde ölçütler sayı doğruluğu, koşul kapsamı ve kaynakta olmayan bilgi eklememedir. Üslup veya uzunluk tercihi değerlendirmeye dahil değildir. Böylece kısa ama doğru bir yanıtı yalnızca ayrıntı eklemedi diye kaybettirmeyiz. J2’de anlam eşdeğer olduğu için zorunlu bir kazanan yoktur. Değerlendiricinin eşdeğerlik veya yetersiz bilgi seçeneğine sahip olması, gereksiz tercih üretmesini önlemek için önemlidir.
Kontrol notları değerlendirme sonuçlarından önce hazırlanmış referanslardır. Bir modelin seçtiği yanıtı sonradan doğru kabul edip kontrol notunu ona uydurmayın. Gerçek işte daha tartışmalı sorular olabilir; o durumda ölçütlerin uzman incelemesi ve birden çok değerlendirme gerekebilir. Bu dört kısa vaka, kapsamı açık cümlelerde sayı ve koşul hatasını görmeye yöneliktir; bütün yazı kalitesini ölçmez.
Birinci yanıt her turda aynı yanıt değildir
| Vaka | 1. tur: sıra X,Y / seçim | 2. tur: sıra Y,X / seçim | Kalıcı kimlikler | Tutarlılık |
|---|---|---|---|---|
| J1 | Birinci | İkinci | X → X | Tutarlı |
| J2 | Birinci | Birinci | X → Y | Değişti |
| J3 | İkinci | Birinci | Y → Y | Tutarlı |
| J4 | İkinci | İkinci | Y → X | Değişti |
İlk turda iki X ve iki Y seçilmiştir. İkinci turda da toplamlar iki X ve iki Y’dir. Bu toplam eşitliği değerlendiricinin aynı kararları verdiğini göstermez; J2 ve J4 değişmiştir. Konumu kalıcı yanıt kimliğine çevirmeden karşılaştırırsanız J1’i yanlışlıkla değişmiş sayabilirsiniz, çünkü birinci seçim ikinciye dönmüştür. Oysa iki turda da seçilen metin X’tir.
Kalıcı kimlikle tutarlı vaka sayısı 2 / 4 = yüzde 50’dir. Bu oran değerlendiricinin doğruluğu değildir. Aynı yanlış metni iki turda da seçseydi yine tutarlı görünürdü. Ayrıca bu küçük, elle hazırlanmış kayıt sıra etkisinin gerçek bir modeldeki yaygınlığını ölçmez. Gerçek denemede rastlantısal değişkenlik, isimlendirme ve başka etkenler de incelenmelidir; tek ters çevirme bütün nedenleri kanıtlamaz.
Tutarlılığı kaynak kontrolünden ayrı raporlayın
Sentetik J1–J4 çiftlerini ve iki tur seçimlerini kullan. Önce Birinci/İkinci seçimlerini o turun X/Y sırasına göre kalıcı kimliğe çevir. Sonra her vakada tutarlılığı karşılaştır. Kaynak kontrol notuyla doğruluğu ayrıca incele. Toplam kazanan sayıları aynı diye bütün sonuçları tutarlı sayma. J2'de anlam eşdeğerliğini koru. Gerçek model testi veya genel doğruluk oranı iddia etme; değişen vakaları inceleme listesine al.
J1: X/X, tutarlı ve verilen kaynağa uygun. J2: X/Y, seçim değişiyor; referansa göre iki yanıt eşdeğer. J3: Y/Y, tutarlı ve verilen kapsamı koruyor. J4: Y/X, seçim değişiyor; ilk turdaki Y kaynakta olmayan tarih ekliyor. Tutarlı vaka: 2/4. Toplam seçilen X/Y sayıları iki turda da 2/2. J2 ve J4 kesin kazanan olarak raporlanmaz; değerlendirme kaydı incelenir.
Burada J1 ve J3 için hem tutarlılık hem kaynak uyumu görülür. Bu iki başarılı vaka, değerlendiricinin başka işlerde güvenilir olduğunu kanıtlamaz. Değerlendirme hizmetini gerçek akışa koymadan önce görev türleri, kritik hata koşulları ve insan incelemesi tasarlanmalıdır. Bir modelin diğerinden daha uzun gerekçe yazması veya kendi puanından emin konuşması, bu kontrollerin yerine geçmez.
Gerçek denemede kullanılan kaynak, yanıt metinleri, rubrik, değerlendirici sürümü ve sunum sırası birlikte saklanır. Yalnızca son puanı kaydetmek kararın nasıl değiştiğini yeniden incelemeye yetmez. Yanıtları yeniden üreterek ikinci tur hazırlarsanız artık yalnızca sıralamayı değiştirmiş olmazsınız. Bu uygulamada metinleri dondurmanın nedeni, karşılaştırmanın hangi değişkeni sınadığını açık tutmaktır.
Tutarlı hatayı da yakalayacak bir alıştırma yapın
- Kaynak ve değerlendirme ölçütleri baştan belli mi?
- İki turda metinler değişmeden kaldı mı?
- Konumlar kalıcı yanıt kimliğine çevrildi mi?
- Eşdeğerlik zorla kazanan seçimine dönüşmedi mi?
- Tutarlılık ve kaynak doğruluğu ayrı raporlandı mı?
Küçük alıştırma: J4’ün ikinci tur seçiminde Birinci yazdığını düşünün. İkinci tur sırası Y,X olduğundan bu seçim Y’dir. J4 artık Y/Y ile tutarlı görünür, fakat iki turda da kaynakta olmayan ‘yarın’ tarihini seçmiştir. Tutarlı vaka sayısı üçe yükselirken bu vakanın doğruluğu iyileşmez. Yalnızca tutarlılık puanını optimize etmenin neden yetersiz olduğu burada görülür.
Tamamlanmış değerlendirme notu kazanan listesinin yanında referans, sunum sırası ve açık kalan kararları içerir. Yapay zekâ değerlendiricisi karşılaştırmayı hızlandırabilir; onun önerisini kullanabilmek için hangi ölçütte, hangi kaynakla ve hangi tutarlılıkla karar verdiğini de kontrol edebilmeniz gerekir.
Kaynaklar ve doğrulama
- Zheng ve diğerleri — Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
2023 çalışmasında değerlendirici modellerin sıra etkisi ve yanıtların yerini değiştirerek karşılaştırma yaklaşımı. Dört çift ve kayıtlar özgün sentetik uygulamadır; güncel model başarısı iddiası yok.
Erişim ve kontrol:
Yöneticiler İçin Yapay Zekâ
Yöneticiler İçin Yapay Zekâ programındaki değerlendirme çalışmalarında, puanı üreten aracın da nasıl sınanacağını ele alabilirsiniz. Eğitim talebinize kaynak doğruluğu, rubrik ve insan incelemesi gereksinimlerinizi ekleyin.
- Kuruma özel planlanır