En yakın kayıt hangi ölçüye göre yakın?

Görsel benzerlik denemenizde iki aday var. A kaydının parlaklığı sorguya çok yakın, kenar sayısı biraz farklı. B’nin kenar sayısı aynı, parlaklığı daha uzak. Yapay zekâ B’yi en benzer örnek olarak açıklıyor. Bu tercih görüntüyü daha iyi anlamasından kaynaklanmak zorunda değildir. Büyük sayılarla ifade edilen özellik, kullanılan uzaklık hesabında diğer özelliğin katkısını bastırmış olabilir. Önce her ölçümün sonuca ne kadar katkı verdiğini görün.

Burada gerçek görüntü veya model kullanılmıyor. İki sentetik özellik tanımlıyoruz: x ortalama parlaklık özeti, y kenar sayısı. Parlaklık için 0–255 aralığı, kenar için negatif olmayan tam sayı kullanılır. Bu değerler gerçek bir görüntüden çıkarılmış değildir; yalnızca iki farklı sayısal ölçeğin etkisini göstermek için hazırlanmıştır. Sorgu ve iki aday aynı özellik tanımıyla kaydedilmiştir.

Sentetik özellik kayıtları
Kayıtx parlaklıky kenar sayısıRol
Q1001000Sorgu
A991100Birinci aday
B951000İkinci aday

Bu alıştırmada yakınlık, iki özellik farkının karelerinin toplamıyla ölçülür. Karekök alınsa sıralama değişmez; negatif olmayan kare uzaklıkları karşılaştırmak yeterlidir. Küçük sonuç daha yakın demektir. Bunun insanın görsel benzerlik yargısıyla veya üretimdeki doğru sınıfla aynı olduğu varsayılmaz. Uzaklık tanımı, değerlendirilmesi gereken bir tasarım tercihidir.

Uzaklığı iki katkıya ayırın

Elle hesaplanan ham kare uzaklık
Adayx farkıy farkıx katkısıy katkısıToplam
A−110011000010001
B−5025025

A için parlaklık farkının katkısı birdir; kenar farkının katkısı on bindir. B’de kenar farkı sıfır olduğu için toplam yalnız yirmi beştir. Ham hesap B’yi seçer. Bu tabloda “biraz farklı” gibi bir doğal dil ifadesinin sayısal karşılığı açık değildir. Yüz kenarlık farkın önemli olup olmadığını yalnızca büyük görünmesine veya modelin sıfatına göre kararlaştıramazsınız.

scikit-learn’ün ölçekleme örneği, farklı büyüklüklerdeki özelliklerin uzaklık temelli komşulukları değiştirebildiğini gösterir. Büyük sayılı bir özelliğin farkları ham uzaklığı baskın biçimde etkileyebilir. Biz aşağıda hazır bir model eğitmek veya bu kaynağın veri kümesini yeniden kullanmak yerine, iki sabit ölçekle bu mekanizmayı küçük bir hesap üzerinde inceleyeceğiz.Kaynak: scikit-learn — Importance of feature scaling

Ölçek değiştirmek her durumda gerekli veya iyi değildir. Eğer iş kuralınız kenar sayısındaki farkı çok daha önemli buluyorsa ham tercihin farklı bir gerekçesi olabilir. Burada henüz doğru aday etiketi verilmemiştir. Bu nedenle B’nin yanlış, A’nın doğru olduğunu söylemeyeceğiz. Aynı kayıtlarda ölçünün değişmesinin seçimi nasıl değiştirdiğini göstereceğiz.

Aynı dönüşümü sorguya ve adaylara uygulayın

İkinci senaryonun sözleşmesi x farkını bire, y farkını yüze bölmektir. Bu sabitler örnek için verilmiştir; üç kayıttan tahmin edilmiş standart sapmalar değildir. A’nın farkları −1 ve 1, B’nin farkları −5 ve 0 olur. Artık A için kare uzaklık 1+1=2, B için 25+0=25 bulunur. Aynı kayıtların sırası değişmiştir.

Özgün uzaklık sözleşmeleri
Ham d² = (aday x − sorgu x)² + (aday y − sorgu y)².
İkinci senaryo d² = ((aday x − sorgu x)/1)² + ((aday y − sorgu y)/100)².
Sabit ölçekler bütün kayıtlarda aynıdır; sıfıra bölme yoktur.
Elle hazırlanmış sabit ölçek karşılaştırması
AdayÖlçekli x katkısıÖlçekli y katkısıToplamSıra
A1121
B250252

Aynı hesabı bütün x değerlerini bire, bütün y değerlerini yüze bölerek de yapabilirsiniz. Bu durumda sorgu Q=100/10, A=99/11 ve B=95/10 olur. Sonra iki noktayı aynı dönüştürülmüş uzayda karşılaştırırsınız. Yalnızca adayları ölçekleyip sorguyu 100/1000 halinde bırakmak başka bir hata üretir; noktalar aynı ölçüde temsil edilmez.

Bu sabit bölme işlemi StandardScaler çalıştırması değildir. Standardizasyon genellikle eğitim verisinden ortalama ve standart sapma öğrenir; burada öğrenilen bir parametre yoktur. Gerçek akışta ölçekler veriden öğrenilecekse hangi verinin kullanılacağı ve aynı durumun yeni sorgularda nasıl korunacağı ayrıca belirlenmelidir. Örnekteki 1 ve 100 sayılarını başka veriye evrensel kural olarak taşımayın.

Seçimi açıklarken ölçüyü de gösterin

Kopyalanabilir benzerlik denetimi
Q=(100,1000), A=(99,1100), B=(95,1000). İlk özellik parlaklık özeti, ikinci kenar sayısı; hepsi sentetik. Ham kare uzaklığı özellik katkılarına ayır. Sonra x farkını 1’e, y farkını 100’e bölen sabit ölçekte tekrar hesapla. Sorgu ve adaylarda aynı dönüşümü kullan. İki sıralamayı ve değişimin nedenini yaz. Etiket, gerçek görüntü veya model eğitimi olmadığı için kalite artışı iddia etme.
Açıklamalı beklenen çıktı
Ham ölçü: A=10001, B=25; B yakın.
Sabit ölçekli ölçü: A=2, B=25; A yakın.
Değişen veri veya etiket yok. İkinci özelliğin göreli katkısı değişti. Hangi ölçünün görev için daha iyi olduğu bu üç sentetik kayıttan belirlenemez.

Sonuç kaydında yalnızca kazanan aday adını tutarsanız ileride yapılan ölçek değişikliğini açıklamak güçleşir. Sorgu kimliği, aday kimlikleri, özellik tanımları ve kullanılan ölçek sürümü birlikte kayıtlı olmalıdır. Aynı A etiketi farklı bir özellik çıkarma sürümünde başka sayıları taşıyabilir. Benzerlik sonucu, hesaplandığı veri ve ölçü bağlamıyla anlam kazanır.

  • Özelliklerin birimini, aralığını ve çıkarılma tanımını doğrulayın.
  • Her uzaklıkta özellik katkılarını ayrı gösterin.
  • Sorgu ve adayların aynı dönüşümden geçtiğini kontrol edin.
  • Sıra değişimini doğruluk artışıyla eşitlemeyin.

Bütün adaylara ve sorguya aynı merkez kaymasını uygulamak farkları değiştirmez; farklı ölçek katsayıları ise göreli katkıları değiştirir. Bu ayrım dönüşüm denetiminde yardımcıdır. Noktaları yalnızca ekranda farklı eksen aralıklarıyla çizmekle hesapta gerçekten başka katsayı kullanmak da aynı şey değildir. Rapor, görüntü ölçeğini değil hesaplanan uzaklık tanımını göstermelidir.

Adayın ikinci özelliğini büyütün

A kaydının kenar sayısını 1100 yerine 1500 yapın. Parlaklığı 99 kalsın; Q ve B değişmesin. İkinci senaryodaki sabit ölçeklerle yeni kare uzaklığı hesaplayın ve en yakın adayı bulun. Bu değişimin neden ölçekli yaklaşımın her durumda A’yı seçeceği anlamına gelmediğini açıklayın.

Alıştırmanın cevabı
Yeni A farkları −1 ve 500. Ölçekli kare uzaklık 1 + (500/100)² = 26. B hâlâ 25; bu kez B daha yakındır. Ölçek bir aday adına bağlı seçim kuralı değildir; verilmiş farkları belirli ağırlıklarla karşılaştırır.

İncelemenin teslimatı iki sıralama listesiyle sınırlı kalmasın. Kullanılan özellikleri, katkı hesabını ve seçimin değiştiği koşulu aynı kayıtta gösterin. Bu açıklama, ekip içinde “benzer” sözcüğünün hangi sayısal ölçüyü anlattığını tartışmak için somut bir başlangıç sağlar.

Kaynaklar ve doğrulama

İlgili okumalar

Üretimde Yapay Zekâ

Üretimde Yapay Zekâ programında benzerlik için kullandığınız özelliklerin ölçeklerini birlikte tartışabilirsiniz. Her özelliğin uzaklığa katkısını çıkarmak, aday seçiminin hangi ölçümden etkilendiğini gösterir.

  • Kuruma özel planlanır