Küçük harfe çevirmek dil bilgisi de ister
Bir not arşivinde ISI ve İSİ etiketleri var. Yapay zekâ bütün büyük harfleri küçülterek arama anahtarı hazırlıyor. Sonuçların ikisini de isi yaparsa farklı Türkçe harf dizileri birleşmiş olur. Tersine, varsayılan dönüşüm noktalı İ için beklenmeyen birleşik bir dizi bırakırsa aynı sözcük bulunamayabilir. Büyük ve küçük harf dönüşümü yalnız görünüş düzenleme değildir; arama ilişkisinin hangi metinleri eşit sayacağını da etkiler.
Türkçede i harfinin büyüğü İ, ı harfinin büyüğü I’dır. Unicode’un kendi açıklaması bu iki çifti ayrı tanımlar ve dil bağımlı dönüşümün neden gerektiğini gösterir. Bu çalışmada yalnız Türkçe olarak etiketlenmiş metin alanlarını ele alacağız. Ürün kodu, parola veya farklı dildeki ad için aynı dönüşüm otomatik uygulanmaz. Önce alanın neyi temsil ettiğini belirlemek gerekir.Kaynak: Unicode — Case mappings FAQ
Dönüşümden önce kaynak diziyi koruyun
| Kimlik | Ham harf | Kod noktası | Türkçe küçük biçim |
|---|---|---|---|
| H1 | I | U+0049 | ı |
| H2 | İ | U+0130 | i |
| H3 | ı | U+0131 | ı |
| H4 | i | U+0069 | i |
H1 ile H3 ve H2 ile H4, bu alan için büyük/küçük harf farkını yok sayan karşılaştırmada eşleşebilir. H1 ile H2 ise aynı çift değildir. Dört ham harften iki arama anahtarı çıkması burada bilinçli bir tercihtir. Ham biçimi silerseniz kullanıcının ilk yazımını artık yalnız anahtardan geri kuramazsınız. Bu yüzden gösterilecek kaynak alanını ve aramada kullanılacak türetilmiş alanı birlikte saklayın.
Önceki Unicode normalleştirmesi uygulaması, aynı harfin farklı kanonik dizilerini karşılaştırıyordu. NFC kullanmak tek başına Türkçe büyük/küçük harf dönüşümü yapmaz. I ve ı, NFC sonrasında da farklı harf dizileridir. Normalleştirme ile harf küçültmeyi birbirinin yerine söylemek, hangi adımın hangi eşitliği oluşturduğunu gizler. İki işlem kullanılıyorsa sıra ve dil tercihi denetim kaydında görünmelidir.
Varsayılan ve Türkçe dönüşümü yan yana inceleyin
"I".toLowerCase() → "i"
"I".toLocaleLowerCase("tr") → "ı"
"İ".toLowerCase() → "i" + U+0307
"İ".toLocaleLowerCase("tr") → "i"
Ham metni koruyun; sonuç dizisini gerekirse kod noktalarıyla gösterin.Varsayılan küçültmede noktalı İ’nin sonucu i ve birleştirici nokta içerebilir. Ekranda kısa bir i gibi görünse de dizi, tek kod noktalı i ile ham eşitlikte aynı değildir. Bu sonuç karakter sayımını da etkileyebilir. Sorunu yalnız font değiştirmek veya gözle aynı demek çözmez. Denetimde hem görünür metin hem kod noktası dizisi yararlı kanıttır.
| Kimlik | Ham metin | Dil | Türkçe arama anahtarı |
|---|---|---|---|
| M1 | ISI | tr | ısı |
| M2 | ısı | tr | ısı |
| M3 | İSİ | tr | isi |
| M4 | isi | tr | isi |
Türkçe küçük biçim üzerinden M1/M2 ve M3/M4 iki ayrı gruptur. I, İ ve ı harflerinin hepsini i’ye çeviren basit değiştirme kuralı dört kaydı bir gruba indirir. Bu, toleranslı arama için bazen istenebilecek daha geniş bir ilişkidir; ancak Türkçe harf eşlemesi diye sunulamaz. Arama kolaylığı için genişletilmiş bir eşleşme seçilse bile sonuçlar ana kayıtların kimliklerini birleştirmemelidir.
Arama anahtarı ile kayıt kimliğini ayırın
Bir not başlığının farklı yazımlarla bulunması ile iki notun aynı kayıt olması farklı kararlardır. Arama anahtarı benzer başlıkları aday olarak getirebilir; kayıt birleştirme için bağımsız kimlik ve içerik kanıtı gerekir. Başlıkları küçültüp tekilleştirmek, aynı başlıklı iki ayrı notu da silebilir. Bu uygulama sadece karşılaştırma alanını üretir; arşivdeki satırları birleştirmez veya dosya adlarını değiştirmez.
Dil bilgisi olmayan bir alanı gördüğünüzde metnin Türkçe olabileceğini fark etmek yararlıdır, fakat bunun kesin olduğunu varsaymayın. Karışık bir arşivde kullanıcı tarafından seçilen dil, kaynağın belge dili veya alan sözleşmesi kullanılabilir. Kod alanları için kaynak sistemin eşitlik kuralı korunur. Bir yazı başlığı için uygun olan dönüşüm, dış sistemin büyük harfe duyarlı kodunda yanlış eşleşme yaratabilir.
Kontrol dizisine tek harflerin yanı sıra gerçek göreve benzeyen kısa sözcükler ekleyin. Hangi çiftlerin eşleşmesi, hangilerinin ayrı kalması gerektiğini önce siz yazın. Yalnız başarılı örnekleri sınamak, dört harfi tek harfe indiren aşırı temizleme yöntemini de başarılı gösterebilir. Ayırmak istediğiniz çiftlerin korunması, birleştirmek istedikleriniz kadar önemli bir testtir.
AI’dan dönüşümün sınırını açıklamasını isteyin
M1=ISI, M2=ısı, M3=İSİ, M4=isi; hepsi Türkçe not başlığıdır, kayıt kimliği değildir. Ham metni koruyup Türkçe küçük harf anahtarını üret. M1/M2 ve M3/M4 eşleşmeli; iki grup birbirinden ayrı kalmalı. Varsayılan JavaScript toLowerCase ile toLocaleLowerCase("tr") sonuçlarını I ve İ üzerinde ayrıca karşılaştır. Görünmeyen nokta varsa kod noktasını yaz. Kaydı silme, ad değiştirme veya bütün diller için doğruluk garantisi verme.M1/M2 → ısı. M3/M4 → isi. Dört kaynak kayıt korunur; iki arama anahtarı vardır. I ve İ tek Türkçe harf çifti değildir. Dil belirtilmeyen yeni alan için otomatik Türkçe dönüşüm kararı verilmez.
Bu çıktıyı kontrol ederken anahtarların sayısını tek başına yeterli bulmayın. İki grup oluşması doğru üyelerin bulunduğunu göstermez. Kimlikleri anahtarlarla yan yana okuyun; ardından ham metnin değişmediğini karşılaştırın. Dönüşümün tekrar uygulanması yeni anahtarı değiştirmemeli, fakat bu özellik de doğru dil seçiminin yerine geçmemelidir.
İki kelimeyi büyük harfe geri götürün
Türkçe başlıklar için ılık ve ilik sözcüklerinin büyük biçimlerini bulun. Sonra bu büyük biçimleri Türkçe küçük harfe çevirin. İki sözcüğün ayrı kaldığını denetleyin. Bu alıştırma kayıt kimliğini geri üretmez; yalnız verilen harf çiftlerinde dönüşümün davranışını gösterir.
ılık → ILIK → ılık. ilik → İLİK → ilik. İki farklı sözcük ayrı kalır. I, İ ve ı harflerini i’ye indiren kural bu ayrımı bozabilir; geniş arama tercihi ile Türkçe büyük/küçük eşlemesi aynı işlem değildir.
Metin temizliği kaydınızda ham alan, dil, dönüşüm adı ve türetilmiş anahtar birlikte yer alsın. Böylece eşleşmenin hangi tercihten doğduğu görülebilir. Kullanıcının sözcüklerini koruyarak aramayı kolaylaştırmak, açıklanmamış bir dönüşümle farklı kayıtları tekleştirmekten daha denetlenebilir bir çalışma sunar.
Kaynaklar ve doğrulama
- Unicode — Case mappings FAQ
Türkçede i/İ ve ı/I harf çiftlerinin ayrı büyük/küçük eşlemeleri.
Erişim ve kontrol:
Üretken Yapay Zekâ ile İş Verimliliği
Üretken Yapay Zekâ ile İş Verimliliği eğitiminde Türkçe başlıklarınızdan küçük bir karşılaştırma kümesi kurabilirsiniz. Eşleşmesi ve ayrı kalması gereken örnekleri birlikte kullanmak, metin temizleme önerilerini uygulamadan önce değerlendirmeyi kolaylaştırır.
- Bireysel tarih henüz açıklanmadı