Yapay zekâ

Türkçe yazmak yapay zekâya ne kadar pahalı? Kendi sitemin metniyle ölçtüm

mcalab.com.tr'nin TR ve EN metinleri aynı uzunlukta. Tokenizer'dan geçirince Türkçe %39 daha fazla token çıktı. Ölçümün tamamı ve faturaya etkisi.

Bu yazının İngilizcesi: English version.

Bir süredir kafamı kurcalayan bir şüphe vardı: Türkçe prompt yazmak İngilizceden pahalı mı? Herkes "eklemeli dil, token'ı çok yer" diyor ama kimse sayı vermiyor. Ben de kendi sitemi kobay yaptım.

Şansım şu: mcalab.com.tr bugüne kadar iki dilli tek sayfa mantığıyla yazıldı. Aynı HTML'de data-lang="tr" ve data-lang="en" etiketli iki metin yan yana duruyor. Yani elimde kendi yazdığım, telifi bana ait, gerçek bir paralel derlem var. Çeviri motoru değil, insan eliyle iki dilde kurulmuş cümleler.

Yöntem

Siteden data-lang çiftlerini çekip HTML'i temizleyen küçük bir betik yazdım. Tekrar edenleri (menü başlıkları her sayfada var) attım, geriye 24 benzersiz TR/EN çifti kaldı. Sonra bunları iki tokenizer'dan geçirdim:

Araç gpt-tokenizer npm paketi, sürüm 4.0.0. Ölçüm 19 Ağustos 2026'da yapıldı.

Sonuç

Önce şu tesadüfe bakın: derlemin iki dili neredeyse birebir aynı karakter uzunluğunda. Bunu ben ayarlamadım, öylece çıktı.

ÖlçüTürkçeİngilizceOran
Karakter2.5082.5181,00
Kelime3564410,81
Token (o200k)7705541,39
Token (cl100k)1.0145631,80
Karakter / token (o200k)3,264,55

Aynı bilgiyi, aynı karakter sayısında anlatıyorum. Modern tokenizer'da Türkçe %39 daha fazla token ediyor. Eski tokenizer'da fark %80'di.

Kelime sayısına dikkat: Türkçe aynı şeyi %19 daha az kelimeyle söylüyor. "Kaydedebilirsiniz" bir kelime, "you can save it" dört kelime. Ama token cinsinden Türkçe kelime başına 2,16, İngilizce 1,26 token tutuyor. Yani Türkçenin kısalık avantajı tokenizer'da yeniyor, üstüne para veriyorsunuz.

Neden böyle

Tokenizer'lar İngilizce metin ağırlıklı derlemlerde eğitiliyor. Sık geçen İngilizce kelimeler tek bir token'a oturuyor; Türkçenin ekleri ise parçalanıyor. Birkaç kelimeyi tek tek geçirdim:

Kelimeo200k token
computer1
bilgisayar3
update1
güncelleme4
application1
uygulamalarımızın5
çalıştıramadıklarımızdan8
Zıpla3

Son satır beni güldürdü: kendi oyunumun adı üç token. Z, ı, pla. Türkçeye özgü ı harfi tek başına bir token yiyor. Latin alfabesi dışına çıkmadan bile pahalıya geliyoruz.

Bir istisna da var: Türkiye tek token. Demek ki derlemde yeterince sık geçen özel adlar sözlüğe girmiş. Yani mesele "Türkçe karakter" değil, sıklık. Tokenizer, gördüğü şeyi ucuzlatıyor.

Eski tokenizer'dan yeniye geçiş Türkçeye ne kazandırdı

Bu ölçümün en sevindirici tarafı: aynı 24 çiftte Türkçe token sayısı cl100k'da 1.014 iken o200k'da 770'e düşmüş. %24 ucuzlama. İngilizce tarafta ise 563'ten 554'e, yani neredeyse hiç değişmemiş.

Yeni tokenizer'ın kazancının büyük kısmını İngilizce dışındaki diller aldı. Kimse bunu duyuru metnine "Türkçe %24 ucuzladı" diye yazmadı ama sayı bu.

Faturaya çevirelim

19 Ağustos 2026 fiyatlarıyla, Anthropic'in fiyat sayfasına göre Claude Opus 5 girdisi 1 milyon token başına 5 dolar. Ölçtüğüm karakter/token oranlarıyla:

SenaryoTR tokenEN tokenOpus 5 girdi maliyeti farkı
100 bin karakterlik doküman~30.700~22.0000,04 $
Günde 500 böyle çağrı15,3 M11,0 M~21 $/gün
Aynısı ay boyunca460 M330 M~650 $/ay

Tek seferlik bir sohbette fark yuvarlama hatası. Ama üretimde çalışan bir ürününüz varsa, Türkçe olmak size ayda üç haneli dolar yazıyor. Bunu bilerek fiyatlamak lazım.

Bir de ters tarafı var: bağlam penceresi de token cinsinden. 1 milyon token'lık pencereye İngilizce ~4,55 milyon karakter sığarken Türkçe ~3,26 milyon karakter sığıyor. Yani "1M bağlam" reklamı Türkçe kullanıcıya sessizce %28 daha küçük geliyor.

Ne yapıyorum

Ölçümden sonra kendi kullanımımda üç şeyi değiştirdim:

  1. Sistem promptunu İngilizce yazıyorum. Modelden Türkçe cevap istemek ayrı şey, ona verdiğim talimatı Türkçe yazmak ayrı şey. Talimat her çağrıda tekrar gidiyor; en pahalı kısmı o. İngilizceye çevirince aynı talimat gözle görülür şekilde küçüldü. Cevap kalitesinde bir fark hissetmedim — ama bu benim izlenimim, ölçüm değil.
  2. Uzun sabit metinleri önbelleğe alıyorum. Anthropic'te önbellek okuması temel girdi fiyatının onda biri. Türkçe metnin token şişkinliğini en ucuza kapatan yol bu; şişkinliği yok etmiyor, üstündeki çarpanı düşürüyor.
  3. JSON anahtarlarını ve alan adlarını Türkçe yazmıyorum. Ölçümden sonra fark ettiğim en aptalca kayıp buydu. Yapılandırılmış çıktı isterken şemadaki her anahtar her çağrıda gidiyor; kullanici_adi yerine username yazmak tek başına birkaç token, ama şema yirmi alanlıysa ve günde binlerce çağrı yapıyorsanız toplamı görünür oluyor. Kullanıcıya gösterilen metin Türkçe kalsın, makineye giden anahtarlar İngilizce olsun.
  4. Türkçe kullanıcı metnini olduğu gibi bırakıyorum. Kullanıcının yazdığını çevirip modele vermek hem anlam kaybettiriyor hem de çeviri çağrısının kendisi para. Şişkinliğe orada razıyım.

Bu ölçümün sınırları

Dürüst olmak lazım, bu bir akademik çalışma değil:

Yani "Türkçe %39 pahalı" cümlesi, tam olarak şu demek: benim yazdığım tarzda metinlerde, o200k_base tokenizer'ında, %39. Başka bir derlemde 1,3 de çıkar 1,5 de.

Yine de eminim olduğum şey şu: fark var, küçük değil, ve kimse size bunu söylemiyor. Fiyat sayfalarındaki "1 milyon token başına 5 dolar" ifadesi dil-nötr görünüyor ama değil. Türkçe konuşan bir geliştirici olarak, aynı dolarla daha az iş yapıyorsunuz.

Ölçümü kendi metninizle tekrarlamak isterseniz yöntem basit: iki dilde aynı içeriği alın, gpt-tokenizer paketinden o200k_base kodlayıcısını çağırın, uzunlukları bölün. On dakikalık iş. Kendi rakamınızı görmek, benimkine güvenmekten iyidir.

Bu blogda reklam vermek ya da birlikte iş yapmak

MCALAB bağımsız bir stüdyo. Sponsorluk, çapraz tanıtım ya da bir iş birliği için:

ads@mcalab.com.tr

Ayrıntılar: Reklam & iş birliği. Kullanıcı desteği için destek sayfası.