Tanım
Tokenization, metnin yapay zekâ ve NLP modelleri tarafından işlenebilmesi için token adı verilen küçük birimlere ayrılması sürecidir. Türkçede tokenlara ayırma veya belirteçleme olarak açıklanabilir.
Tokenization sonucunda bir cümle kelimelere, alt kelimelere, karakterlere veya özel sembollere bölünebilir. Modern büyük dil modelleri çoğunlukla alt kelime tabanlı tokenization yöntemleri kullanır.
Bu süreç, modelin metni sayısal temsillere dönüştürebilmesi için ilk adımlardan biridir. Tokenization kalitesi, modelin farklı dilleri, nadir kelimeleri ve teknik ifadeleri işleme biçimini etkileyebilir.
Kökeni
Tokenization, doğal dil işleme alanının temel ön işleme adımlarından biridir. Bilgisayarların metni analiz edebilmesi için serbest metnin daha düzenli ve işlenebilir parçalara ayrılması gerekir.
İlk dönemlerde boşluk ve noktalama işaretlerine göre kelime düzeyinde tokenization yaygındı. Ancak dillerin yapısı, birleşik kelimeler, ekler ve nadir kelimeler bu yaklaşımı sınırlı hale getirdi.
LLM sistemleriyle birlikte subword tokenization daha yaygın kullanılır hale geldi. Bu sayede model, daha önce görmediği kelimeleri bile parçalara ayırarak işleyebilir.
Nerelerde Kullanılır?
Tokenization; LLM, NLP pipeline, search engine, embedding modeli, sentiment analysis, text classification, machine translation ve AI assistant sistemlerinde kullanılır.
Bir model, “AI Visibility” ifadesini bir veya birden fazla tokena ayırabilir. Bu parçalar daha sonra sayısal temsillere dönüştürülerek model tarafından işlenir.
AI ürünlerinde tokenization, context window sınırı ve API maliyeti açısından da önemlidir. Aynı metin farklı modellerde farklı token sayısına sahip olabilir.
Örnek Kullanım
“Büyüme Mimarisi” ifadesi modele bağlı olarak iki kelime tokenı, alt kelime parçaları veya farklı semboller halinde tokenlara ayrılabilir.
Bir AI mühendisi, “Bu dilde tokenization verimsiz çalışıyor; aynı metin çok fazla token tüketiyor” diyebilir.
Karıştırılan Kavramlar
- Tokenization ve Token: Tokenization metni parçalara ayırma sürecidir. Token bu sürecin ürettiği birimdir.
- Tokenization ve Embedding: Tokenization metni birimlere böler. Embedding bu birimleri sayısal vektörlere dönüştürür.
- Tokenization ve Text Segmentation: Text Segmentation metni daha geniş bölümlere ayırabilir. Tokenization modelin işlediği küçük birimlere odaklanır.
- Tokenization ve Chunking: Chunking uzun metni daha büyük parçalara ayırır. Tokenization bu parçaların içindeki temel token birimlerini oluşturur.
İlgili Terimler
- Token
- LLM
- NLP
- Embedding
- Context Window
- Chunking
- Text Classification
- Language Model
- Generative AI
Büyüme Mimarisi Notu
Tokenization, büyüme mimarisinde AI sistemlerinin metni nasıl parçalayıp işlediğini belirleyen teknik temeldir. Metnin model tarafından nasıl görüldüğü, çıktı kalitesini ve maliyeti etkiler.
Çok dilli içerik, uzun doküman ve RAG sistemlerinde tokenization davranışı dikkatle değerlendirilmelidir. Token verimliliği, AI ölçekleme maliyetini doğrudan etkiler.