Tanım
Token, yapay zekâ ve doğal dil işleme sistemlerinde metnin model tarafından işlenebilir parçalara ayrılmış birimidir. Bir token kelime, kelime parçası, noktalama işareti, karakter veya alt kelime birimi olabilir.
Büyük dil modelleri metni doğrudan insan gibi kelime kelime değil, tokenlara ayrılmış temsil üzerinden işler. Modelin input ve output uzunluğu çoğu zaman token sayısıyla ölçülür.
Token kavramı; LLM, context window, prompt engineering, embedding, tokenization, inference cost ve model kapasitesi gibi birçok AI kavramıyla ilişkilidir.
Kökeni
Token kavramı, dil işleme ve bilgisayar bilimi alanlarında metni daha küçük işlenebilir parçalara ayırma ihtiyacından doğmuştur. Bilgisayarlar doğal dili anlamlandırmadan önce metni belirli birimlere dönüştürmek zorundadır.
Erken NLP sistemlerinde token çoğunlukla kelime düzeyinde ele alınırken, modern LLM sistemlerinde alt kelime tabanlı tokenization yöntemleri yaygınlaşmıştır. Bu yöntemler farklı dillerdeki kelime varyasyonlarını ve nadir kelimeleri daha esnek işlemeyi sağlar.
LLM kullanımının yaygınlaşmasıyla token, yalnızca teknik NLP kavramı değil, AI maliyeti, hız ve bağlam kapasitesi açısından da önemli operasyonel metrik haline gelmiştir.
Nerelerde Kullanılır?
Token; LLM promptlarında, model yanıtlarında, context window hesaplarında, API fiyatlandırmasında, embedding üretiminde, text generation ve NLP pipeline süreçlerinde kullanılır.
Bir kullanıcı uzun bir dokümanı modele verdiğinde bu doküman tokenlara ayrılır. Model, context window sınırı içinde kalabildiği kadar tokenı işleyebilir.
AI ürünlerinde token sayısı, yanıt süresi ve maliyet üzerinde doğrudan etkili olabilir. Gereksiz uzun promptlar daha fazla token tüketebilir ve işlem maliyetini artırabilir.
Örnek Kullanım
Bir LLM API çağrısında 2.000 token input ve 500 token output kullanılmışsa toplam token tüketimi 2.500 olabilir.
Bir AI mühendisi, “Prompt çok uzun olduğu için token maliyeti artıyor; bağlamı sadeleştirmeliyiz” diyebilir.
Karıştırılan Kavramlar
- Token ve Kelime: Kelime dilbilgisel birimdir. Token modelin metni işlemek için kullandığı parça olabilir ve her zaman kelimeye eşit değildir.
- Token ve Character: Character tek karakterdir. Token bir veya daha fazla karakterden oluşabilir.
- Token ve Prompt: Prompt modele verilen talimattır. Prompt içindeki metin tokenlara ayrılarak işlenir.
- Token ve Embedding: Token metin birimidir. Embedding bu birimin veya metnin sayısal vektör temsilidir.
İlgili Terimler
- Tokenization
- LLM
- Context Window
- Prompt
- Embedding
- NLP
- Inference
- Generative AI
- Language Model
Büyüme Mimarisi Notu
Token, büyüme mimarisinde AI kullanımının görünmeyen maliyet ve kapasite birimidir. Prompt, doküman ve yanıt uzunlukları token tüketimiyle doğrudan ilişkilidir.
AI destekli içerik, destek ve arama sistemlerinde token yönetimi; maliyet, hız ve çıktı kalitesi açısından stratejik hale gelir. Gereksiz bağlam değil, doğru bağlam önemlidir.