Tokenization Nedir Nasıl Çalışır
Tokenization Nedir, Nasıl Çalışır?
Tokenization Nedir, Nasıl Çalışır?
Tüm bilgisayarlar, yani günlük hayatta kullandığımız laptoplardan veri merkezlerindeki güçlü sunuculara kadar hiçbiri aslında kelimeleri, cümleleri ya da harfleri doğrudan anlayamaz. Bilgisayarların insan dilini anlayabilmesi için metnin önce küçük parçacıklara sonra sayılara ve nihayetinde matrislere dönüştürülmesi gerekir.
Tokenization temel olarak insan dilindeki metinlerin, LLM (büyük dil modeli) tarafından anlaşılabilmesi amacıyla küçük parçacıklara bölünmesine ve sonrasında sayılsal hale getirilmesine denir.
Tokenization, kelime olarak çoğunlukla kelimelere bölmek anlamında kullanılsa da LLM dünyasındaki tokenization kelimelere bölme ve sayısal hale getirme sürecinin tamamıdır.
Tokenization süreci ancak insan dilinin yorumlanması ve anlamlandırılması gereken durumlarda yapılır, Doğal Dil İşleme (NLP/AI) yapılmayacaksa metin matrise çevrilmez.
Tokenization yapmaya kalktığımızda teorik olarak 3 ihtimalin aklımıza gelmesi doğaldır. Cümleleri parçalarken; kelimelere göre, harflere göre ya da kelime kök ve eklerine göre parçalayabiliriz.
Kelime Düzeyinde (Word-level) yaparsak örneğin "Kitaplıktakiler" gibi kelimeler yani ekleriyle birlikte kelimeler işlenmeye çalışır ve doğal olarak sözlük çok büyür. Out-of-Vocabulary (OOV) model tıkanma problemi yaşanabilir.
Karakter Düzeyinde (Character-level) bölersek, örneğimk-i-t-a-p...Sözlük çok küçülür ama kelimeler arasındaki anlamsal bağ kopar ve girdi dizisi çok uzar.
O zaman en iyisi Alt-Kelime Düzeyinde Subword-level bölmek. Kelimeleri köklerine ve eklerine ayırır (kitap + lık + ta + kiler) Böylece hem sözlük boyutunu ideal seviyede tutar hem de nadir kelimeleri tanıdık kök/ek parçalarına bölerek OOV problemini çözer.