Türkçe BPE Tokenizer

Türkçe Wikipedia'dan (resmi MediaWiki API üzerinden, action=query&generator=random) toplanan bir korpus üzerinde eğitilmiş BPE (Byte-Pair Encoding) tokenizer.

Eğitim Detayları

  • Yöntem: BPE (Hugging Face tokenizers kütüphanesi)
  • Pre-tokenizer: Whitespace
  • Hedef vocab boyutu: 256.000
  • Gerçekleşen vocab boyutu: 78.431 (korpus boyutu hedefe göre daha küçük kaldığı için trainer daha düşük bir vocab'da yakınsadı)
  • Özel tokenlar: [UNK], [PAD], [BOS], [EOS]
  • Korpus kaynağı: tr.wikipedia.org resmi API, rastgele makaleler (grnnamespace=0, düz metin explaintext=1)

Kullanım

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("eraycancelik/BPE-tokenizer")
ids = tokenizer("merhaba dünya")
print(ids)

Bilinen Sınırlamalar

  • Vocab boyutu, korpusun küçüklüğü nedeniyle hedeflenen 256K'nın oldukça altında kaldı; daha büyük/çeşitli bir korpusla yeniden eğitim, alt-kelime parçalanma kalitesini artırabilir.
  • Whitespace pre-tokenizer + eksik bir decoder yapılandırması nedeniyle decode edilen metinde kelime-içi ekstra boşluklar görülebilir (örn. "merhaba" → "mer ha ba"); üretim kullanımından önce ByteLevel veya Metaspace tipi bir pre-tokenizer/decoder ile yeniden değerlendirilmesi önerilir.
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support