Türkçe Byte-Level BPE Tokenizer

Türkçe Wikipedia makaleleri üzerinde eğitilmiş, 128.000 kelime dağarcığına (vocab) sahip byte-level BPE tokenizer.

Detaylar

  • Vocab boyutu: 128.000
  • Algoritma: Byte-Level BPE (GPT-2/LLaMA tarzı)
  • Eğitim verisi: Türkçe Wikipedia (wikimedia/wikipedia, tr)
  • Kütüphane: Hugging Face tokenizers

Kullanım

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("kullanici-adi/repo-adi")

metin = "Türkiye ve Azerbaycan kardeş ülkelerdir."
ids = tokenizer.encode(metin)
print(ids)
print(tokenizer.decode(ids))
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support