Türkçe Byte-Level BPE Tokenizer
Türkçe Wikipedia makaleleri üzerinde eğitilmiş, 128.000 kelime dağarcığına (vocab) sahip byte-level BPE tokenizer.
Detaylar
- Vocab boyutu: 128.000
- Algoritma: Byte-Level BPE (GPT-2/LLaMA tarzı)
- Eğitim verisi: Türkçe Wikipedia (wikimedia/wikipedia, tr)
- Kütüphane: Hugging Face
tokenizers
Kullanım
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("kullanici-adi/repo-adi")
metin = "Türkiye ve Azerbaycan kardeş ülkelerdir."
ids = tokenizer.encode(metin)
print(ids)
print(tokenizer.decode(ids))
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support