Custom BPE Tokenizer

Model Özeti

Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle Marvel evreni terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir BPE (Byte-Pair Encoding) Tokenizer modelidir.

Gazi Üniversitesi Teknoloji Fakültesi Bilgisayar Mühendisliği bölümü projeleri kapsamında, sıfırdan yapılandırılmış ve spesifik bir alan üzerinde eğitilmiştir.

Model Detayları

Model Açıklaması

Standart tokenizer'lar genel verilerle eğitildiği için özel isimlerde (Örn: "Adamantium", "Wakanda", "Latveria") parçalama hataları yapabilir. Bu BPE Tokenizer, doğrudan Marvel evrenine ait Türkçe metinler üzerinden eğitilerek bu spesifik terminolojiyi tek parça veya en mantıklı alt-kelime öbekleri halinde tanımak üzere optimize edilmiştir.

  • Geliştirici: Ege Ertekin
  • Model Türü: Byte-Pair Encoding Tokenizer
  • Dil: Türkçe
  • Kütüphane: tokenizers, transformers
  • Sözlük Boyutu: 10.000

Kullanım Amacı

Doğrudan Kullanım

Bu tokenizer, Egertekin/marvel-domain-dataset veya benzeri Türkçe çizgi roman/fantastik evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilece temel dil modellerinde metin işleme aracı olarak kullanılmalıdır.

Eğitim Detayları

Eğitim Verisi

Tokenizer, tamamen Hugging Face Hub üzerinde bulunan Egertekin/marvel-domain-dataset veri seti kullanılarak eğitilmiştir. Bu veri setindeki Wikipedia tabanlı organik metinler ve manuel olarak girilip çoğaltılan soru-cevap çiftleri, eğitim derlemi olarak kullanılmıştır.

Eğitim Prosedürü

Model, Hugging Face tokenizers kütüphanesindeki BpeTrainer kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için [UNK] ve doldurma işlemleri için [PAD] gibi özel token'lar tanımlanmıştır.

  • Özel Tokenler: [PAD], [UNK], [CLS], [SEP], [MASK]
  • Ön-İşleme: ByteLevel(add_prefix_space=False)

Başlangıç

Tokenizer'ı projenizde kullanmak için aşağıdaki Python kodunu çalıştırabilirsiniz:

from transformers import PreTrainedTokenizerFast

# Tokenizer'ı Hugging Face üzerinden yükleme
tokenizer = PreTrainedTokenizerFast.from_pretrained("Egertekin/custom-bpe-tokenizer")

# Örnek kullanım
ornek_metin = "Wolverine'in iskeleti Adamantium ile kaplıdır."
tokenlar = tokenizer.tokenize(ornek_metin)

print(tokenlar)
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support