Crubin-PT 0.1

Русскоязычный претрейн с нуля на FineWeb2-HQ + Ficbook, ~4B packed tokens. Сделан для дальнейшего обучения под один локальный мем, название тоже локальный мем. Мозги не ебите особо.

Training loss

Архитектура LlamaForCausalLM · 16 layers · hidden 768 · FFN 2048 · GQA 12/4 · RoPE
Параметры 116,048,640
Контекст 2048
Vocab 20,000 (byte-level BPE)
Train loss 10.05 → 2.87 (min 2.51 @ step 9820)
Датасет ~4.0B packed

План обубления

  1. Первые 8% шагов — 100% FineWeb2-HQ
  2. Далее линейный рост:
    p(ficbook): 0% → 30% до конца обучения (p(fineweb): 100% → 70%)

Фанфики в фикбуке в среднем длиннее → доля токенов в ficbook немного выше, чем вероятность появления документа.

Онлайн-фильтры: короткие/пустые документы, нулевые/управляющие байты, экстремальные повторы символов.


Гиперпараметры обубления

Init random (from-scratch)
Optimizer AdamW 8-bit (β1=0.9, β2=0.95)
Peak LR 3e-4 · cosine · warmup ~3%
Weight decay 0.1
Batch 64 × grad_accum 2 (effective 128)
Sequence length 2048 · packing
Precision bf16 · gradient checkpointing
Stack Unsloth + TRL SFTTrainer (CLM pretrain)

Результаты:

Сомнительные.

Приблизительные значения NLL/PPL на паркетных выборках, похожих на обучающую выборку:

Датасет loss PPL
FineWeb2 ~2.5 ~13
Ficbook ~3.2 ~23

Наблюдаемое поведение:

  • Последовательные продолжения на русском языке (особенно при выборке + repetition_penalty)
  • При жадном декодировании без штрафа может возникнуть зацикливание (типично для небольших языковых моделей)
  • Слабое соблюдение фактов / математических правил / инструкций (ожидаемо для базовой CLM с 100 миллионами параметров)

Наименее хуёвые результаты были с такими параметрами:

do_sample=True
temperature=0.7–0.9
top_p=0.9
repetition_penalty=1.1–1.2
max_new_tokens=64–256

Ограничения

  • 116M глупих параметров
  • Ебучие фанфики в датасете
  • Мои глупенькие познания в обучении LLM
  • Not suitable for safety-critical or factual QA without further alignment / retrieval
Downloads last month
21
Safetensors
Model size
0.1B params
Tensor type
F32
·
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Datasets used to train rylyshkvar/crubin-base