epfml/FineWeb2-HQ
Viewer • Updated • 380M • 13.7k • 75
How to use rylyshkvar/crubin-base with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("text-generation", model="rylyshkvar/crubin-base") # Load model directly
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("rylyshkvar/crubin-base")
model = AutoModelForCausalLM.from_pretrained("rylyshkvar/crubin-base", device_map="auto")How to use rylyshkvar/crubin-base with vLLM:
# Install vLLM from pip:
pip install vllm
# Start the vLLM server:
vllm serve "rylyshkvar/crubin-base"
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:8000/v1/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "rylyshkvar/crubin-base",
"prompt": "Once upon a time,",
"max_tokens": 512,
"temperature": 0.5
}'docker model run hf.co/rylyshkvar/crubin-base
How to use rylyshkvar/crubin-base with SGLang:
# Install SGLang from pip:
pip install sglang
# Start the SGLang server:
python3 -m sglang.launch_server \
--model-path "rylyshkvar/crubin-base" \
--host 0.0.0.0 \
--port 30000
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:30000/v1/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "rylyshkvar/crubin-base",
"prompt": "Once upon a time,",
"max_tokens": 512,
"temperature": 0.5
}'docker run --gpus all \
--shm-size 32g \
-p 30000:30000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--env "HF_TOKEN=<secret>" \
--ipc=host \
lmsysorg/sglang:latest \
python3 -m sglang.launch_server \
--model-path "rylyshkvar/crubin-base" \
--host 0.0.0.0 \
--port 30000
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:30000/v1/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "rylyshkvar/crubin-base",
"prompt": "Once upon a time,",
"max_tokens": 512,
"temperature": 0.5
}'How to use rylyshkvar/crubin-base with Docker Model Runner:
docker model run hf.co/rylyshkvar/crubin-base
Русскоязычный претрейн с нуля на FineWeb2-HQ + Ficbook, ~4B packed tokens. Сделан для дальнейшего обучения под один локальный мем, название тоже локальный мем. Мозги не ебите особо.
| Архитектура | LlamaForCausalLM · 16 layers · hidden 768 · FFN 2048 · GQA 12/4 · RoPE |
| Параметры | 116,048,640 |
| Контекст | 2048 |
| Vocab | 20,000 (byte-level BPE) |
| Train loss | 10.05 → 2.87 (min 2.51 @ step 9820) |
| Датасет | ~4.0B packed |
p(ficbook): 0% → 30% до конца обучения
(p(fineweb): 100% → 70%)Фанфики в фикбуке в среднем длиннее → доля токенов в ficbook немного выше, чем вероятность появления документа.
Онлайн-фильтры: короткие/пустые документы, нулевые/управляющие байты, экстремальные повторы символов.
| Init | random (from-scratch) |
| Optimizer | AdamW 8-bit (β1=0.9, β2=0.95) |
| Peak LR | 3e-4 · cosine · warmup ~3% |
| Weight decay | 0.1 |
| Batch | 64 × grad_accum 2 (effective 128) |
| Sequence length | 2048 · packing |
| Precision | bf16 · gradient checkpointing |
| Stack | Unsloth + TRL SFTTrainer (CLM pretrain) |
Сомнительные.
Приблизительные значения NLL/PPL на паркетных выборках, похожих на обучающую выборку:
| Датасет | loss | PPL |
|---|---|---|
| FineWeb2 | ~2.5 | ~13 |
| Ficbook | ~3.2 | ~23 |
Наблюдаемое поведение:
repetition_penalty)do_sample=True
temperature=0.7–0.9
top_p=0.9
repetition_penalty=1.1–1.2
max_new_tokens=64–256