2.34 GB
18 files
Updated 2 days ago
Name
Size
agent_traces
openai_chat
scripts
.gitattributes2.88 kB
xet
README.md3.04 kB
xet
dataset_config.json285 Bytes
xet
dataset_infos.json3.74 kB
xet
quality_distribution.png50.1 kB
xet
README.md

๐Ÿง  Fable-5 Premium Dataset

RACER IS OP

A rigorously cleaned, high-quality supervised fine-tuning (SFT) dataset built from Claude Fable-5 agent traces.

Priorities: Quality > Ease of Access > Quantity

๐Ÿ“Š Dataset Overview

Property Value
Total Records 12,730
Train Split 5,728 (45.0%)
Validation Split 318 (2.5%)
Test Split 319 (2.5%)
Created 2026-07-30
License MIT

๐Ÿ“ฆ Formats Available

This dataset is available in two formats:

  1. OpenAI Chat Format โ€” Standard messages array with user/assistant/tool roles. Ready for Axolotl, Unsloth, and OpenAI fine-tuning API.
  2. Hugging Face Agent Traces Format โ€” Native HF Agent Traces viewable in Data Studio.

๐Ÿ”— Sources

Source Fable-5 Rows Description

๐Ÿงน Quality Pipeline

  1. Deduplication โ€” SHA-256 content hashing across all sources (cross-source dedup)
  2. Structural Validation โ€” Valid message schemas, tool call IDs, proper role sequencing
  3. Content Filtering โ€” Remove empty/truncated responses, error-only sessions, placeholders
  4. PII Scrubbing โ€” Remove local paths, API keys, environment-specific data
  5. Tool Call Validation โ€” Ensure tool calls have matching tool responses
  6. Quality Scoring โ€” Multi-dimensional quality metrics

๐Ÿ“ˆ Quality Distribution

Quality Distribution
Range Count
0.3-0.5 448
0.7-0.8 532
0.8-0.9 3,736
0.9-1.0 6,740

๐ŸŽฏ Usage

With Hugging Face Datasets

from datasets import load_dataset

# Load OpenAI Chat format
dataset = load_dataset("saidutta69/fable-5-premium", "openai_chat", split="train")

# Load Agent Traces format
traces = load_dataset("saidutta69/fable-5-premium", "agent_traces", split="train")

With Axolotl

# axolotl config
dataset:
  - path: saidutta69/fable-5-premium
    type: chat_template
    split: train

With Unsloth

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="unsloth/llama-3-8b",
    max_seq_length=4096,
)

๐Ÿ—๏ธ Chain-of-Thought (CoT)

  • reasoning field โ€” Separate field for models that support explicit thinking tokens
  • Embedded <think> tags โ€” CoT merged into assistant content for standard fine-tuning
Total size
2.34 GB
Files
18
Last updated
Aug 31
Pre-warmed CDN
US EU US EU

Contributors