Dynamic Multi-Byte Prediction With Hierarchical Language Models Paper • 2608.15454 • Published 8 days ago • 18
When Cases Get Rare: A Retrieval Benchmark for Off-Guideline Clinical Question Answering Paper • 2605.21807 • Published May 20
To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining Paper • 2604.00715 • Published Apr 1
BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning Paper • 2602.04085 • Published Feb 3
Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models Paper • 2305.13707 • Published May 23, 2023
ScholarEval: Research Idea Evaluation Grounded in Literature Paper • 2510.16234 • Published Oct 17, 2025 • 2
CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders Paper • 2509.00691 • Published Aug 31, 2025 • 2
Continually Adding New Languages to Multilingual Language Models Paper • 2509.11414 • Published Sep 14, 2025
FLEXITOKENS: Flexible Tokenization for Evolving Language Models Paper • 2507.12720 • Published Jul 17, 2025 • 10
Dynamic Multi-Byte Prediction With Hierarchical Language Models Paper • 2608.15454 • Published 8 days ago • 18
ScholarEval: Research Idea Evaluation Grounded in Literature Paper • 2510.16234 • Published Oct 17, 2025 • 2
MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization Paper • 2407.08818 • Published Jul 11, 2024
Steering off Course: Reliability Challenges in Steering Language Models Paper • 2504.04635 • Published Apr 6, 2025
SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control Paper • 2210.17432 • Published Oct 31, 2022 • 2
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research Paper • 2402.00159 • Published Jan 31, 2024 • 66