AI Safety Research
AISafety
AI & ML interests
LLMs, planning, EA
Recent Activity
upvoted an article 1 day ago
Security incident disclosure — July 2026 commentedon an article 1 day ago
Security incident disclosure — July 2026 upvoted a paper 1 day ago
Weak-to-Strong Generalization via Direct On-Policy Distillation