AI Safety Research
AISafety
AI & ML interests
LLMs, planning, EA
Recent Activity
upvoted an article about 1 hour ago
Security incident disclosure — July 2026 commentedon an article about 1 hour ago
Security incident disclosure — July 2026 upvoted a paper about 1 hour ago
Weak-to-Strong Generalization via Direct On-Policy Distillation