Security: remove hardcoded tokens from code/train_dpo.py, use env/arg only b481f47 verified ViuAI commited on 10 days ago
Add SFT auxiliary loss (0.5x) and boost DPO learning rate to 1.5e-5 for 500M model e81c88f verified ViuAI commited on 10 days ago
Upload latest DPO v1 alignment script: code/train_dpo.py f3cbfc2 verified ViuAI commited on 10 days ago
Update train_dpo.py with complete DDP multi-GPU and memory management c362eb6 verified ViuAI commited on 20 days ago