| { | |
| "best_global_step": 3939, | |
| "best_metric": 0.9143047682560853, | |
| "best_model_checkpoint": "./xlmr-sr-bs-hr-langid\\checkpoint-3939", | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 3939, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.07616146230007616, | |
| "grad_norm": 3.7161569595336914, | |
| "learning_rate": 8.389830508474577e-06, | |
| "loss": 1.0068478393554687, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.15232292460015232, | |
| "grad_norm": 8.061516761779785, | |
| "learning_rate": 1.6864406779661018e-05, | |
| "loss": 0.529828109741211, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.2284843869002285, | |
| "grad_norm": 6.003665924072266, | |
| "learning_rate": 1.9659735349716448e-05, | |
| "loss": 0.3999551010131836, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.30464584920030463, | |
| "grad_norm": 7.825595855712891, | |
| "learning_rate": 1.9119632730218742e-05, | |
| "loss": 0.35300273895263673, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.38080731150038083, | |
| "grad_norm": 14.767660140991211, | |
| "learning_rate": 1.857953011072104e-05, | |
| "loss": 0.30567848205566406, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.456968773800457, | |
| "grad_norm": 6.6135077476501465, | |
| "learning_rate": 1.8039427491223333e-05, | |
| "loss": 0.30176273345947263, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.5331302361005331, | |
| "grad_norm": 7.354424476623535, | |
| "learning_rate": 1.749932487172563e-05, | |
| "loss": 0.2914651107788086, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.6092916984006093, | |
| "grad_norm": 4.273357391357422, | |
| "learning_rate": 1.6959222252227925e-05, | |
| "loss": 0.273216609954834, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.6854531607006854, | |
| "grad_norm": 5.5916666984558105, | |
| "learning_rate": 1.6419119632730222e-05, | |
| "loss": 0.2715462875366211, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.7616146230007617, | |
| "grad_norm": 12.632597923278809, | |
| "learning_rate": 1.5879017013232516e-05, | |
| "loss": 0.27853103637695314, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.8377760853008378, | |
| "grad_norm": 5.093064308166504, | |
| "learning_rate": 1.533891439373481e-05, | |
| "loss": 0.2554133224487305, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.913937547600914, | |
| "grad_norm": 6.2285261154174805, | |
| "learning_rate": 1.4798811774237108e-05, | |
| "loss": 0.2594594955444336, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.9900990099009901, | |
| "grad_norm": 8.794631958007812, | |
| "learning_rate": 1.42587091547394e-05, | |
| "loss": 0.2614645767211914, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_accuracy": 0.8990774702678671, | |
| "eval_f1_macro": 0.8998312065968656, | |
| "eval_loss": 0.245062917470932, | |
| "eval_runtime": 78.7006, | |
| "eval_samples_per_second": 114.319, | |
| "eval_steps_per_second": 3.583, | |
| "step": 1313 | |
| }, | |
| { | |
| "epoch": 1.0662604722010662, | |
| "grad_norm": 6.119467735290527, | |
| "learning_rate": 1.3718606535241696e-05, | |
| "loss": 0.23620071411132812, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 1.1424219345011424, | |
| "grad_norm": 9.841064453125, | |
| "learning_rate": 1.3178503915743991e-05, | |
| "loss": 0.21465208053588866, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.2185833968012185, | |
| "grad_norm": 12.337705612182617, | |
| "learning_rate": 1.2638401296246287e-05, | |
| "loss": 0.20962884902954101, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.2947448591012947, | |
| "grad_norm": 4.582294940948486, | |
| "learning_rate": 1.2098298676748583e-05, | |
| "loss": 0.2203717041015625, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.370906321401371, | |
| "grad_norm": 6.51242208480835, | |
| "learning_rate": 1.1558196057250879e-05, | |
| "loss": 0.2035850143432617, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.447067783701447, | |
| "grad_norm": 5.34440279006958, | |
| "learning_rate": 1.1018093437753174e-05, | |
| "loss": 0.18973876953125, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.5232292460015233, | |
| "grad_norm": 6.378429412841797, | |
| "learning_rate": 1.047799081825547e-05, | |
| "loss": 0.2004266357421875, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.5993907083015992, | |
| "grad_norm": 8.042850494384766, | |
| "learning_rate": 9.937888198757764e-06, | |
| "loss": 0.20238819122314453, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.6755521706016756, | |
| "grad_norm": 5.476775646209717, | |
| "learning_rate": 9.39778557926006e-06, | |
| "loss": 0.21350696563720703, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.7517136329017517, | |
| "grad_norm": 6.851023197174072, | |
| "learning_rate": 8.857682959762356e-06, | |
| "loss": 0.20105552673339844, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 1.827875095201828, | |
| "grad_norm": 3.7949297428131104, | |
| "learning_rate": 8.317580340264651e-06, | |
| "loss": 0.2064978790283203, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 1.904036557501904, | |
| "grad_norm": 4.971927165985107, | |
| "learning_rate": 7.777477720766945e-06, | |
| "loss": 0.1962567138671875, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.9801980198019802, | |
| "grad_norm": 3.824700355529785, | |
| "learning_rate": 7.237375101269242e-06, | |
| "loss": 0.189071102142334, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_accuracy": 0.9096365455151717, | |
| "eval_f1_macro": 0.910348978543713, | |
| "eval_loss": 0.2188359647989273, | |
| "eval_runtime": 61.246, | |
| "eval_samples_per_second": 146.899, | |
| "eval_steps_per_second": 4.604, | |
| "step": 2626 | |
| }, | |
| { | |
| "epoch": 2.0563594821020565, | |
| "grad_norm": 10.640642166137695, | |
| "learning_rate": 6.697272481771538e-06, | |
| "loss": 0.16652795791625977, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 2.1325209444021325, | |
| "grad_norm": 6.904885768890381, | |
| "learning_rate": 6.157169862273833e-06, | |
| "loss": 0.17334474563598634, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 2.208682406702209, | |
| "grad_norm": 5.3162713050842285, | |
| "learning_rate": 5.617067242776127e-06, | |
| "loss": 0.14890146255493164, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 2.2848438690022848, | |
| "grad_norm": 6.163121223449707, | |
| "learning_rate": 5.076964623278423e-06, | |
| "loss": 0.1651030158996582, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 2.361005331302361, | |
| "grad_norm": 4.752669811248779, | |
| "learning_rate": 4.536862003780719e-06, | |
| "loss": 0.1462579345703125, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 2.437166793602437, | |
| "grad_norm": 5.332653045654297, | |
| "learning_rate": 3.9967593842830145e-06, | |
| "loss": 0.15916800498962402, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 2.5133282559025134, | |
| "grad_norm": 5.450231075286865, | |
| "learning_rate": 3.4566567647853094e-06, | |
| "loss": 0.15194120407104492, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 2.5894897182025893, | |
| "grad_norm": 6.999484539031982, | |
| "learning_rate": 2.916554145287605e-06, | |
| "loss": 0.15108756065368653, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 2.6656511805026657, | |
| "grad_norm": 4.82545804977417, | |
| "learning_rate": 2.3764515257899004e-06, | |
| "loss": 0.15751500129699708, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 2.741812642802742, | |
| "grad_norm": 8.598002433776855, | |
| "learning_rate": 1.8363489062921957e-06, | |
| "loss": 0.151602783203125, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 2.817974105102818, | |
| "grad_norm": 7.693239212036133, | |
| "learning_rate": 1.296246286794491e-06, | |
| "loss": 0.16218629837036133, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 2.894135567402894, | |
| "grad_norm": 5.526150226593018, | |
| "learning_rate": 7.561436672967864e-07, | |
| "loss": 0.15039791107177736, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 2.9702970297029703, | |
| "grad_norm": 8.92986011505127, | |
| "learning_rate": 2.1604104779908184e-07, | |
| "loss": 0.14814735412597657, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_accuracy": 0.9143047682560853, | |
| "eval_f1_macro": 0.9148603781305308, | |
| "eval_loss": 0.23814931511878967, | |
| "eval_runtime": 61.2277, | |
| "eval_samples_per_second": 146.943, | |
| "eval_steps_per_second": 4.606, | |
| "step": 3939 | |
| } | |
| ], | |
| "logging_steps": 100, | |
| "max_steps": 3939, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.3157276289362856e+16, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |