{ "best_global_step": 3939, "best_metric": 0.9143047682560853, "best_model_checkpoint": "./xlmr-sr-bs-hr-langid\\checkpoint-3939", "epoch": 3.0, "eval_steps": 500, "global_step": 3939, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.07616146230007616, "grad_norm": 3.7161569595336914, "learning_rate": 8.389830508474577e-06, "loss": 1.0068478393554687, "step": 100 }, { "epoch": 0.15232292460015232, "grad_norm": 8.061516761779785, "learning_rate": 1.6864406779661018e-05, "loss": 0.529828109741211, "step": 200 }, { "epoch": 0.2284843869002285, "grad_norm": 6.003665924072266, "learning_rate": 1.9659735349716448e-05, "loss": 0.3999551010131836, "step": 300 }, { "epoch": 0.30464584920030463, "grad_norm": 7.825595855712891, "learning_rate": 1.9119632730218742e-05, "loss": 0.35300273895263673, "step": 400 }, { "epoch": 0.38080731150038083, "grad_norm": 14.767660140991211, "learning_rate": 1.857953011072104e-05, "loss": 0.30567848205566406, "step": 500 }, { "epoch": 0.456968773800457, "grad_norm": 6.6135077476501465, "learning_rate": 1.8039427491223333e-05, "loss": 0.30176273345947263, "step": 600 }, { "epoch": 0.5331302361005331, "grad_norm": 7.354424476623535, "learning_rate": 1.749932487172563e-05, "loss": 0.2914651107788086, "step": 700 }, { "epoch": 0.6092916984006093, "grad_norm": 4.273357391357422, "learning_rate": 1.6959222252227925e-05, "loss": 0.273216609954834, "step": 800 }, { "epoch": 0.6854531607006854, "grad_norm": 5.5916666984558105, "learning_rate": 1.6419119632730222e-05, "loss": 0.2715462875366211, "step": 900 }, { "epoch": 0.7616146230007617, "grad_norm": 12.632597923278809, "learning_rate": 1.5879017013232516e-05, "loss": 0.27853103637695314, "step": 1000 }, { "epoch": 0.8377760853008378, "grad_norm": 5.093064308166504, "learning_rate": 1.533891439373481e-05, "loss": 0.2554133224487305, "step": 1100 }, { "epoch": 0.913937547600914, "grad_norm": 6.2285261154174805, "learning_rate": 1.4798811774237108e-05, "loss": 0.2594594955444336, "step": 1200 }, { "epoch": 0.9900990099009901, "grad_norm": 8.794631958007812, "learning_rate": 1.42587091547394e-05, "loss": 0.2614645767211914, "step": 1300 }, { "epoch": 1.0, "eval_accuracy": 0.8990774702678671, "eval_f1_macro": 0.8998312065968656, "eval_loss": 0.245062917470932, "eval_runtime": 78.7006, "eval_samples_per_second": 114.319, "eval_steps_per_second": 3.583, "step": 1313 }, { "epoch": 1.0662604722010662, "grad_norm": 6.119467735290527, "learning_rate": 1.3718606535241696e-05, "loss": 0.23620071411132812, "step": 1400 }, { "epoch": 1.1424219345011424, "grad_norm": 9.841064453125, "learning_rate": 1.3178503915743991e-05, "loss": 0.21465208053588866, "step": 1500 }, { "epoch": 1.2185833968012185, "grad_norm": 12.337705612182617, "learning_rate": 1.2638401296246287e-05, "loss": 0.20962884902954101, "step": 1600 }, { "epoch": 1.2947448591012947, "grad_norm": 4.582294940948486, "learning_rate": 1.2098298676748583e-05, "loss": 0.2203717041015625, "step": 1700 }, { "epoch": 1.370906321401371, "grad_norm": 6.51242208480835, "learning_rate": 1.1558196057250879e-05, "loss": 0.2035850143432617, "step": 1800 }, { "epoch": 1.447067783701447, "grad_norm": 5.34440279006958, "learning_rate": 1.1018093437753174e-05, "loss": 0.18973876953125, "step": 1900 }, { "epoch": 1.5232292460015233, "grad_norm": 6.378429412841797, "learning_rate": 1.047799081825547e-05, "loss": 0.2004266357421875, "step": 2000 }, { "epoch": 1.5993907083015992, "grad_norm": 8.042850494384766, "learning_rate": 9.937888198757764e-06, "loss": 0.20238819122314453, "step": 2100 }, { "epoch": 1.6755521706016756, "grad_norm": 5.476775646209717, "learning_rate": 9.39778557926006e-06, "loss": 0.21350696563720703, "step": 2200 }, { "epoch": 1.7517136329017517, "grad_norm": 6.851023197174072, "learning_rate": 8.857682959762356e-06, "loss": 0.20105552673339844, "step": 2300 }, { "epoch": 1.827875095201828, "grad_norm": 3.7949297428131104, "learning_rate": 8.317580340264651e-06, "loss": 0.2064978790283203, "step": 2400 }, { "epoch": 1.904036557501904, "grad_norm": 4.971927165985107, "learning_rate": 7.777477720766945e-06, "loss": 0.1962567138671875, "step": 2500 }, { "epoch": 1.9801980198019802, "grad_norm": 3.824700355529785, "learning_rate": 7.237375101269242e-06, "loss": 0.189071102142334, "step": 2600 }, { "epoch": 2.0, "eval_accuracy": 0.9096365455151717, "eval_f1_macro": 0.910348978543713, "eval_loss": 0.2188359647989273, "eval_runtime": 61.246, "eval_samples_per_second": 146.899, "eval_steps_per_second": 4.604, "step": 2626 }, { "epoch": 2.0563594821020565, "grad_norm": 10.640642166137695, "learning_rate": 6.697272481771538e-06, "loss": 0.16652795791625977, "step": 2700 }, { "epoch": 2.1325209444021325, "grad_norm": 6.904885768890381, "learning_rate": 6.157169862273833e-06, "loss": 0.17334474563598634, "step": 2800 }, { "epoch": 2.208682406702209, "grad_norm": 5.3162713050842285, "learning_rate": 5.617067242776127e-06, "loss": 0.14890146255493164, "step": 2900 }, { "epoch": 2.2848438690022848, "grad_norm": 6.163121223449707, "learning_rate": 5.076964623278423e-06, "loss": 0.1651030158996582, "step": 3000 }, { "epoch": 2.361005331302361, "grad_norm": 4.752669811248779, "learning_rate": 4.536862003780719e-06, "loss": 0.1462579345703125, "step": 3100 }, { "epoch": 2.437166793602437, "grad_norm": 5.332653045654297, "learning_rate": 3.9967593842830145e-06, "loss": 0.15916800498962402, "step": 3200 }, { "epoch": 2.5133282559025134, "grad_norm": 5.450231075286865, "learning_rate": 3.4566567647853094e-06, "loss": 0.15194120407104492, "step": 3300 }, { "epoch": 2.5894897182025893, "grad_norm": 6.999484539031982, "learning_rate": 2.916554145287605e-06, "loss": 0.15108756065368653, "step": 3400 }, { "epoch": 2.6656511805026657, "grad_norm": 4.82545804977417, "learning_rate": 2.3764515257899004e-06, "loss": 0.15751500129699708, "step": 3500 }, { "epoch": 2.741812642802742, "grad_norm": 8.598002433776855, "learning_rate": 1.8363489062921957e-06, "loss": 0.151602783203125, "step": 3600 }, { "epoch": 2.817974105102818, "grad_norm": 7.693239212036133, "learning_rate": 1.296246286794491e-06, "loss": 0.16218629837036133, "step": 3700 }, { "epoch": 2.894135567402894, "grad_norm": 5.526150226593018, "learning_rate": 7.561436672967864e-07, "loss": 0.15039791107177736, "step": 3800 }, { "epoch": 2.9702970297029703, "grad_norm": 8.92986011505127, "learning_rate": 2.1604104779908184e-07, "loss": 0.14814735412597657, "step": 3900 }, { "epoch": 3.0, "eval_accuracy": 0.9143047682560853, "eval_f1_macro": 0.9148603781305308, "eval_loss": 0.23814931511878967, "eval_runtime": 61.2277, "eval_samples_per_second": 146.943, "eval_steps_per_second": 4.606, "step": 3939 } ], "logging_steps": 100, "max_steps": 3939, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.3157276289362856e+16, "train_batch_size": 32, "trial_name": null, "trial_params": null }