RoBERTo / trainer_state.json
absltnull's picture
Upload folder using huggingface_hub
494f3a2 verified
Raw
History Blame Contribute Delete
9.26 kB
{
"best_global_step": 3939,
"best_metric": 0.9143047682560853,
"best_model_checkpoint": "./xlmr-sr-bs-hr-langid\\checkpoint-3939",
"epoch": 3.0,
"eval_steps": 500,
"global_step": 3939,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.07616146230007616,
"grad_norm": 3.7161569595336914,
"learning_rate": 8.389830508474577e-06,
"loss": 1.0068478393554687,
"step": 100
},
{
"epoch": 0.15232292460015232,
"grad_norm": 8.061516761779785,
"learning_rate": 1.6864406779661018e-05,
"loss": 0.529828109741211,
"step": 200
},
{
"epoch": 0.2284843869002285,
"grad_norm": 6.003665924072266,
"learning_rate": 1.9659735349716448e-05,
"loss": 0.3999551010131836,
"step": 300
},
{
"epoch": 0.30464584920030463,
"grad_norm": 7.825595855712891,
"learning_rate": 1.9119632730218742e-05,
"loss": 0.35300273895263673,
"step": 400
},
{
"epoch": 0.38080731150038083,
"grad_norm": 14.767660140991211,
"learning_rate": 1.857953011072104e-05,
"loss": 0.30567848205566406,
"step": 500
},
{
"epoch": 0.456968773800457,
"grad_norm": 6.6135077476501465,
"learning_rate": 1.8039427491223333e-05,
"loss": 0.30176273345947263,
"step": 600
},
{
"epoch": 0.5331302361005331,
"grad_norm": 7.354424476623535,
"learning_rate": 1.749932487172563e-05,
"loss": 0.2914651107788086,
"step": 700
},
{
"epoch": 0.6092916984006093,
"grad_norm": 4.273357391357422,
"learning_rate": 1.6959222252227925e-05,
"loss": 0.273216609954834,
"step": 800
},
{
"epoch": 0.6854531607006854,
"grad_norm": 5.5916666984558105,
"learning_rate": 1.6419119632730222e-05,
"loss": 0.2715462875366211,
"step": 900
},
{
"epoch": 0.7616146230007617,
"grad_norm": 12.632597923278809,
"learning_rate": 1.5879017013232516e-05,
"loss": 0.27853103637695314,
"step": 1000
},
{
"epoch": 0.8377760853008378,
"grad_norm": 5.093064308166504,
"learning_rate": 1.533891439373481e-05,
"loss": 0.2554133224487305,
"step": 1100
},
{
"epoch": 0.913937547600914,
"grad_norm": 6.2285261154174805,
"learning_rate": 1.4798811774237108e-05,
"loss": 0.2594594955444336,
"step": 1200
},
{
"epoch": 0.9900990099009901,
"grad_norm": 8.794631958007812,
"learning_rate": 1.42587091547394e-05,
"loss": 0.2614645767211914,
"step": 1300
},
{
"epoch": 1.0,
"eval_accuracy": 0.8990774702678671,
"eval_f1_macro": 0.8998312065968656,
"eval_loss": 0.245062917470932,
"eval_runtime": 78.7006,
"eval_samples_per_second": 114.319,
"eval_steps_per_second": 3.583,
"step": 1313
},
{
"epoch": 1.0662604722010662,
"grad_norm": 6.119467735290527,
"learning_rate": 1.3718606535241696e-05,
"loss": 0.23620071411132812,
"step": 1400
},
{
"epoch": 1.1424219345011424,
"grad_norm": 9.841064453125,
"learning_rate": 1.3178503915743991e-05,
"loss": 0.21465208053588866,
"step": 1500
},
{
"epoch": 1.2185833968012185,
"grad_norm": 12.337705612182617,
"learning_rate": 1.2638401296246287e-05,
"loss": 0.20962884902954101,
"step": 1600
},
{
"epoch": 1.2947448591012947,
"grad_norm": 4.582294940948486,
"learning_rate": 1.2098298676748583e-05,
"loss": 0.2203717041015625,
"step": 1700
},
{
"epoch": 1.370906321401371,
"grad_norm": 6.51242208480835,
"learning_rate": 1.1558196057250879e-05,
"loss": 0.2035850143432617,
"step": 1800
},
{
"epoch": 1.447067783701447,
"grad_norm": 5.34440279006958,
"learning_rate": 1.1018093437753174e-05,
"loss": 0.18973876953125,
"step": 1900
},
{
"epoch": 1.5232292460015233,
"grad_norm": 6.378429412841797,
"learning_rate": 1.047799081825547e-05,
"loss": 0.2004266357421875,
"step": 2000
},
{
"epoch": 1.5993907083015992,
"grad_norm": 8.042850494384766,
"learning_rate": 9.937888198757764e-06,
"loss": 0.20238819122314453,
"step": 2100
},
{
"epoch": 1.6755521706016756,
"grad_norm": 5.476775646209717,
"learning_rate": 9.39778557926006e-06,
"loss": 0.21350696563720703,
"step": 2200
},
{
"epoch": 1.7517136329017517,
"grad_norm": 6.851023197174072,
"learning_rate": 8.857682959762356e-06,
"loss": 0.20105552673339844,
"step": 2300
},
{
"epoch": 1.827875095201828,
"grad_norm": 3.7949297428131104,
"learning_rate": 8.317580340264651e-06,
"loss": 0.2064978790283203,
"step": 2400
},
{
"epoch": 1.904036557501904,
"grad_norm": 4.971927165985107,
"learning_rate": 7.777477720766945e-06,
"loss": 0.1962567138671875,
"step": 2500
},
{
"epoch": 1.9801980198019802,
"grad_norm": 3.824700355529785,
"learning_rate": 7.237375101269242e-06,
"loss": 0.189071102142334,
"step": 2600
},
{
"epoch": 2.0,
"eval_accuracy": 0.9096365455151717,
"eval_f1_macro": 0.910348978543713,
"eval_loss": 0.2188359647989273,
"eval_runtime": 61.246,
"eval_samples_per_second": 146.899,
"eval_steps_per_second": 4.604,
"step": 2626
},
{
"epoch": 2.0563594821020565,
"grad_norm": 10.640642166137695,
"learning_rate": 6.697272481771538e-06,
"loss": 0.16652795791625977,
"step": 2700
},
{
"epoch": 2.1325209444021325,
"grad_norm": 6.904885768890381,
"learning_rate": 6.157169862273833e-06,
"loss": 0.17334474563598634,
"step": 2800
},
{
"epoch": 2.208682406702209,
"grad_norm": 5.3162713050842285,
"learning_rate": 5.617067242776127e-06,
"loss": 0.14890146255493164,
"step": 2900
},
{
"epoch": 2.2848438690022848,
"grad_norm": 6.163121223449707,
"learning_rate": 5.076964623278423e-06,
"loss": 0.1651030158996582,
"step": 3000
},
{
"epoch": 2.361005331302361,
"grad_norm": 4.752669811248779,
"learning_rate": 4.536862003780719e-06,
"loss": 0.1462579345703125,
"step": 3100
},
{
"epoch": 2.437166793602437,
"grad_norm": 5.332653045654297,
"learning_rate": 3.9967593842830145e-06,
"loss": 0.15916800498962402,
"step": 3200
},
{
"epoch": 2.5133282559025134,
"grad_norm": 5.450231075286865,
"learning_rate": 3.4566567647853094e-06,
"loss": 0.15194120407104492,
"step": 3300
},
{
"epoch": 2.5894897182025893,
"grad_norm": 6.999484539031982,
"learning_rate": 2.916554145287605e-06,
"loss": 0.15108756065368653,
"step": 3400
},
{
"epoch": 2.6656511805026657,
"grad_norm": 4.82545804977417,
"learning_rate": 2.3764515257899004e-06,
"loss": 0.15751500129699708,
"step": 3500
},
{
"epoch": 2.741812642802742,
"grad_norm": 8.598002433776855,
"learning_rate": 1.8363489062921957e-06,
"loss": 0.151602783203125,
"step": 3600
},
{
"epoch": 2.817974105102818,
"grad_norm": 7.693239212036133,
"learning_rate": 1.296246286794491e-06,
"loss": 0.16218629837036133,
"step": 3700
},
{
"epoch": 2.894135567402894,
"grad_norm": 5.526150226593018,
"learning_rate": 7.561436672967864e-07,
"loss": 0.15039791107177736,
"step": 3800
},
{
"epoch": 2.9702970297029703,
"grad_norm": 8.92986011505127,
"learning_rate": 2.1604104779908184e-07,
"loss": 0.14814735412597657,
"step": 3900
},
{
"epoch": 3.0,
"eval_accuracy": 0.9143047682560853,
"eval_f1_macro": 0.9148603781305308,
"eval_loss": 0.23814931511878967,
"eval_runtime": 61.2277,
"eval_samples_per_second": 146.943,
"eval_steps_per_second": 4.606,
"step": 3939
}
],
"logging_steps": 100,
"max_steps": 3939,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.3157276289362856e+16,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}