nbr-500-chat / checkpoint-114 /trainer_state.json
limajr's picture
Upload folder using huggingface_hub
e15164d verified
Raw
History Blame Contribute Delete
6.54 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 114,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.08839779005524862,
"grad_norm": 13.0625,
"learning_rate": 4.605263157894737e-06,
"logits/chosen": -3.266218900680542,
"logits/rejected": -3.173306703567505,
"logps/chosen": -169.16183471679688,
"logps/rejected": -190.1395263671875,
"loss": 0.6924,
"rewards/accuracies": 0.48124998807907104,
"rewards/chosen": 0.0008526706951670349,
"rewards/margins": 0.0017210483783856034,
"rewards/rejected": -0.0008683774503879249,
"step": 10
},
{
"epoch": 0.17679558011049723,
"grad_norm": 12.625,
"learning_rate": 4.166666666666667e-06,
"logits/chosen": -3.263390302658081,
"logits/rejected": -3.2149460315704346,
"logps/chosen": -162.94313049316406,
"logps/rejected": -179.63369750976562,
"loss": 0.6946,
"rewards/accuracies": 0.4625000059604645,
"rewards/chosen": -0.0010867499513551593,
"rewards/margins": -0.002635319484397769,
"rewards/rejected": 0.0015485694166272879,
"step": 20
},
{
"epoch": 0.26519337016574585,
"grad_norm": 13.625,
"learning_rate": 3.728070175438597e-06,
"logits/chosen": -3.299316883087158,
"logits/rejected": -3.243040084838867,
"logps/chosen": -168.03802490234375,
"logps/rejected": -191.59165954589844,
"loss": 0.6908,
"rewards/accuracies": 0.5562499761581421,
"rewards/chosen": 0.005441132001578808,
"rewards/margins": 0.004950051195919514,
"rewards/rejected": 0.0004910803982056677,
"step": 30
},
{
"epoch": 0.35359116022099446,
"grad_norm": 12.8125,
"learning_rate": 3.289473684210527e-06,
"logits/chosen": -3.3205394744873047,
"logits/rejected": -3.2248268127441406,
"logps/chosen": -163.4181365966797,
"logps/rejected": -190.28494262695312,
"loss": 0.692,
"rewards/accuracies": 0.4937500059604645,
"rewards/chosen": 0.0033660412300378084,
"rewards/margins": 0.0026486157439649105,
"rewards/rejected": 0.0007174253696575761,
"step": 40
},
{
"epoch": 0.4419889502762431,
"grad_norm": 13.4375,
"learning_rate": 2.8508771929824565e-06,
"logits/chosen": -3.266845226287842,
"logits/rejected": -3.239501953125,
"logps/chosen": -165.8727569580078,
"logps/rejected": -180.970703125,
"loss": 0.69,
"rewards/accuracies": 0.5562499761581421,
"rewards/chosen": 0.002517760032787919,
"rewards/margins": 0.006597781088203192,
"rewards/rejected": -0.004080021288245916,
"step": 50
},
{
"epoch": 0.5303867403314917,
"grad_norm": 13.0,
"learning_rate": 2.412280701754386e-06,
"logits/chosen": -3.300370454788208,
"logits/rejected": -3.2336509227752686,
"logps/chosen": -166.43919372558594,
"logps/rejected": -177.72369384765625,
"loss": 0.6912,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0010731505462899804,
"rewards/margins": 0.004260644782334566,
"rewards/rejected": -0.0031874938867986202,
"step": 60
},
{
"epoch": 0.6187845303867403,
"grad_norm": 13.1875,
"learning_rate": 1.973684210526316e-06,
"logits/chosen": -3.292241334915161,
"logits/rejected": -3.263917922973633,
"logps/chosen": -166.0662841796875,
"logps/rejected": -179.9429168701172,
"loss": 0.6886,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.004152910318225622,
"rewards/margins": 0.009452776983380318,
"rewards/rejected": -0.005299866199493408,
"step": 70
},
{
"epoch": 0.7071823204419889,
"grad_norm": 13.1875,
"learning_rate": 1.5350877192982458e-06,
"logits/chosen": -3.2774970531463623,
"logits/rejected": -3.2063546180725098,
"logps/chosen": -166.04795837402344,
"logps/rejected": -189.38204956054688,
"loss": 0.6917,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.002573251724243164,
"rewards/margins": 0.00316311651840806,
"rewards/rejected": -0.0005898644449189305,
"step": 80
},
{
"epoch": 0.7955801104972375,
"grad_norm": 11.75,
"learning_rate": 1.0964912280701756e-06,
"logits/chosen": -3.3311314582824707,
"logits/rejected": -3.2796638011932373,
"logps/chosen": -157.93948364257812,
"logps/rejected": -183.2423095703125,
"loss": 0.6909,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": 0.002239528112113476,
"rewards/margins": 0.00483693415299058,
"rewards/rejected": -0.002597406040877104,
"step": 90
},
{
"epoch": 0.8839779005524862,
"grad_norm": 14.75,
"learning_rate": 6.578947368421053e-07,
"logits/chosen": -3.2761390209198,
"logits/rejected": -3.2539830207824707,
"logps/chosen": -178.083984375,
"logps/rejected": -185.00401306152344,
"loss": 0.6913,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.001332092098891735,
"rewards/margins": 0.004107826389372349,
"rewards/rejected": -0.0027757335919886827,
"step": 100
},
{
"epoch": 0.9723756906077348,
"grad_norm": 13.3125,
"learning_rate": 2.192982456140351e-07,
"logits/chosen": -3.2679781913757324,
"logits/rejected": -3.1474175453186035,
"logps/chosen": -170.65786743164062,
"logps/rejected": -183.07583618164062,
"loss": 0.692,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.001837458461523056,
"rewards/margins": 0.0027389838360249996,
"rewards/rejected": -0.0009015247924253345,
"step": 110
}
],
"logging_steps": 10,
"max_steps": 114,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}