chinna6's picture
End of training
ce40549 verified
Raw
History Blame Contribute Delete
8.36 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN, "... is not valid JSON
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 6.7272727272727275,
"eval_steps": 500,
"global_step": 20,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 392.125,
"epoch": 0.7272727272727273,
"grad_norm": 2.3548953533172607,
"kl": 8.267481666734966e-05,
"learning_rate": 4.965903258506806e-07,
"loss": 0.0,
"reward": 0.22768377978354692,
"reward_std": 0.3886153739877045,
"rewards/concensus_correctness_reward_func": 0.015687499195337296,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.2580275312066078,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.04603125946596265,
"step": 2
},
{
"completion_length": 404.64285714285717,
"epoch": 1.3636363636363638,
"grad_norm": NaN,
"kl": 0.0011071320425669131,
"learning_rate": 4.864543104251586e-07,
"loss": 0.0,
"reward": 0.032648100916828425,
"reward_std": 0.20958313665219716,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.08168381186468261,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.04903571307659149,
"step": 4
},
{
"completion_length": 297.85714285714283,
"epoch": 2.0,
"grad_norm": 3.1153604984283447,
"kl": 4.778541071053561e-05,
"learning_rate": 4.472851273490984e-07,
"loss": 0.0,
"reward": 0.20052496450287954,
"reward_std": 0.25849828869104385,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.17427496133106096,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.026250002639634267,
"step": 6
},
{
"completion_length": 390.59375,
"epoch": 2.7272727272727275,
"grad_norm": 1.8379318714141846,
"kl": 7.826527257748239e-05,
"learning_rate": 3.867370395306068e-07,
"loss": 0.0,
"reward": 0.06725184712558985,
"reward_std": 0.4277870515361428,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.13472059718333185,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.06746875029057264,
"step": 8
},
{
"completion_length": 314.17857142857144,
"epoch": 3.3636363636363638,
"grad_norm": 8.823220252990723,
"kl": 6.003522191479403e-05,
"learning_rate": 3.1137137178519977e-07,
"loss": 0.0,
"reward": 0.602835435952459,
"reward_std": 0.3692689197404044,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.2830496983868735,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.31978571840694975,
"step": 10
},
{
"completion_length": 377.89285714285717,
"epoch": 4.0,
"grad_norm": 1.446035623550415,
"kl": 6.864860259676269e-05,
"learning_rate": 2.2935516363191693e-07,
"loss": 0.0,
"reward": 0.31896616731371197,
"reward_std": 0.3869111631065607,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.15957331018788473,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.15939285925456456,
"step": 12
},
{
"completion_length": 356.96875,
"epoch": 4.7272727272727275,
"grad_norm": NaN,
"kl": 0.00014677891823566824,
"learning_rate": 2.2935516363191693e-07,
"loss": 0.0,
"reward": 0.24034546129405499,
"reward_std": 0.27134356228634715,
"rewards/concensus_correctness_reward_func": 0.015687499195337296,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.13928297231905162,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.08537500188685954,
"step": 14
},
{
"completion_length": 447.39285714285717,
"epoch": 5.363636363636363,
"grad_norm": 8.778853416442871,
"kl": 6.431972282630991e-05,
"learning_rate": 1.4957614383675767e-07,
"loss": 0.0,
"reward": 0.1563647144607135,
"reward_std": 0.42256759639297214,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.14450755422668798,
"rewards/soft_format_reward_func": 0.017857142857142856,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.00599999725818634,
"step": 16
},
{
"completion_length": 325.42857142857144,
"epoch": 6.0,
"grad_norm": NaN,
"kl": 0.002005238527220042,
"learning_rate": 1.1326296046939333e-07,
"loss": 0.0,
"reward": 0.17687146259205683,
"reward_std": 0.15588495135307312,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.15162146131375007,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.02524999901652336,
"step": 18
},
{
"completion_length": 410.5625,
"epoch": 6.7272727272727275,
"grad_norm": 2.279639720916748,
"kl": 4.0441590726914e-05,
"learning_rate": 5.271487265090163e-08,
"loss": 0.0,
"reward": 0.3732794551178813,
"reward_std": 0.37106609204784036,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.22265444789081812,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.15062500350177288,
"step": 20
},
{
"epoch": 6.7272727272727275,
"step": 20,
"total_flos": 0.0,
"train_loss": 3.5012255779065525e-07,
"train_runtime": 1119.4838,
"train_samples_per_second": 0.286,
"train_steps_per_second": 0.018
}
],
"logging_steps": 2,
"max_steps": 20,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}