sakara2's picture
End of training
5753a0f verified
Raw
History Blame Contribute Delete
8.46 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 6.7272727272727275,
"eval_steps": 500,
"global_step": 20,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 472.21875,
"epoch": 0.7272727272727273,
"grad_norm": 4.534781455993652,
"kl": 0.008206730344682,
"learning_rate": 5e-07,
"loss": 0.0,
"reward": 0.335196889936924,
"reward_std": 0.4634492734912783,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.254853137768805,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.08034374378621578,
"step": 2
},
{
"completion_length": 434.25,
"epoch": 1.3636363636363638,
"grad_norm": 3.990346670150757,
"kl": 0.004460517333687416,
"learning_rate": 4.864543104251586e-07,
"loss": 0.0,
"reward": 0.23956100004059927,
"reward_std": 0.39508587813803125,
"rewards/concensus_correctness_reward_func": 0.052571428673607964,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.2285252841455596,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.04153571490730558,
"step": 4
},
{
"completion_length": 320.64285714285717,
"epoch": 2.0,
"grad_norm": 2.0588278770446777,
"kl": 0.11155916550861937,
"learning_rate": 4.472851273490984e-07,
"loss": 0.0001,
"reward": 0.31050378642976284,
"reward_std": 0.31080392096191645,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.2616466488689184,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.04885714128613472,
"step": 6
},
{
"completion_length": 378.03125,
"epoch": 2.7272727272727275,
"grad_norm": 30.297046661376953,
"kl": 0.4378207582485629,
"learning_rate": 3.867370395306068e-07,
"loss": 0.0004,
"reward": 0.22754877456463873,
"reward_std": 0.9356243578367867,
"rewards/concensus_correctness_reward_func": 0.07725000008940697,
"rewards/consensus_reward_func": 0.0625,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.23864254099316895,
"rewards/soft_format_reward_func": 0.015625,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.16646875580772758,
"step": 8
},
{
"completion_length": 470.35714285714283,
"epoch": 3.3636363636363638,
"grad_norm": 41.05766296386719,
"kl": 4.791061709136037,
"learning_rate": 3.1137137178519977e-07,
"loss": 0.0042,
"reward": 0.2232233083673886,
"reward_std": 0.32254474077905926,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.188544737175107,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.034678573054926734,
"step": 10
},
{
"completion_length": 589.3571428571429,
"epoch": 4.0,
"grad_norm": 2.7544920444488525,
"kl": 0.012513568525069527,
"learning_rate": 2.2935516363191693e-07,
"loss": 0.0,
"reward": 0.36643355978386744,
"reward_std": 0.39640770692910465,
"rewards/concensus_correctness_reward_func": 0.052571428673607964,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.2045407114284379,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.1093214281967708,
"step": 12
},
{
"completion_length": 374.875,
"epoch": 4.7272727272727275,
"grad_norm": 1.7192025184631348,
"kl": 0.0048929502663668245,
"learning_rate": 1.4957614383675767e-07,
"loss": 0.0,
"reward": 0.30030711740255356,
"reward_std": 0.4493426423287019,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.23215085780248046,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.06815625180024654,
"step": 14
},
{
"completion_length": 525.7857142857143,
"epoch": 5.363636363636363,
"grad_norm": 2.8850600719451904,
"kl": 0.06893503013166732,
"learning_rate": 8.067960709356478e-08,
"loss": 0.0001,
"reward": 0.3723179179110697,
"reward_std": 0.6978639279093061,
"rewards/concensus_correctness_reward_func": 0.07142857142857142,
"rewards/consensus_reward_func": 0.14285714285714285,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.2334607969969511,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.07542857208422252,
"step": 16
},
{
"completion_length": 356.7142857142857,
"epoch": 6.0,
"grad_norm": 36.78139114379883,
"kl": 0.10154176016970139,
"learning_rate": 3.013156219837776e-08,
"loss": 0.0001,
"reward": 0.4411936615194593,
"reward_std": 0.49921108103756395,
"rewards/concensus_correctness_reward_func": 0.07142857142857142,
"rewards/consensus_reward_func": 0.14285714285714285,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.21180081207837378,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.015107142073767526,
"step": 18
},
{
"completion_length": 408.0625,
"epoch": 6.7272727272727275,
"grad_norm": 1.6329376697540283,
"kl": 0.006408709974493831,
"learning_rate": 3.4096741493194193e-09,
"loss": 0.0,
"reward": 0.37784312618896365,
"reward_std": 0.4983527325093746,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 0.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.19749936903826892,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.18034374713897705,
"step": 20
},
{
"epoch": 6.7272727272727275,
"step": 20,
"total_flos": 0.0,
"train_loss": 0.0004911098741558817,
"train_runtime": 327.6226,
"train_samples_per_second": 0.977,
"train_steps_per_second": 0.061
}
],
"logging_steps": 2,
"max_steps": 20,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}