Transformers
Safetensors
Generated from Trainer
rl-swarm
grpo
gensyn
I am fast restless gull
unsloth
trl
Instructions to use chinna6/Qwen2.5-0.5B-Instruct-Gensyn-Swarm-fast_restless_gull with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use chinna6/Qwen2.5-0.5B-Instruct-Gensyn-Swarm-fast_restless_gull with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("chinna6/Qwen2.5-0.5B-Instruct-Gensyn-Swarm-fast_restless_gull", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Desktop
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN,
"... is not valid JSON
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 6.7272727272727275, | |
| "eval_steps": 500, | |
| "global_step": 20, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "completion_length": 392.125, | |
| "epoch": 0.7272727272727273, | |
| "grad_norm": 2.3548953533172607, | |
| "kl": 8.267481666734966e-05, | |
| "learning_rate": 4.965903258506806e-07, | |
| "loss": 0.0, | |
| "reward": 0.22768377978354692, | |
| "reward_std": 0.3886153739877045, | |
| "rewards/concensus_correctness_reward_func": 0.015687499195337296, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.2580275312066078, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": -0.04603125946596265, | |
| "step": 2 | |
| }, | |
| { | |
| "completion_length": 404.64285714285717, | |
| "epoch": 1.3636363636363638, | |
| "grad_norm": NaN, | |
| "kl": 0.0011071320425669131, | |
| "learning_rate": 4.864543104251586e-07, | |
| "loss": 0.0, | |
| "reward": 0.032648100916828425, | |
| "reward_std": 0.20958313665219716, | |
| "rewards/concensus_correctness_reward_func": 0.0, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.08168381186468261, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": -0.04903571307659149, | |
| "step": 4 | |
| }, | |
| { | |
| "completion_length": 297.85714285714283, | |
| "epoch": 2.0, | |
| "grad_norm": 3.1153604984283447, | |
| "kl": 4.778541071053561e-05, | |
| "learning_rate": 4.472851273490984e-07, | |
| "loss": 0.0, | |
| "reward": 0.20052496450287954, | |
| "reward_std": 0.25849828869104385, | |
| "rewards/concensus_correctness_reward_func": 0.0, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.17427496133106096, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": 0.026250002639634267, | |
| "step": 6 | |
| }, | |
| { | |
| "completion_length": 390.59375, | |
| "epoch": 2.7272727272727275, | |
| "grad_norm": 1.8379318714141846, | |
| "kl": 7.826527257748239e-05, | |
| "learning_rate": 3.867370395306068e-07, | |
| "loss": 0.0, | |
| "reward": 0.06725184712558985, | |
| "reward_std": 0.4277870515361428, | |
| "rewards/concensus_correctness_reward_func": 0.0, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.13472059718333185, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": -0.06746875029057264, | |
| "step": 8 | |
| }, | |
| { | |
| "completion_length": 314.17857142857144, | |
| "epoch": 3.3636363636363638, | |
| "grad_norm": 8.823220252990723, | |
| "kl": 6.003522191479403e-05, | |
| "learning_rate": 3.1137137178519977e-07, | |
| "loss": 0.0, | |
| "reward": 0.602835435952459, | |
| "reward_std": 0.3692689197404044, | |
| "rewards/concensus_correctness_reward_func": 0.0, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.2830496983868735, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": 0.31978571840694975, | |
| "step": 10 | |
| }, | |
| { | |
| "completion_length": 377.89285714285717, | |
| "epoch": 4.0, | |
| "grad_norm": 1.446035623550415, | |
| "kl": 6.864860259676269e-05, | |
| "learning_rate": 2.2935516363191693e-07, | |
| "loss": 0.0, | |
| "reward": 0.31896616731371197, | |
| "reward_std": 0.3869111631065607, | |
| "rewards/concensus_correctness_reward_func": 0.0, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.15957331018788473, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": 0.15939285925456456, | |
| "step": 12 | |
| }, | |
| { | |
| "completion_length": 356.96875, | |
| "epoch": 4.7272727272727275, | |
| "grad_norm": NaN, | |
| "kl": 0.00014677891823566824, | |
| "learning_rate": 2.2935516363191693e-07, | |
| "loss": 0.0, | |
| "reward": 0.24034546129405499, | |
| "reward_std": 0.27134356228634715, | |
| "rewards/concensus_correctness_reward_func": 0.015687499195337296, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.13928297231905162, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": 0.08537500188685954, | |
| "step": 14 | |
| }, | |
| { | |
| "completion_length": 447.39285714285717, | |
| "epoch": 5.363636363636363, | |
| "grad_norm": 8.778853416442871, | |
| "kl": 6.431972282630991e-05, | |
| "learning_rate": 1.4957614383675767e-07, | |
| "loss": 0.0, | |
| "reward": 0.1563647144607135, | |
| "reward_std": 0.42256759639297214, | |
| "rewards/concensus_correctness_reward_func": 0.0, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.14450755422668798, | |
| "rewards/soft_format_reward_func": 0.017857142857142856, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": -0.00599999725818634, | |
| "step": 16 | |
| }, | |
| { | |
| "completion_length": 325.42857142857144, | |
| "epoch": 6.0, | |
| "grad_norm": NaN, | |
| "kl": 0.002005238527220042, | |
| "learning_rate": 1.1326296046939333e-07, | |
| "loss": 0.0, | |
| "reward": 0.17687146259205683, | |
| "reward_std": 0.15588495135307312, | |
| "rewards/concensus_correctness_reward_func": 0.0, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.15162146131375007, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": 0.02524999901652336, | |
| "step": 18 | |
| }, | |
| { | |
| "completion_length": 410.5625, | |
| "epoch": 6.7272727272727275, | |
| "grad_norm": 2.279639720916748, | |
| "kl": 4.0441590726914e-05, | |
| "learning_rate": 5.271487265090163e-08, | |
| "loss": 0.0, | |
| "reward": 0.3732794551178813, | |
| "reward_std": 0.37106609204784036, | |
| "rewards/concensus_correctness_reward_func": 0.0, | |
| "rewards/consensus_reward_func": 0.0, | |
| "rewards/cumulative_reward_2": 0.0, | |
| "rewards/final_correctness_reward_func": 0.0, | |
| "rewards/question_recreation_reward_func": 0.22265444789081812, | |
| "rewards/soft_format_reward_func": 0.0, | |
| "rewards/strict_format_reward_func": 0.0, | |
| "rewards/xmlcount_reward_func": 0.15062500350177288, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 6.7272727272727275, | |
| "step": 20, | |
| "total_flos": 0.0, | |
| "train_loss": 3.5012255779065525e-07, | |
| "train_runtime": 1119.4838, | |
| "train_samples_per_second": 0.286, | |
| "train_steps_per_second": 0.018 | |
| } | |
| ], | |
| "logging_steps": 2, | |
| "max_steps": 20, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 25, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |