{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 10.0, "eval_steps": 500, "global_step": 4630, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.1079913606911447, "grad_norm": 15.24159049987793, "learning_rate": 2.1166306695464366e-06, "loss": 1.9486, "step": 50 }, { "epoch": 0.2159827213822894, "grad_norm": 16.068605422973633, "learning_rate": 4.276457883369331e-06, "loss": 1.2593, "step": 100 }, { "epoch": 0.32397408207343414, "grad_norm": 15.524004936218262, "learning_rate": 6.436285097192225e-06, "loss": 0.7355, "step": 150 }, { "epoch": 0.4319654427645788, "grad_norm": 18.918603897094727, "learning_rate": 8.59611231101512e-06, "loss": 0.546, "step": 200 }, { "epoch": 0.5399568034557235, "grad_norm": 13.727082252502441, "learning_rate": 1.0755939524838012e-05, "loss": 0.4791, "step": 250 }, { "epoch": 0.6479481641468683, "grad_norm": 13.836669921875, "learning_rate": 1.2915766738660909e-05, "loss": 0.3971, "step": 300 }, { "epoch": 0.755939524838013, "grad_norm": 4.7911481857299805, "learning_rate": 1.5075593952483802e-05, "loss": 0.3148, "step": 350 }, { "epoch": 0.8639308855291576, "grad_norm": 6.807811737060547, "learning_rate": 1.7235421166306695e-05, "loss": 0.3241, "step": 400 }, { "epoch": 0.9719222462203023, "grad_norm": 0.5625627040863037, "learning_rate": 1.939524838012959e-05, "loss": 0.2552, "step": 450 }, { "epoch": 1.0, "eval_loss": 0.2700121998786926, "eval_runtime": 20.772, "eval_samples_per_second": 39.621, "eval_steps_per_second": 2.503, "step": 463 }, { "epoch": 1.079913606911447, "grad_norm": 8.922011375427246, "learning_rate": 1.982721382289417e-05, "loss": 0.2515, "step": 500 }, { "epoch": 1.187904967602592, "grad_norm": 3.4080042839050293, "learning_rate": 1.9587233021358293e-05, "loss": 0.2607, "step": 550 }, { "epoch": 1.2958963282937366, "grad_norm": 0.810586154460907, "learning_rate": 1.9347252219822416e-05, "loss": 0.2093, "step": 600 }, { "epoch": 1.4038876889848813, "grad_norm": 4.636417865753174, "learning_rate": 1.910727141828654e-05, "loss": 0.2755, "step": 650 }, { "epoch": 1.511879049676026, "grad_norm": 8.486068725585938, "learning_rate": 1.8867290616750663e-05, "loss": 0.1779, "step": 700 }, { "epoch": 1.6198704103671706, "grad_norm": 13.278620719909668, "learning_rate": 1.8627309815214783e-05, "loss": 0.1862, "step": 750 }, { "epoch": 1.7278617710583153, "grad_norm": 5.251581192016602, "learning_rate": 1.8387329013678906e-05, "loss": 0.1645, "step": 800 }, { "epoch": 1.83585313174946, "grad_norm": 5.251072883605957, "learning_rate": 1.814734821214303e-05, "loss": 0.1676, "step": 850 }, { "epoch": 1.9438444924406046, "grad_norm": 7.933957099914551, "learning_rate": 1.7907367410607153e-05, "loss": 0.2098, "step": 900 }, { "epoch": 2.0, "eval_loss": 0.19168274104595184, "eval_runtime": 21.6821, "eval_samples_per_second": 37.958, "eval_steps_per_second": 2.398, "step": 926 }, { "epoch": 2.0518358531317493, "grad_norm": 2.119457960128784, "learning_rate": 1.7667386609071277e-05, "loss": 0.2279, "step": 950 }, { "epoch": 2.159827213822894, "grad_norm": 4.489124774932861, "learning_rate": 1.7427405807535397e-05, "loss": 0.1753, "step": 1000 }, { "epoch": 2.267818574514039, "grad_norm": 5.081973075866699, "learning_rate": 1.718742500599952e-05, "loss": 0.181, "step": 1050 }, { "epoch": 2.375809935205184, "grad_norm": 13.309564590454102, "learning_rate": 1.6947444204463643e-05, "loss": 0.1755, "step": 1100 }, { "epoch": 2.4838012958963285, "grad_norm": 5.2334723472595215, "learning_rate": 1.6707463402927767e-05, "loss": 0.1633, "step": 1150 }, { "epoch": 2.591792656587473, "grad_norm": 4.591087818145752, "learning_rate": 1.646748260139189e-05, "loss": 0.13, "step": 1200 }, { "epoch": 2.699784017278618, "grad_norm": 0.08640618622303009, "learning_rate": 1.6227501799856014e-05, "loss": 0.1237, "step": 1250 }, { "epoch": 2.8077753779697625, "grad_norm": 3.6601691246032715, "learning_rate": 1.5987520998320137e-05, "loss": 0.1911, "step": 1300 }, { "epoch": 2.915766738660907, "grad_norm": 1.4245907068252563, "learning_rate": 1.574754019678426e-05, "loss": 0.1655, "step": 1350 }, { "epoch": 3.0, "eval_loss": 0.1828612983226776, "eval_runtime": 22.4072, "eval_samples_per_second": 36.729, "eval_steps_per_second": 2.321, "step": 1389 }, { "epoch": 3.023758099352052, "grad_norm": 3.9116933345794678, "learning_rate": 1.550755939524838e-05, "loss": 0.1548, "step": 1400 }, { "epoch": 3.1317494600431965, "grad_norm": 5.976468563079834, "learning_rate": 1.5267578593712504e-05, "loss": 0.1487, "step": 1450 }, { "epoch": 3.239740820734341, "grad_norm": 3.716071128845215, "learning_rate": 1.5027597792176627e-05, "loss": 0.1692, "step": 1500 }, { "epoch": 3.347732181425486, "grad_norm": 4.578957557678223, "learning_rate": 1.478761699064075e-05, "loss": 0.1719, "step": 1550 }, { "epoch": 3.4557235421166306, "grad_norm": 4.424953460693359, "learning_rate": 1.4547636189104872e-05, "loss": 0.1541, "step": 1600 }, { "epoch": 3.5637149028077753, "grad_norm": 5.738244533538818, "learning_rate": 1.4307655387568996e-05, "loss": 0.1664, "step": 1650 }, { "epoch": 3.67170626349892, "grad_norm": 0.7902525663375854, "learning_rate": 1.4067674586033117e-05, "loss": 0.1451, "step": 1700 }, { "epoch": 3.7796976241900646, "grad_norm": 10.984625816345215, "learning_rate": 1.382769378449724e-05, "loss": 0.163, "step": 1750 }, { "epoch": 3.8876889848812093, "grad_norm": 0.3437069058418274, "learning_rate": 1.3587712982961366e-05, "loss": 0.1615, "step": 1800 }, { "epoch": 3.995680345572354, "grad_norm": 6.087996006011963, "learning_rate": 1.3347732181425487e-05, "loss": 0.1445, "step": 1850 }, { "epoch": 4.0, "eval_loss": 0.18373550474643707, "eval_runtime": 19.1948, "eval_samples_per_second": 42.876, "eval_steps_per_second": 2.709, "step": 1852 }, { "epoch": 4.103671706263499, "grad_norm": 9.516853332519531, "learning_rate": 1.310775137988961e-05, "loss": 0.1527, "step": 1900 }, { "epoch": 4.211663066954643, "grad_norm": 3.8790721893310547, "learning_rate": 1.2867770578353732e-05, "loss": 0.1439, "step": 1950 }, { "epoch": 4.319654427645788, "grad_norm": 5.269755840301514, "learning_rate": 1.2627789776817856e-05, "loss": 0.1321, "step": 2000 }, { "epoch": 4.427645788336933, "grad_norm": 6.4369893074035645, "learning_rate": 1.238780897528198e-05, "loss": 0.1593, "step": 2050 }, { "epoch": 4.535637149028078, "grad_norm": 9.754737854003906, "learning_rate": 1.2147828173746101e-05, "loss": 0.1388, "step": 2100 }, { "epoch": 4.643628509719223, "grad_norm": 4.531418800354004, "learning_rate": 1.1907847372210224e-05, "loss": 0.1434, "step": 2150 }, { "epoch": 4.751619870410368, "grad_norm": 2.5565500259399414, "learning_rate": 1.1667866570674346e-05, "loss": 0.1456, "step": 2200 }, { "epoch": 4.859611231101512, "grad_norm": 3.0373988151550293, "learning_rate": 1.142788576913847e-05, "loss": 0.1568, "step": 2250 }, { "epoch": 4.967602591792657, "grad_norm": 7.106463432312012, "learning_rate": 1.1187904967602593e-05, "loss": 0.1549, "step": 2300 }, { "epoch": 5.0, "eval_loss": 0.16200467944145203, "eval_runtime": 19.8308, "eval_samples_per_second": 41.501, "eval_steps_per_second": 2.622, "step": 2315 }, { "epoch": 5.075593952483802, "grad_norm": 1.8910789489746094, "learning_rate": 1.0947924166066714e-05, "loss": 0.1736, "step": 2350 }, { "epoch": 5.183585313174946, "grad_norm": 1.3723983764648438, "learning_rate": 1.070794336453084e-05, "loss": 0.1337, "step": 2400 }, { "epoch": 5.291576673866091, "grad_norm": 2.3787972927093506, "learning_rate": 1.0467962562994963e-05, "loss": 0.1221, "step": 2450 }, { "epoch": 5.399568034557236, "grad_norm": 2.458906412124634, "learning_rate": 1.0227981761459085e-05, "loss": 0.1372, "step": 2500 }, { "epoch": 5.50755939524838, "grad_norm": 2.6780011653900146, "learning_rate": 9.988000959923208e-06, "loss": 0.1682, "step": 2550 }, { "epoch": 5.615550755939525, "grad_norm": 2.9658782482147217, "learning_rate": 9.74802015838733e-06, "loss": 0.1489, "step": 2600 }, { "epoch": 5.72354211663067, "grad_norm": 2.0444753170013428, "learning_rate": 9.508039356851453e-06, "loss": 0.138, "step": 2650 }, { "epoch": 5.831533477321814, "grad_norm": 2.001603603363037, "learning_rate": 9.268058555315575e-06, "loss": 0.1197, "step": 2700 }, { "epoch": 5.939524838012959, "grad_norm": 0.0714740976691246, "learning_rate": 9.028077753779698e-06, "loss": 0.139, "step": 2750 }, { "epoch": 6.0, "eval_loss": 0.16732291877269745, "eval_runtime": 24.8414, "eval_samples_per_second": 33.13, "eval_steps_per_second": 2.093, "step": 2778 }, { "epoch": 6.047516198704104, "grad_norm": 4.453672885894775, "learning_rate": 8.788096952243822e-06, "loss": 0.1503, "step": 2800 }, { "epoch": 6.155507559395248, "grad_norm": 2.792571544647217, "learning_rate": 8.548116150707943e-06, "loss": 0.1441, "step": 2850 }, { "epoch": 6.263498920086393, "grad_norm": 0.1777549535036087, "learning_rate": 8.308135349172067e-06, "loss": 0.1614, "step": 2900 }, { "epoch": 6.371490280777538, "grad_norm": 3.0961155891418457, "learning_rate": 8.06815454763619e-06, "loss": 0.1179, "step": 2950 }, { "epoch": 6.479481641468682, "grad_norm": 0.10719757527112961, "learning_rate": 7.828173746100313e-06, "loss": 0.1509, "step": 3000 }, { "epoch": 6.587473002159827, "grad_norm": 0.027445131912827492, "learning_rate": 7.588192944564435e-06, "loss": 0.1467, "step": 3050 }, { "epoch": 6.695464362850972, "grad_norm": 5.075443267822266, "learning_rate": 7.348212143028558e-06, "loss": 0.141, "step": 3100 }, { "epoch": 6.8034557235421165, "grad_norm": 0.1375100016593933, "learning_rate": 7.108231341492681e-06, "loss": 0.1358, "step": 3150 }, { "epoch": 6.911447084233261, "grad_norm": 2.0139362812042236, "learning_rate": 6.868250539956804e-06, "loss": 0.1639, "step": 3200 }, { "epoch": 7.0, "eval_loss": 0.15860523283481598, "eval_runtime": 26.2207, "eval_samples_per_second": 31.387, "eval_steps_per_second": 1.983, "step": 3241 }, { "epoch": 7.019438444924406, "grad_norm": 0.09312976896762848, "learning_rate": 6.628269738420927e-06, "loss": 0.1294, "step": 3250 }, { "epoch": 7.1274298056155505, "grad_norm": 3.9996461868286133, "learning_rate": 6.3882889368850495e-06, "loss": 0.1344, "step": 3300 }, { "epoch": 7.235421166306695, "grad_norm": 1.266003966331482, "learning_rate": 6.148308135349173e-06, "loss": 0.1138, "step": 3350 }, { "epoch": 7.34341252699784, "grad_norm": 0.8446139097213745, "learning_rate": 5.908327333813295e-06, "loss": 0.1409, "step": 3400 }, { "epoch": 7.4514038876889845, "grad_norm": 2.299039125442505, "learning_rate": 5.668346532277418e-06, "loss": 0.1293, "step": 3450 }, { "epoch": 7.559395248380129, "grad_norm": 1.5416117906570435, "learning_rate": 5.428365730741541e-06, "loss": 0.1088, "step": 3500 }, { "epoch": 7.667386609071274, "grad_norm": 3.3261375427246094, "learning_rate": 5.188384929205664e-06, "loss": 0.1399, "step": 3550 }, { "epoch": 7.775377969762419, "grad_norm": 3.3896985054016113, "learning_rate": 4.948404127669787e-06, "loss": 0.127, "step": 3600 }, { "epoch": 7.883369330453563, "grad_norm": 0.08087552338838577, "learning_rate": 4.70842332613391e-06, "loss": 0.1448, "step": 3650 }, { "epoch": 7.991360691144708, "grad_norm": 0.712371289730072, "learning_rate": 4.468442524598032e-06, "loss": 0.1376, "step": 3700 }, { "epoch": 8.0, "eval_loss": 0.1555214673280716, "eval_runtime": 26.2282, "eval_samples_per_second": 31.378, "eval_steps_per_second": 1.983, "step": 3704 }, { "epoch": 8.099352051835853, "grad_norm": 0.04458538815379143, "learning_rate": 4.228461723062156e-06, "loss": 0.1171, "step": 3750 }, { "epoch": 8.207343412526997, "grad_norm": 3.261307954788208, "learning_rate": 3.988480921526278e-06, "loss": 0.1221, "step": 3800 }, { "epoch": 8.315334773218142, "grad_norm": 0.07829932123422623, "learning_rate": 3.7485001199904008e-06, "loss": 0.1406, "step": 3850 }, { "epoch": 8.423326133909287, "grad_norm": 2.330026626586914, "learning_rate": 3.508519318454524e-06, "loss": 0.1299, "step": 3900 }, { "epoch": 8.531317494600431, "grad_norm": 0.7942795753479004, "learning_rate": 3.2685385169186467e-06, "loss": 0.1363, "step": 3950 }, { "epoch": 8.639308855291576, "grad_norm": 2.6522200107574463, "learning_rate": 3.0285577153827692e-06, "loss": 0.117, "step": 4000 }, { "epoch": 8.74730021598272, "grad_norm": 2.3869872093200684, "learning_rate": 2.7885769138468926e-06, "loss": 0.1572, "step": 4050 }, { "epoch": 8.855291576673865, "grad_norm": 1.1808924674987793, "learning_rate": 2.548596112311015e-06, "loss": 0.1213, "step": 4100 }, { "epoch": 8.96328293736501, "grad_norm": 3.1210787296295166, "learning_rate": 2.308615310775138e-06, "loss": 0.1218, "step": 4150 }, { "epoch": 9.0, "eval_loss": 0.15509691834449768, "eval_runtime": 26.4137, "eval_samples_per_second": 31.158, "eval_steps_per_second": 1.969, "step": 4167 }, { "epoch": 9.071274298056155, "grad_norm": 1.0357710123062134, "learning_rate": 2.068634509239261e-06, "loss": 0.1333, "step": 4200 }, { "epoch": 9.1792656587473, "grad_norm": 3.8207991123199463, "learning_rate": 1.8286537077033838e-06, "loss": 0.1339, "step": 4250 }, { "epoch": 9.287257019438446, "grad_norm": 3.1769232749938965, "learning_rate": 1.5886729061675068e-06, "loss": 0.1477, "step": 4300 }, { "epoch": 9.39524838012959, "grad_norm": 2.3620474338531494, "learning_rate": 1.3486921046316296e-06, "loss": 0.1013, "step": 4350 }, { "epoch": 9.503239740820735, "grad_norm": 0.047901928424835205, "learning_rate": 1.1087113030957525e-06, "loss": 0.1241, "step": 4400 }, { "epoch": 9.61123110151188, "grad_norm": 0.07165756076574326, "learning_rate": 8.687305015598753e-07, "loss": 0.1091, "step": 4450 }, { "epoch": 9.719222462203025, "grad_norm": 2.574002265930176, "learning_rate": 6.287497000239981e-07, "loss": 0.1077, "step": 4500 }, { "epoch": 9.82721382289417, "grad_norm": 1.7075910568237305, "learning_rate": 3.88768898488121e-07, "loss": 0.1261, "step": 4550 }, { "epoch": 9.935205183585314, "grad_norm": 2.4924235343933105, "learning_rate": 1.4878809695224384e-07, "loss": 0.1396, "step": 4600 }, { "epoch": 10.0, "eval_loss": 0.1544954627752304, "eval_runtime": 27.5689, "eval_samples_per_second": 29.852, "eval_steps_per_second": 1.886, "step": 4630 } ], "logging_steps": 50, "max_steps": 4630, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }