qinghuiwan's picture
Upload folder using huggingface_hub
ecaf2df verified
Raw
History Blame Contribute Delete
18.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 10.0,
"eval_steps": 500,
"global_step": 4630,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.1079913606911447,
"grad_norm": 15.24159049987793,
"learning_rate": 2.1166306695464366e-06,
"loss": 1.9486,
"step": 50
},
{
"epoch": 0.2159827213822894,
"grad_norm": 16.068605422973633,
"learning_rate": 4.276457883369331e-06,
"loss": 1.2593,
"step": 100
},
{
"epoch": 0.32397408207343414,
"grad_norm": 15.524004936218262,
"learning_rate": 6.436285097192225e-06,
"loss": 0.7355,
"step": 150
},
{
"epoch": 0.4319654427645788,
"grad_norm": 18.918603897094727,
"learning_rate": 8.59611231101512e-06,
"loss": 0.546,
"step": 200
},
{
"epoch": 0.5399568034557235,
"grad_norm": 13.727082252502441,
"learning_rate": 1.0755939524838012e-05,
"loss": 0.4791,
"step": 250
},
{
"epoch": 0.6479481641468683,
"grad_norm": 13.836669921875,
"learning_rate": 1.2915766738660909e-05,
"loss": 0.3971,
"step": 300
},
{
"epoch": 0.755939524838013,
"grad_norm": 4.7911481857299805,
"learning_rate": 1.5075593952483802e-05,
"loss": 0.3148,
"step": 350
},
{
"epoch": 0.8639308855291576,
"grad_norm": 6.807811737060547,
"learning_rate": 1.7235421166306695e-05,
"loss": 0.3241,
"step": 400
},
{
"epoch": 0.9719222462203023,
"grad_norm": 0.5625627040863037,
"learning_rate": 1.939524838012959e-05,
"loss": 0.2552,
"step": 450
},
{
"epoch": 1.0,
"eval_loss": 0.2700121998786926,
"eval_runtime": 20.772,
"eval_samples_per_second": 39.621,
"eval_steps_per_second": 2.503,
"step": 463
},
{
"epoch": 1.079913606911447,
"grad_norm": 8.922011375427246,
"learning_rate": 1.982721382289417e-05,
"loss": 0.2515,
"step": 500
},
{
"epoch": 1.187904967602592,
"grad_norm": 3.4080042839050293,
"learning_rate": 1.9587233021358293e-05,
"loss": 0.2607,
"step": 550
},
{
"epoch": 1.2958963282937366,
"grad_norm": 0.810586154460907,
"learning_rate": 1.9347252219822416e-05,
"loss": 0.2093,
"step": 600
},
{
"epoch": 1.4038876889848813,
"grad_norm": 4.636417865753174,
"learning_rate": 1.910727141828654e-05,
"loss": 0.2755,
"step": 650
},
{
"epoch": 1.511879049676026,
"grad_norm": 8.486068725585938,
"learning_rate": 1.8867290616750663e-05,
"loss": 0.1779,
"step": 700
},
{
"epoch": 1.6198704103671706,
"grad_norm": 13.278620719909668,
"learning_rate": 1.8627309815214783e-05,
"loss": 0.1862,
"step": 750
},
{
"epoch": 1.7278617710583153,
"grad_norm": 5.251581192016602,
"learning_rate": 1.8387329013678906e-05,
"loss": 0.1645,
"step": 800
},
{
"epoch": 1.83585313174946,
"grad_norm": 5.251072883605957,
"learning_rate": 1.814734821214303e-05,
"loss": 0.1676,
"step": 850
},
{
"epoch": 1.9438444924406046,
"grad_norm": 7.933957099914551,
"learning_rate": 1.7907367410607153e-05,
"loss": 0.2098,
"step": 900
},
{
"epoch": 2.0,
"eval_loss": 0.19168274104595184,
"eval_runtime": 21.6821,
"eval_samples_per_second": 37.958,
"eval_steps_per_second": 2.398,
"step": 926
},
{
"epoch": 2.0518358531317493,
"grad_norm": 2.119457960128784,
"learning_rate": 1.7667386609071277e-05,
"loss": 0.2279,
"step": 950
},
{
"epoch": 2.159827213822894,
"grad_norm": 4.489124774932861,
"learning_rate": 1.7427405807535397e-05,
"loss": 0.1753,
"step": 1000
},
{
"epoch": 2.267818574514039,
"grad_norm": 5.081973075866699,
"learning_rate": 1.718742500599952e-05,
"loss": 0.181,
"step": 1050
},
{
"epoch": 2.375809935205184,
"grad_norm": 13.309564590454102,
"learning_rate": 1.6947444204463643e-05,
"loss": 0.1755,
"step": 1100
},
{
"epoch": 2.4838012958963285,
"grad_norm": 5.2334723472595215,
"learning_rate": 1.6707463402927767e-05,
"loss": 0.1633,
"step": 1150
},
{
"epoch": 2.591792656587473,
"grad_norm": 4.591087818145752,
"learning_rate": 1.646748260139189e-05,
"loss": 0.13,
"step": 1200
},
{
"epoch": 2.699784017278618,
"grad_norm": 0.08640618622303009,
"learning_rate": 1.6227501799856014e-05,
"loss": 0.1237,
"step": 1250
},
{
"epoch": 2.8077753779697625,
"grad_norm": 3.6601691246032715,
"learning_rate": 1.5987520998320137e-05,
"loss": 0.1911,
"step": 1300
},
{
"epoch": 2.915766738660907,
"grad_norm": 1.4245907068252563,
"learning_rate": 1.574754019678426e-05,
"loss": 0.1655,
"step": 1350
},
{
"epoch": 3.0,
"eval_loss": 0.1828612983226776,
"eval_runtime": 22.4072,
"eval_samples_per_second": 36.729,
"eval_steps_per_second": 2.321,
"step": 1389
},
{
"epoch": 3.023758099352052,
"grad_norm": 3.9116933345794678,
"learning_rate": 1.550755939524838e-05,
"loss": 0.1548,
"step": 1400
},
{
"epoch": 3.1317494600431965,
"grad_norm": 5.976468563079834,
"learning_rate": 1.5267578593712504e-05,
"loss": 0.1487,
"step": 1450
},
{
"epoch": 3.239740820734341,
"grad_norm": 3.716071128845215,
"learning_rate": 1.5027597792176627e-05,
"loss": 0.1692,
"step": 1500
},
{
"epoch": 3.347732181425486,
"grad_norm": 4.578957557678223,
"learning_rate": 1.478761699064075e-05,
"loss": 0.1719,
"step": 1550
},
{
"epoch": 3.4557235421166306,
"grad_norm": 4.424953460693359,
"learning_rate": 1.4547636189104872e-05,
"loss": 0.1541,
"step": 1600
},
{
"epoch": 3.5637149028077753,
"grad_norm": 5.738244533538818,
"learning_rate": 1.4307655387568996e-05,
"loss": 0.1664,
"step": 1650
},
{
"epoch": 3.67170626349892,
"grad_norm": 0.7902525663375854,
"learning_rate": 1.4067674586033117e-05,
"loss": 0.1451,
"step": 1700
},
{
"epoch": 3.7796976241900646,
"grad_norm": 10.984625816345215,
"learning_rate": 1.382769378449724e-05,
"loss": 0.163,
"step": 1750
},
{
"epoch": 3.8876889848812093,
"grad_norm": 0.3437069058418274,
"learning_rate": 1.3587712982961366e-05,
"loss": 0.1615,
"step": 1800
},
{
"epoch": 3.995680345572354,
"grad_norm": 6.087996006011963,
"learning_rate": 1.3347732181425487e-05,
"loss": 0.1445,
"step": 1850
},
{
"epoch": 4.0,
"eval_loss": 0.18373550474643707,
"eval_runtime": 19.1948,
"eval_samples_per_second": 42.876,
"eval_steps_per_second": 2.709,
"step": 1852
},
{
"epoch": 4.103671706263499,
"grad_norm": 9.516853332519531,
"learning_rate": 1.310775137988961e-05,
"loss": 0.1527,
"step": 1900
},
{
"epoch": 4.211663066954643,
"grad_norm": 3.8790721893310547,
"learning_rate": 1.2867770578353732e-05,
"loss": 0.1439,
"step": 1950
},
{
"epoch": 4.319654427645788,
"grad_norm": 5.269755840301514,
"learning_rate": 1.2627789776817856e-05,
"loss": 0.1321,
"step": 2000
},
{
"epoch": 4.427645788336933,
"grad_norm": 6.4369893074035645,
"learning_rate": 1.238780897528198e-05,
"loss": 0.1593,
"step": 2050
},
{
"epoch": 4.535637149028078,
"grad_norm": 9.754737854003906,
"learning_rate": 1.2147828173746101e-05,
"loss": 0.1388,
"step": 2100
},
{
"epoch": 4.643628509719223,
"grad_norm": 4.531418800354004,
"learning_rate": 1.1907847372210224e-05,
"loss": 0.1434,
"step": 2150
},
{
"epoch": 4.751619870410368,
"grad_norm": 2.5565500259399414,
"learning_rate": 1.1667866570674346e-05,
"loss": 0.1456,
"step": 2200
},
{
"epoch": 4.859611231101512,
"grad_norm": 3.0373988151550293,
"learning_rate": 1.142788576913847e-05,
"loss": 0.1568,
"step": 2250
},
{
"epoch": 4.967602591792657,
"grad_norm": 7.106463432312012,
"learning_rate": 1.1187904967602593e-05,
"loss": 0.1549,
"step": 2300
},
{
"epoch": 5.0,
"eval_loss": 0.16200467944145203,
"eval_runtime": 19.8308,
"eval_samples_per_second": 41.501,
"eval_steps_per_second": 2.622,
"step": 2315
},
{
"epoch": 5.075593952483802,
"grad_norm": 1.8910789489746094,
"learning_rate": 1.0947924166066714e-05,
"loss": 0.1736,
"step": 2350
},
{
"epoch": 5.183585313174946,
"grad_norm": 1.3723983764648438,
"learning_rate": 1.070794336453084e-05,
"loss": 0.1337,
"step": 2400
},
{
"epoch": 5.291576673866091,
"grad_norm": 2.3787972927093506,
"learning_rate": 1.0467962562994963e-05,
"loss": 0.1221,
"step": 2450
},
{
"epoch": 5.399568034557236,
"grad_norm": 2.458906412124634,
"learning_rate": 1.0227981761459085e-05,
"loss": 0.1372,
"step": 2500
},
{
"epoch": 5.50755939524838,
"grad_norm": 2.6780011653900146,
"learning_rate": 9.988000959923208e-06,
"loss": 0.1682,
"step": 2550
},
{
"epoch": 5.615550755939525,
"grad_norm": 2.9658782482147217,
"learning_rate": 9.74802015838733e-06,
"loss": 0.1489,
"step": 2600
},
{
"epoch": 5.72354211663067,
"grad_norm": 2.0444753170013428,
"learning_rate": 9.508039356851453e-06,
"loss": 0.138,
"step": 2650
},
{
"epoch": 5.831533477321814,
"grad_norm": 2.001603603363037,
"learning_rate": 9.268058555315575e-06,
"loss": 0.1197,
"step": 2700
},
{
"epoch": 5.939524838012959,
"grad_norm": 0.0714740976691246,
"learning_rate": 9.028077753779698e-06,
"loss": 0.139,
"step": 2750
},
{
"epoch": 6.0,
"eval_loss": 0.16732291877269745,
"eval_runtime": 24.8414,
"eval_samples_per_second": 33.13,
"eval_steps_per_second": 2.093,
"step": 2778
},
{
"epoch": 6.047516198704104,
"grad_norm": 4.453672885894775,
"learning_rate": 8.788096952243822e-06,
"loss": 0.1503,
"step": 2800
},
{
"epoch": 6.155507559395248,
"grad_norm": 2.792571544647217,
"learning_rate": 8.548116150707943e-06,
"loss": 0.1441,
"step": 2850
},
{
"epoch": 6.263498920086393,
"grad_norm": 0.1777549535036087,
"learning_rate": 8.308135349172067e-06,
"loss": 0.1614,
"step": 2900
},
{
"epoch": 6.371490280777538,
"grad_norm": 3.0961155891418457,
"learning_rate": 8.06815454763619e-06,
"loss": 0.1179,
"step": 2950
},
{
"epoch": 6.479481641468682,
"grad_norm": 0.10719757527112961,
"learning_rate": 7.828173746100313e-06,
"loss": 0.1509,
"step": 3000
},
{
"epoch": 6.587473002159827,
"grad_norm": 0.027445131912827492,
"learning_rate": 7.588192944564435e-06,
"loss": 0.1467,
"step": 3050
},
{
"epoch": 6.695464362850972,
"grad_norm": 5.075443267822266,
"learning_rate": 7.348212143028558e-06,
"loss": 0.141,
"step": 3100
},
{
"epoch": 6.8034557235421165,
"grad_norm": 0.1375100016593933,
"learning_rate": 7.108231341492681e-06,
"loss": 0.1358,
"step": 3150
},
{
"epoch": 6.911447084233261,
"grad_norm": 2.0139362812042236,
"learning_rate": 6.868250539956804e-06,
"loss": 0.1639,
"step": 3200
},
{
"epoch": 7.0,
"eval_loss": 0.15860523283481598,
"eval_runtime": 26.2207,
"eval_samples_per_second": 31.387,
"eval_steps_per_second": 1.983,
"step": 3241
},
{
"epoch": 7.019438444924406,
"grad_norm": 0.09312976896762848,
"learning_rate": 6.628269738420927e-06,
"loss": 0.1294,
"step": 3250
},
{
"epoch": 7.1274298056155505,
"grad_norm": 3.9996461868286133,
"learning_rate": 6.3882889368850495e-06,
"loss": 0.1344,
"step": 3300
},
{
"epoch": 7.235421166306695,
"grad_norm": 1.266003966331482,
"learning_rate": 6.148308135349173e-06,
"loss": 0.1138,
"step": 3350
},
{
"epoch": 7.34341252699784,
"grad_norm": 0.8446139097213745,
"learning_rate": 5.908327333813295e-06,
"loss": 0.1409,
"step": 3400
},
{
"epoch": 7.4514038876889845,
"grad_norm": 2.299039125442505,
"learning_rate": 5.668346532277418e-06,
"loss": 0.1293,
"step": 3450
},
{
"epoch": 7.559395248380129,
"grad_norm": 1.5416117906570435,
"learning_rate": 5.428365730741541e-06,
"loss": 0.1088,
"step": 3500
},
{
"epoch": 7.667386609071274,
"grad_norm": 3.3261375427246094,
"learning_rate": 5.188384929205664e-06,
"loss": 0.1399,
"step": 3550
},
{
"epoch": 7.775377969762419,
"grad_norm": 3.3896985054016113,
"learning_rate": 4.948404127669787e-06,
"loss": 0.127,
"step": 3600
},
{
"epoch": 7.883369330453563,
"grad_norm": 0.08087552338838577,
"learning_rate": 4.70842332613391e-06,
"loss": 0.1448,
"step": 3650
},
{
"epoch": 7.991360691144708,
"grad_norm": 0.712371289730072,
"learning_rate": 4.468442524598032e-06,
"loss": 0.1376,
"step": 3700
},
{
"epoch": 8.0,
"eval_loss": 0.1555214673280716,
"eval_runtime": 26.2282,
"eval_samples_per_second": 31.378,
"eval_steps_per_second": 1.983,
"step": 3704
},
{
"epoch": 8.099352051835853,
"grad_norm": 0.04458538815379143,
"learning_rate": 4.228461723062156e-06,
"loss": 0.1171,
"step": 3750
},
{
"epoch": 8.207343412526997,
"grad_norm": 3.261307954788208,
"learning_rate": 3.988480921526278e-06,
"loss": 0.1221,
"step": 3800
},
{
"epoch": 8.315334773218142,
"grad_norm": 0.07829932123422623,
"learning_rate": 3.7485001199904008e-06,
"loss": 0.1406,
"step": 3850
},
{
"epoch": 8.423326133909287,
"grad_norm": 2.330026626586914,
"learning_rate": 3.508519318454524e-06,
"loss": 0.1299,
"step": 3900
},
{
"epoch": 8.531317494600431,
"grad_norm": 0.7942795753479004,
"learning_rate": 3.2685385169186467e-06,
"loss": 0.1363,
"step": 3950
},
{
"epoch": 8.639308855291576,
"grad_norm": 2.6522200107574463,
"learning_rate": 3.0285577153827692e-06,
"loss": 0.117,
"step": 4000
},
{
"epoch": 8.74730021598272,
"grad_norm": 2.3869872093200684,
"learning_rate": 2.7885769138468926e-06,
"loss": 0.1572,
"step": 4050
},
{
"epoch": 8.855291576673865,
"grad_norm": 1.1808924674987793,
"learning_rate": 2.548596112311015e-06,
"loss": 0.1213,
"step": 4100
},
{
"epoch": 8.96328293736501,
"grad_norm": 3.1210787296295166,
"learning_rate": 2.308615310775138e-06,
"loss": 0.1218,
"step": 4150
},
{
"epoch": 9.0,
"eval_loss": 0.15509691834449768,
"eval_runtime": 26.4137,
"eval_samples_per_second": 31.158,
"eval_steps_per_second": 1.969,
"step": 4167
},
{
"epoch": 9.071274298056155,
"grad_norm": 1.0357710123062134,
"learning_rate": 2.068634509239261e-06,
"loss": 0.1333,
"step": 4200
},
{
"epoch": 9.1792656587473,
"grad_norm": 3.8207991123199463,
"learning_rate": 1.8286537077033838e-06,
"loss": 0.1339,
"step": 4250
},
{
"epoch": 9.287257019438446,
"grad_norm": 3.1769232749938965,
"learning_rate": 1.5886729061675068e-06,
"loss": 0.1477,
"step": 4300
},
{
"epoch": 9.39524838012959,
"grad_norm": 2.3620474338531494,
"learning_rate": 1.3486921046316296e-06,
"loss": 0.1013,
"step": 4350
},
{
"epoch": 9.503239740820735,
"grad_norm": 0.047901928424835205,
"learning_rate": 1.1087113030957525e-06,
"loss": 0.1241,
"step": 4400
},
{
"epoch": 9.61123110151188,
"grad_norm": 0.07165756076574326,
"learning_rate": 8.687305015598753e-07,
"loss": 0.1091,
"step": 4450
},
{
"epoch": 9.719222462203025,
"grad_norm": 2.574002265930176,
"learning_rate": 6.287497000239981e-07,
"loss": 0.1077,
"step": 4500
},
{
"epoch": 9.82721382289417,
"grad_norm": 1.7075910568237305,
"learning_rate": 3.88768898488121e-07,
"loss": 0.1261,
"step": 4550
},
{
"epoch": 9.935205183585314,
"grad_norm": 2.4924235343933105,
"learning_rate": 1.4878809695224384e-07,
"loss": 0.1396,
"step": 4600
},
{
"epoch": 10.0,
"eval_loss": 0.1544954627752304,
"eval_runtime": 27.5689,
"eval_samples_per_second": 29.852,
"eval_steps_per_second": 1.886,
"step": 4630
}
],
"logging_steps": 50,
"max_steps": 4630,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}