{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.6666666666666666, "eval_steps": 500, "global_step": 2744, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0012147716229348883, "grad_norm": 22.0, "learning_rate": 3.380914285714285e-05, "loss": 2.1764, "step": 5 }, { "epoch": 0.0024295432458697765, "grad_norm": 13.1875, "learning_rate": 7.607057142857141e-05, "loss": 1.8601, "step": 10 }, { "epoch": 0.0036443148688046646, "grad_norm": 6.6875, "learning_rate": 0.00011833199999999999, "loss": 1.1947, "step": 15 }, { "epoch": 0.004859086491739553, "grad_norm": 2.65625, "learning_rate": 0.00016059342857142853, "loss": 0.7752, "step": 20 }, { "epoch": 0.0060738581146744415, "grad_norm": 1.6953125, "learning_rate": 0.00020285485714285713, "loss": 0.546, "step": 25 }, { "epoch": 0.007288629737609329, "grad_norm": 1.515625, "learning_rate": 0.0002451162857142857, "loss": 0.4864, "step": 30 }, { "epoch": 0.008503401360544218, "grad_norm": 0.93359375, "learning_rate": 0.00028737771428571425, "loss": 0.4397, "step": 35 }, { "epoch": 0.009718172983479106, "grad_norm": 1.46875, "learning_rate": 0.00029582994222560353, "loss": 0.466, "step": 40 }, { "epoch": 0.010932944606413994, "grad_norm": 1.3828125, "learning_rate": 0.00029582970751722125, "loss": 0.4189, "step": 45 }, { "epoch": 0.012147716229348883, "grad_norm": 1.09375, "learning_rate": 0.00029582929226433497, "loss": 0.4224, "step": 50 }, { "epoch": 0.01336248785228377, "grad_norm": 1.8828125, "learning_rate": 0.0002958286964676205, "loss": 0.4094, "step": 55 }, { "epoch": 0.014577259475218658, "grad_norm": 1.0078125, "learning_rate": 0.0002958279201280475, "loss": 0.3838, "step": 60 }, { "epoch": 0.015792031098153546, "grad_norm": 1.0390625, "learning_rate": 0.00029582696324687946, "loss": 0.389, "step": 65 }, { "epoch": 0.017006802721088437, "grad_norm": 1.328125, "learning_rate": 0.0002958258258256736, "loss": 0.3934, "step": 70 }, { "epoch": 0.017006802721088437, "eval_loss": 0.363860160112381, "eval_runtime": 2.4278, "eval_samples_per_second": 82.378, "eval_steps_per_second": 82.378, "step": 70 }, { "epoch": 0.018221574344023325, "grad_norm": 1.078125, "learning_rate": 0.0002958245078662811, "loss": 0.3635, "step": 75 }, { "epoch": 0.019436345966958212, "grad_norm": 1.15625, "learning_rate": 0.00029582300937084694, "loss": 0.354, "step": 80 }, { "epoch": 0.0206511175898931, "grad_norm": 0.91015625, "learning_rate": 0.00029582133034180983, "loss": 0.3154, "step": 85 }, { "epoch": 0.021865889212827987, "grad_norm": 0.96875, "learning_rate": 0.0002958194707819022, "loss": 0.3332, "step": 90 }, { "epoch": 0.023080660835762875, "grad_norm": 0.96484375, "learning_rate": 0.00029581743069415057, "loss": 0.3235, "step": 95 }, { "epoch": 0.024295432458697766, "grad_norm": 1.03125, "learning_rate": 0.00029581521008187507, "loss": 0.3195, "step": 100 }, { "epoch": 0.025510204081632654, "grad_norm": 0.93359375, "learning_rate": 0.00029581280894868967, "loss": 0.3159, "step": 105 }, { "epoch": 0.02672497570456754, "grad_norm": 1.046875, "learning_rate": 0.00029581022729850215, "loss": 0.3072, "step": 110 }, { "epoch": 0.02793974732750243, "grad_norm": 0.83203125, "learning_rate": 0.000295807465135514, "loss": 0.3268, "step": 115 }, { "epoch": 0.029154518950437316, "grad_norm": 0.92578125, "learning_rate": 0.00029580452246422064, "loss": 0.2857, "step": 120 }, { "epoch": 0.030369290573372208, "grad_norm": 0.9765625, "learning_rate": 0.0002958013992894111, "loss": 0.2897, "step": 125 }, { "epoch": 0.03158406219630709, "grad_norm": 0.8671875, "learning_rate": 0.0002957980956161683, "loss": 0.285, "step": 130 }, { "epoch": 0.03279883381924198, "grad_norm": 0.76953125, "learning_rate": 0.00029579461144986876, "loss": 0.2759, "step": 135 }, { "epoch": 0.034013605442176874, "grad_norm": 0.8828125, "learning_rate": 0.00029579094679618294, "loss": 0.2859, "step": 140 }, { "epoch": 0.03522837706511176, "grad_norm": 0.78125, "learning_rate": 0.00029578710166107484, "loss": 0.2717, "step": 145 }, { "epoch": 0.03644314868804665, "grad_norm": 1.046875, "learning_rate": 0.0002957830760508024, "loss": 0.2828, "step": 150 }, { "epoch": 0.03765792031098154, "grad_norm": 0.875, "learning_rate": 0.0002957788699719171, "loss": 0.2809, "step": 155 }, { "epoch": 0.038872691933916424, "grad_norm": 1.234375, "learning_rate": 0.00029577448343126415, "loss": 0.2889, "step": 160 }, { "epoch": 0.04008746355685131, "grad_norm": 0.8671875, "learning_rate": 0.00029576991643598264, "loss": 0.2642, "step": 165 }, { "epoch": 0.0413022351797862, "grad_norm": 1.046875, "learning_rate": 0.00029576516899350503, "loss": 0.2701, "step": 170 }, { "epoch": 0.04251700680272109, "grad_norm": 1.0078125, "learning_rate": 0.0002957602411115577, "loss": 0.2729, "step": 175 }, { "epoch": 0.043731778425655975, "grad_norm": 1.5, "learning_rate": 0.00029575513279816063, "loss": 0.2628, "step": 180 }, { "epoch": 0.04494655004859086, "grad_norm": 0.86328125, "learning_rate": 0.0002957498440616274, "loss": 0.2432, "step": 185 }, { "epoch": 0.04616132167152575, "grad_norm": 0.97265625, "learning_rate": 0.00029574437491056523, "loss": 0.2525, "step": 190 }, { "epoch": 0.047376093294460644, "grad_norm": 1.015625, "learning_rate": 0.0002957387253538751, "loss": 0.265, "step": 195 }, { "epoch": 0.04859086491739553, "grad_norm": 0.9921875, "learning_rate": 0.00029573289540075126, "loss": 0.2574, "step": 200 }, { "epoch": 0.04980563654033042, "grad_norm": 1.0703125, "learning_rate": 0.0002957268850606819, "loss": 0.2546, "step": 205 }, { "epoch": 0.05102040816326531, "grad_norm": 0.92578125, "learning_rate": 0.00029572069434344864, "loss": 0.2483, "step": 210 }, { "epoch": 0.052235179786200195, "grad_norm": 0.87890625, "learning_rate": 0.00029571432325912664, "loss": 0.2547, "step": 215 }, { "epoch": 0.05344995140913508, "grad_norm": 0.7890625, "learning_rate": 0.0002957077718180845, "loss": 0.2413, "step": 220 }, { "epoch": 0.05466472303206997, "grad_norm": 1.2109375, "learning_rate": 0.00029570104003098476, "loss": 0.2385, "step": 225 }, { "epoch": 0.05587949465500486, "grad_norm": 1.015625, "learning_rate": 0.00029569412790878295, "loss": 0.2319, "step": 230 }, { "epoch": 0.057094266277939745, "grad_norm": 0.91015625, "learning_rate": 0.0002956870354627284, "loss": 0.2327, "step": 235 }, { "epoch": 0.05830903790087463, "grad_norm": 1.03125, "learning_rate": 0.00029567976270436367, "loss": 0.2172, "step": 240 }, { "epoch": 0.05952380952380952, "grad_norm": 1.4609375, "learning_rate": 0.0002956723096455252, "loss": 0.2508, "step": 245 }, { "epoch": 0.060738581146744415, "grad_norm": 1.0234375, "learning_rate": 0.00029566467629834237, "loss": 0.2238, "step": 250 }, { "epoch": 0.0619533527696793, "grad_norm": 0.9765625, "learning_rate": 0.0002956568626752382, "loss": 0.2169, "step": 255 }, { "epoch": 0.06316812439261418, "grad_norm": 1.1328125, "learning_rate": 0.0002956488687889292, "loss": 0.2381, "step": 260 }, { "epoch": 0.06438289601554907, "grad_norm": 0.86328125, "learning_rate": 0.0002956406946524252, "loss": 0.2084, "step": 265 }, { "epoch": 0.06559766763848396, "grad_norm": 1.0703125, "learning_rate": 0.0002956323402790292, "loss": 0.2272, "step": 270 }, { "epoch": 0.06681243926141886, "grad_norm": 0.94140625, "learning_rate": 0.0002956238056823377, "loss": 0.2233, "step": 275 }, { "epoch": 0.06802721088435375, "grad_norm": 1.28125, "learning_rate": 0.00029561509087624045, "loss": 0.2112, "step": 280 }, { "epoch": 0.06924198250728864, "grad_norm": 1.21875, "learning_rate": 0.00029560619587492047, "loss": 0.2077, "step": 285 }, { "epoch": 0.07045675413022352, "grad_norm": 1.171875, "learning_rate": 0.0002955971206928542, "loss": 0.2171, "step": 290 }, { "epoch": 0.07167152575315841, "grad_norm": 1.03125, "learning_rate": 0.00029558786534481104, "loss": 0.2065, "step": 295 }, { "epoch": 0.0728862973760933, "grad_norm": 1.015625, "learning_rate": 0.00029557842984585385, "loss": 0.2142, "step": 300 }, { "epoch": 0.07410106899902819, "grad_norm": 1.0546875, "learning_rate": 0.00029556881421133856, "loss": 0.2114, "step": 305 }, { "epoch": 0.07531584062196307, "grad_norm": 1.4140625, "learning_rate": 0.0002955590184569143, "loss": 0.2145, "step": 310 }, { "epoch": 0.07653061224489796, "grad_norm": 1.1328125, "learning_rate": 0.0002955490425985233, "loss": 0.1923, "step": 315 }, { "epoch": 0.07774538386783285, "grad_norm": 0.9921875, "learning_rate": 0.00029553888665240094, "loss": 0.189, "step": 320 }, { "epoch": 0.07896015549076774, "grad_norm": 0.984375, "learning_rate": 0.0002955285506350757, "loss": 0.1808, "step": 325 }, { "epoch": 0.08017492711370262, "grad_norm": 1.15625, "learning_rate": 0.0002955180345633691, "loss": 0.1807, "step": 330 }, { "epoch": 0.08138969873663751, "grad_norm": 1.0625, "learning_rate": 0.0002955073384543956, "loss": 0.1841, "step": 335 }, { "epoch": 0.0826044703595724, "grad_norm": 0.9609375, "learning_rate": 0.0002954964623255629, "loss": 0.1794, "step": 340 }, { "epoch": 0.08381924198250729, "grad_norm": 1.0, "learning_rate": 0.0002954854061945714, "loss": 0.1816, "step": 345 }, { "epoch": 0.08503401360544217, "grad_norm": 1.046875, "learning_rate": 0.0002954741700794147, "loss": 0.1929, "step": 350 }, { "epoch": 0.08624878522837706, "grad_norm": 1.0859375, "learning_rate": 0.00029546275399837906, "loss": 0.1828, "step": 355 }, { "epoch": 0.08746355685131195, "grad_norm": 1.1953125, "learning_rate": 0.00029545115797004385, "loss": 0.18, "step": 360 }, { "epoch": 0.08867832847424684, "grad_norm": 1.109375, "learning_rate": 0.0002954393820132812, "loss": 0.1868, "step": 365 }, { "epoch": 0.08989310009718172, "grad_norm": 0.98828125, "learning_rate": 0.00029542742614725606, "loss": 0.1722, "step": 370 }, { "epoch": 0.09110787172011661, "grad_norm": 1.1171875, "learning_rate": 0.0002954152903914262, "loss": 0.1766, "step": 375 }, { "epoch": 0.0923226433430515, "grad_norm": 1.046875, "learning_rate": 0.0002954029747655422, "loss": 0.1594, "step": 380 }, { "epoch": 0.0935374149659864, "grad_norm": 1.015625, "learning_rate": 0.0002953904792896473, "loss": 0.188, "step": 385 }, { "epoch": 0.09475218658892129, "grad_norm": 1.1484375, "learning_rate": 0.0002953778039840774, "loss": 0.1933, "step": 390 }, { "epoch": 0.09596695821185618, "grad_norm": 0.9921875, "learning_rate": 0.0002953649488694612, "loss": 0.1601, "step": 395 }, { "epoch": 0.09718172983479106, "grad_norm": 1.046875, "learning_rate": 0.0002953519139667199, "loss": 0.1704, "step": 400 }, { "epoch": 0.09839650145772595, "grad_norm": 0.94921875, "learning_rate": 0.00029533869929706743, "loss": 0.1622, "step": 405 }, { "epoch": 0.09961127308066084, "grad_norm": 1.140625, "learning_rate": 0.0002953253048820102, "loss": 0.1602, "step": 410 }, { "epoch": 0.10082604470359573, "grad_norm": 1.03125, "learning_rate": 0.00029531173074334716, "loss": 0.1599, "step": 415 }, { "epoch": 0.10204081632653061, "grad_norm": 1.0078125, "learning_rate": 0.0002952979769031697, "loss": 0.1603, "step": 420 }, { "epoch": 0.1032555879494655, "grad_norm": 1.015625, "learning_rate": 0.0002952840433838618, "loss": 0.1642, "step": 425 }, { "epoch": 0.10447035957240039, "grad_norm": 1.0234375, "learning_rate": 0.00029526993020809975, "loss": 0.1506, "step": 430 }, { "epoch": 0.10568513119533528, "grad_norm": 1.078125, "learning_rate": 0.00029525563739885236, "loss": 0.1698, "step": 435 }, { "epoch": 0.10689990281827016, "grad_norm": 1.0703125, "learning_rate": 0.00029524116497938054, "loss": 0.1702, "step": 440 }, { "epoch": 0.10811467444120505, "grad_norm": 0.8203125, "learning_rate": 0.0002952265129732378, "loss": 0.1371, "step": 445 }, { "epoch": 0.10932944606413994, "grad_norm": 0.94140625, "learning_rate": 0.00029521168140426963, "loss": 0.1422, "step": 450 }, { "epoch": 0.11054421768707483, "grad_norm": 0.9765625, "learning_rate": 0.00029519667029661407, "loss": 0.1522, "step": 455 }, { "epoch": 0.11175898931000972, "grad_norm": 0.94140625, "learning_rate": 0.0002951814796747011, "loss": 0.1556, "step": 460 }, { "epoch": 0.1129737609329446, "grad_norm": 1.046875, "learning_rate": 0.0002951661095632529, "loss": 0.1396, "step": 465 }, { "epoch": 0.11418853255587949, "grad_norm": 1.0078125, "learning_rate": 0.0002951505599872839, "loss": 0.1425, "step": 470 }, { "epoch": 0.11540330417881438, "grad_norm": 0.984375, "learning_rate": 0.0002951348309721005, "loss": 0.1539, "step": 475 }, { "epoch": 0.11661807580174927, "grad_norm": 1.09375, "learning_rate": 0.000295118922543301, "loss": 0.1441, "step": 480 }, { "epoch": 0.11783284742468415, "grad_norm": 1.140625, "learning_rate": 0.00029510283472677603, "loss": 0.1353, "step": 485 }, { "epoch": 0.11904761904761904, "grad_norm": 0.9296875, "learning_rate": 0.00029508656754870786, "loss": 0.1262, "step": 490 }, { "epoch": 0.12026239067055394, "grad_norm": 1.03125, "learning_rate": 0.00029507012103557076, "loss": 0.1378, "step": 495 }, { "epoch": 0.12147716229348883, "grad_norm": 1.0625, "learning_rate": 0.00029505349521413086, "loss": 0.1396, "step": 500 }, { "epoch": 0.12147716229348883, "eval_loss": 0.1296369582414627, "eval_runtime": 2.4106, "eval_samples_per_second": 82.967, "eval_steps_per_second": 82.967, "step": 500 }, { "epoch": 0.12269193391642372, "grad_norm": 0.9375, "learning_rate": 0.00029503669011144616, "loss": 0.1333, "step": 505 }, { "epoch": 0.1239067055393586, "grad_norm": 1.1171875, "learning_rate": 0.0002950197057548664, "loss": 0.1352, "step": 510 }, { "epoch": 0.1251214771622935, "grad_norm": 1.0546875, "learning_rate": 0.00029500254217203296, "loss": 0.1329, "step": 515 }, { "epoch": 0.12633624878522837, "grad_norm": 0.98046875, "learning_rate": 0.0002949851993908791, "loss": 0.1254, "step": 520 }, { "epoch": 0.12755102040816327, "grad_norm": 1.0, "learning_rate": 0.00029496767743962955, "loss": 0.1302, "step": 525 }, { "epoch": 0.12876579203109814, "grad_norm": 1.0078125, "learning_rate": 0.00029494997634680074, "loss": 0.1328, "step": 530 }, { "epoch": 0.12998056365403304, "grad_norm": 1.3984375, "learning_rate": 0.0002949320961412005, "loss": 0.1416, "step": 535 }, { "epoch": 0.13119533527696792, "grad_norm": 1.1640625, "learning_rate": 0.00029491403685192837, "loss": 0.1254, "step": 540 }, { "epoch": 0.13241010689990282, "grad_norm": 1.1171875, "learning_rate": 0.0002948957985083752, "loss": 0.1286, "step": 545 }, { "epoch": 0.13362487852283772, "grad_norm": 1.1875, "learning_rate": 0.00029487738114022314, "loss": 0.1353, "step": 550 }, { "epoch": 0.1348396501457726, "grad_norm": 0.953125, "learning_rate": 0.000294858784777446, "loss": 0.1263, "step": 555 }, { "epoch": 0.1360544217687075, "grad_norm": 1.109375, "learning_rate": 0.0002948400094503087, "loss": 0.121, "step": 560 }, { "epoch": 0.13726919339164237, "grad_norm": 0.9375, "learning_rate": 0.00029482105518936736, "loss": 0.112, "step": 565 }, { "epoch": 0.13848396501457727, "grad_norm": 1.1328125, "learning_rate": 0.0002948019220254695, "loss": 0.1174, "step": 570 }, { "epoch": 0.13969873663751214, "grad_norm": 1.15625, "learning_rate": 0.00029478260998975364, "loss": 0.1225, "step": 575 }, { "epoch": 0.14091350826044705, "grad_norm": 0.96484375, "learning_rate": 0.00029476311911364947, "loss": 0.1152, "step": 580 }, { "epoch": 0.14212827988338192, "grad_norm": 1.234375, "learning_rate": 0.0002947434494288777, "loss": 0.125, "step": 585 }, { "epoch": 0.14334305150631682, "grad_norm": 1.0, "learning_rate": 0.00029472360096745016, "loss": 0.1102, "step": 590 }, { "epoch": 0.1445578231292517, "grad_norm": 0.9453125, "learning_rate": 0.00029470357376166947, "loss": 0.1159, "step": 595 }, { "epoch": 0.1457725947521866, "grad_norm": 1.015625, "learning_rate": 0.0002946833678441292, "loss": 0.1125, "step": 600 }, { "epoch": 0.14698736637512147, "grad_norm": 0.9296875, "learning_rate": 0.00029466298324771394, "loss": 0.0989, "step": 605 }, { "epoch": 0.14820213799805637, "grad_norm": 1.0703125, "learning_rate": 0.0002946424200055988, "loss": 0.1196, "step": 610 }, { "epoch": 0.14941690962099125, "grad_norm": 1.09375, "learning_rate": 0.00029462167815124974, "loss": 0.1095, "step": 615 }, { "epoch": 0.15063168124392615, "grad_norm": 0.8984375, "learning_rate": 0.0002946007577184235, "loss": 0.1134, "step": 620 }, { "epoch": 0.15184645286686102, "grad_norm": 1.203125, "learning_rate": 0.00029457965874116735, "loss": 0.121, "step": 625 }, { "epoch": 0.15306122448979592, "grad_norm": 1.0625, "learning_rate": 0.0002945583812538192, "loss": 0.1169, "step": 630 }, { "epoch": 0.1542759961127308, "grad_norm": 1.0390625, "learning_rate": 0.0002945369252910073, "loss": 0.1033, "step": 635 }, { "epoch": 0.1554907677356657, "grad_norm": 1.3984375, "learning_rate": 0.0002945152908876507, "loss": 0.1065, "step": 640 }, { "epoch": 0.15670553935860057, "grad_norm": 0.9140625, "learning_rate": 0.0002944934780789585, "loss": 0.0958, "step": 645 }, { "epoch": 0.15792031098153547, "grad_norm": 1.1875, "learning_rate": 0.00029447148690043033, "loss": 0.1126, "step": 650 }, { "epoch": 0.15913508260447035, "grad_norm": 1.3203125, "learning_rate": 0.0002944493173878562, "loss": 0.1003, "step": 655 }, { "epoch": 0.16034985422740525, "grad_norm": 0.98046875, "learning_rate": 0.0002944269695773161, "loss": 0.1002, "step": 660 }, { "epoch": 0.16156462585034015, "grad_norm": 1.015625, "learning_rate": 0.0002944044435051804, "loss": 0.1039, "step": 665 }, { "epoch": 0.16277939747327502, "grad_norm": 1.015625, "learning_rate": 0.00029438173920810946, "loss": 0.1068, "step": 670 }, { "epoch": 0.16399416909620992, "grad_norm": 0.99609375, "learning_rate": 0.00029435885672305387, "loss": 0.1064, "step": 675 }, { "epoch": 0.1652089407191448, "grad_norm": 0.9921875, "learning_rate": 0.00029433579608725396, "loss": 0.0894, "step": 680 }, { "epoch": 0.1664237123420797, "grad_norm": 1.0625, "learning_rate": 0.00029431255733824025, "loss": 0.0958, "step": 685 }, { "epoch": 0.16763848396501457, "grad_norm": 0.84375, "learning_rate": 0.0002942891405138329, "loss": 0.0839, "step": 690 }, { "epoch": 0.16885325558794947, "grad_norm": 1.109375, "learning_rate": 0.0002942655456521421, "loss": 0.0967, "step": 695 }, { "epoch": 0.17006802721088435, "grad_norm": 1.234375, "learning_rate": 0.00029424177279156765, "loss": 0.0935, "step": 700 }, { "epoch": 0.17128279883381925, "grad_norm": 0.88671875, "learning_rate": 0.00029421782197079903, "loss": 0.0914, "step": 705 }, { "epoch": 0.17249757045675412, "grad_norm": 1.1328125, "learning_rate": 0.0002941936932288155, "loss": 0.099, "step": 710 }, { "epoch": 0.17371234207968902, "grad_norm": 1.8984375, "learning_rate": 0.00029416938660488563, "loss": 0.0886, "step": 715 }, { "epoch": 0.1749271137026239, "grad_norm": 0.99609375, "learning_rate": 0.0002941449021385677, "loss": 0.0918, "step": 720 }, { "epoch": 0.1761418853255588, "grad_norm": 1.03125, "learning_rate": 0.00029412023986970936, "loss": 0.0925, "step": 725 }, { "epoch": 0.17735665694849367, "grad_norm": 0.9453125, "learning_rate": 0.00029409539983844753, "loss": 0.0897, "step": 730 }, { "epoch": 0.17857142857142858, "grad_norm": 0.98046875, "learning_rate": 0.00029407038208520864, "loss": 0.0943, "step": 735 }, { "epoch": 0.17978620019436345, "grad_norm": 1.2421875, "learning_rate": 0.0002940451866507082, "loss": 0.0898, "step": 740 }, { "epoch": 0.18100097181729835, "grad_norm": 1.0546875, "learning_rate": 0.00029401981357595077, "loss": 0.0875, "step": 745 }, { "epoch": 0.18221574344023322, "grad_norm": 1.0234375, "learning_rate": 0.00029399426290223037, "loss": 0.0888, "step": 750 }, { "epoch": 0.18343051506316813, "grad_norm": 1.0703125, "learning_rate": 0.0002939685346711298, "loss": 0.086, "step": 755 }, { "epoch": 0.184645286686103, "grad_norm": 1.125, "learning_rate": 0.0002939426289245208, "loss": 0.0829, "step": 760 }, { "epoch": 0.1858600583090379, "grad_norm": 1.21875, "learning_rate": 0.00029391654570456424, "loss": 0.0945, "step": 765 }, { "epoch": 0.1870748299319728, "grad_norm": 0.97265625, "learning_rate": 0.0002938902850537095, "loss": 0.0976, "step": 770 }, { "epoch": 0.18828960155490768, "grad_norm": 0.98828125, "learning_rate": 0.00029386384701469504, "loss": 0.0869, "step": 775 }, { "epoch": 0.18950437317784258, "grad_norm": 0.890625, "learning_rate": 0.0002938372316305478, "loss": 0.0758, "step": 780 }, { "epoch": 0.19071914480077745, "grad_norm": 1.0078125, "learning_rate": 0.0002938104389445834, "loss": 0.0853, "step": 785 }, { "epoch": 0.19193391642371235, "grad_norm": 0.94140625, "learning_rate": 0.0002937834690004061, "loss": 0.0896, "step": 790 }, { "epoch": 0.19314868804664723, "grad_norm": 1.1953125, "learning_rate": 0.0002937563218419085, "loss": 0.0852, "step": 795 }, { "epoch": 0.19436345966958213, "grad_norm": 1.046875, "learning_rate": 0.00029372899751327173, "loss": 0.0794, "step": 800 }, { "epoch": 0.195578231292517, "grad_norm": 0.86328125, "learning_rate": 0.00029370149605896517, "loss": 0.0718, "step": 805 }, { "epoch": 0.1967930029154519, "grad_norm": 1.03125, "learning_rate": 0.00029367381752374655, "loss": 0.083, "step": 810 }, { "epoch": 0.19800777453838678, "grad_norm": 0.9375, "learning_rate": 0.00029364596195266166, "loss": 0.079, "step": 815 }, { "epoch": 0.19922254616132168, "grad_norm": 1.0234375, "learning_rate": 0.0002936179293910445, "loss": 0.0723, "step": 820 }, { "epoch": 0.20043731778425655, "grad_norm": 0.97265625, "learning_rate": 0.00029358971988451726, "loss": 0.0724, "step": 825 }, { "epoch": 0.20165208940719145, "grad_norm": 1.1875, "learning_rate": 0.00029356133347898983, "loss": 0.079, "step": 830 }, { "epoch": 0.20286686103012633, "grad_norm": 1.078125, "learning_rate": 0.00029353277022066014, "loss": 0.0748, "step": 835 }, { "epoch": 0.20408163265306123, "grad_norm": 0.98046875, "learning_rate": 0.0002935040301560139, "loss": 0.0798, "step": 840 }, { "epoch": 0.2052964042759961, "grad_norm": 0.984375, "learning_rate": 0.00029347511333182463, "loss": 0.0737, "step": 845 }, { "epoch": 0.206511175898931, "grad_norm": 0.953125, "learning_rate": 0.00029344601979515347, "loss": 0.0766, "step": 850 }, { "epoch": 0.20772594752186588, "grad_norm": 0.89453125, "learning_rate": 0.00029341674959334915, "loss": 0.0697, "step": 855 }, { "epoch": 0.20894071914480078, "grad_norm": 0.83203125, "learning_rate": 0.0002933873027740479, "loss": 0.073, "step": 860 }, { "epoch": 0.21015549076773565, "grad_norm": 1.0546875, "learning_rate": 0.00029335767938517356, "loss": 0.0694, "step": 865 }, { "epoch": 0.21137026239067055, "grad_norm": 1.1484375, "learning_rate": 0.000293327879474937, "loss": 0.0736, "step": 870 }, { "epoch": 0.21258503401360543, "grad_norm": 0.98828125, "learning_rate": 0.0002932979030918367, "loss": 0.0774, "step": 875 }, { "epoch": 0.21379980563654033, "grad_norm": 0.921875, "learning_rate": 0.0002932677502846581, "loss": 0.0586, "step": 880 }, { "epoch": 0.21501457725947523, "grad_norm": 0.97265625, "learning_rate": 0.000293237421102474, "loss": 0.0706, "step": 885 }, { "epoch": 0.2162293488824101, "grad_norm": 1.09375, "learning_rate": 0.00029320691559464395, "loss": 0.0729, "step": 890 }, { "epoch": 0.217444120505345, "grad_norm": 0.94140625, "learning_rate": 0.00029317623381081476, "loss": 0.0626, "step": 895 }, { "epoch": 0.21865889212827988, "grad_norm": 0.9296875, "learning_rate": 0.0002931453758009199, "loss": 0.0691, "step": 900 }, { "epoch": 0.21987366375121478, "grad_norm": 0.953125, "learning_rate": 0.00029311434161517986, "loss": 0.0737, "step": 905 }, { "epoch": 0.22108843537414966, "grad_norm": 0.875, "learning_rate": 0.0002930831313041016, "loss": 0.0594, "step": 910 }, { "epoch": 0.22230320699708456, "grad_norm": 1.0546875, "learning_rate": 0.0002930517449184789, "loss": 0.0633, "step": 915 }, { "epoch": 0.22351797862001943, "grad_norm": 0.9765625, "learning_rate": 0.00029302018250939205, "loss": 0.0693, "step": 920 }, { "epoch": 0.22473275024295433, "grad_norm": 0.8828125, "learning_rate": 0.0002929884441282077, "loss": 0.0637, "step": 925 }, { "epoch": 0.2259475218658892, "grad_norm": 0.99609375, "learning_rate": 0.0002929565298265791, "loss": 0.062, "step": 930 }, { "epoch": 0.2271622934888241, "grad_norm": 0.92578125, "learning_rate": 0.00029292443965644565, "loss": 0.0686, "step": 935 }, { "epoch": 0.22837706511175898, "grad_norm": 0.8984375, "learning_rate": 0.000292892173670033, "loss": 0.064, "step": 940 }, { "epoch": 0.22959183673469388, "grad_norm": 0.98046875, "learning_rate": 0.000292859731919853, "loss": 0.0624, "step": 945 }, { "epoch": 0.23080660835762876, "grad_norm": 0.83203125, "learning_rate": 0.00029282711445870343, "loss": 0.0718, "step": 950 }, { "epoch": 0.23202137998056366, "grad_norm": 1.0625, "learning_rate": 0.0002927943213396681, "loss": 0.0692, "step": 955 }, { "epoch": 0.23323615160349853, "grad_norm": 0.8828125, "learning_rate": 0.0002927613526161168, "loss": 0.0661, "step": 960 }, { "epoch": 0.23445092322643343, "grad_norm": 0.91796875, "learning_rate": 0.0002927282083417049, "loss": 0.0504, "step": 965 }, { "epoch": 0.2356656948493683, "grad_norm": 0.8671875, "learning_rate": 0.0002926948885703736, "loss": 0.0645, "step": 970 }, { "epoch": 0.2368804664723032, "grad_norm": 0.921875, "learning_rate": 0.00029266139335634977, "loss": 0.0632, "step": 975 }, { "epoch": 0.23809523809523808, "grad_norm": 0.9921875, "learning_rate": 0.0002926277227541456, "loss": 0.0665, "step": 980 }, { "epoch": 0.23931000971817298, "grad_norm": 0.8828125, "learning_rate": 0.00029259387681855896, "loss": 0.0593, "step": 985 }, { "epoch": 0.24052478134110788, "grad_norm": 0.984375, "learning_rate": 0.0002925598556046729, "loss": 0.0673, "step": 990 }, { "epoch": 0.24173955296404276, "grad_norm": 0.9375, "learning_rate": 0.00029252565916785585, "loss": 0.062, "step": 995 }, { "epoch": 0.24295432458697766, "grad_norm": 0.8828125, "learning_rate": 0.00029249128756376135, "loss": 0.0641, "step": 1000 }, { "epoch": 0.24295432458697766, "eval_loss": 0.05327101796865463, "eval_runtime": 2.4201, "eval_samples_per_second": 82.641, "eval_steps_per_second": 82.641, "step": 1000 }, { "epoch": 0.24416909620991253, "grad_norm": 1.2734375, "learning_rate": 0.0002924567408483279, "loss": 0.0633, "step": 1005 }, { "epoch": 0.24538386783284744, "grad_norm": 0.89453125, "learning_rate": 0.0002924220190777792, "loss": 0.0604, "step": 1010 }, { "epoch": 0.2465986394557823, "grad_norm": 1.03125, "learning_rate": 0.00029238712230862386, "loss": 0.0571, "step": 1015 }, { "epoch": 0.2478134110787172, "grad_norm": 0.90234375, "learning_rate": 0.000292352050597655, "loss": 0.0551, "step": 1020 }, { "epoch": 0.24902818270165208, "grad_norm": 0.9375, "learning_rate": 0.00029231680400195067, "loss": 0.0587, "step": 1025 }, { "epoch": 0.250242954324587, "grad_norm": 0.7578125, "learning_rate": 0.0002922813825788736, "loss": 0.0534, "step": 1030 }, { "epoch": 0.25145772594752186, "grad_norm": 0.94921875, "learning_rate": 0.0002922457863860709, "loss": 0.0528, "step": 1035 }, { "epoch": 0.25267249757045673, "grad_norm": 0.71875, "learning_rate": 0.00029221001548147417, "loss": 0.0476, "step": 1040 }, { "epoch": 0.25388726919339166, "grad_norm": 0.7421875, "learning_rate": 0.0002921740699232993, "loss": 0.0463, "step": 1045 }, { "epoch": 0.25510204081632654, "grad_norm": 0.796875, "learning_rate": 0.0002921379497700466, "loss": 0.0499, "step": 1050 }, { "epoch": 0.2563168124392614, "grad_norm": 1.0546875, "learning_rate": 0.0002921016550805002, "loss": 0.0552, "step": 1055 }, { "epoch": 0.2575315840621963, "grad_norm": 0.91015625, "learning_rate": 0.00029206518591372863, "loss": 0.0452, "step": 1060 }, { "epoch": 0.2587463556851312, "grad_norm": 0.87890625, "learning_rate": 0.0002920285423290841, "loss": 0.0529, "step": 1065 }, { "epoch": 0.2599611273080661, "grad_norm": 0.9140625, "learning_rate": 0.00029199172438620295, "loss": 0.0509, "step": 1070 }, { "epoch": 0.26117589893100096, "grad_norm": 0.859375, "learning_rate": 0.000291954732145005, "loss": 0.0534, "step": 1075 }, { "epoch": 0.26239067055393583, "grad_norm": 0.9921875, "learning_rate": 0.0002919175656656939, "loss": 0.045, "step": 1080 }, { "epoch": 0.26360544217687076, "grad_norm": 0.9453125, "learning_rate": 0.00029188022500875686, "loss": 0.0567, "step": 1085 }, { "epoch": 0.26482021379980564, "grad_norm": 0.796875, "learning_rate": 0.00029184271023496454, "loss": 0.053, "step": 1090 }, { "epoch": 0.2660349854227405, "grad_norm": 1.03125, "learning_rate": 0.00029180502140537087, "loss": 0.0564, "step": 1095 }, { "epoch": 0.26724975704567544, "grad_norm": 0.9609375, "learning_rate": 0.00029176715858131324, "loss": 0.0545, "step": 1100 }, { "epoch": 0.2684645286686103, "grad_norm": 1.1328125, "learning_rate": 0.0002917291218244121, "loss": 0.0427, "step": 1105 }, { "epoch": 0.2696793002915452, "grad_norm": 0.88671875, "learning_rate": 0.000291690911196571, "loss": 0.0471, "step": 1110 }, { "epoch": 0.27089407191448006, "grad_norm": 0.9453125, "learning_rate": 0.00029165252675997634, "loss": 0.0505, "step": 1115 }, { "epoch": 0.272108843537415, "grad_norm": 0.88671875, "learning_rate": 0.0002916139685770975, "loss": 0.0503, "step": 1120 }, { "epoch": 0.27332361516034986, "grad_norm": 0.83203125, "learning_rate": 0.0002915752367106867, "loss": 0.0404, "step": 1125 }, { "epoch": 0.27453838678328474, "grad_norm": 0.9375, "learning_rate": 0.0002915363312237787, "loss": 0.047, "step": 1130 }, { "epoch": 0.2757531584062196, "grad_norm": 0.8359375, "learning_rate": 0.00029149725217969086, "loss": 0.0436, "step": 1135 }, { "epoch": 0.27696793002915454, "grad_norm": 0.796875, "learning_rate": 0.00029145799964202303, "loss": 0.0486, "step": 1140 }, { "epoch": 0.2781827016520894, "grad_norm": 0.75390625, "learning_rate": 0.0002914185736746573, "loss": 0.0471, "step": 1145 }, { "epoch": 0.2793974732750243, "grad_norm": 0.71875, "learning_rate": 0.0002913789743417581, "loss": 0.0449, "step": 1150 }, { "epoch": 0.28061224489795916, "grad_norm": 0.88671875, "learning_rate": 0.0002913392017077721, "loss": 0.0425, "step": 1155 }, { "epoch": 0.2818270165208941, "grad_norm": 0.7109375, "learning_rate": 0.00029129925583742787, "loss": 0.045, "step": 1160 }, { "epoch": 0.28304178814382897, "grad_norm": 0.78125, "learning_rate": 0.00029125913679573586, "loss": 0.0427, "step": 1165 }, { "epoch": 0.28425655976676384, "grad_norm": 0.75, "learning_rate": 0.0002912188446479886, "loss": 0.0459, "step": 1170 }, { "epoch": 0.2854713313896987, "grad_norm": 0.62890625, "learning_rate": 0.00029117837945976, "loss": 0.0408, "step": 1175 }, { "epoch": 0.28668610301263364, "grad_norm": 0.87890625, "learning_rate": 0.000291137741296906, "loss": 0.0501, "step": 1180 }, { "epoch": 0.2879008746355685, "grad_norm": 0.9296875, "learning_rate": 0.0002910969302255637, "loss": 0.0502, "step": 1185 }, { "epoch": 0.2891156462585034, "grad_norm": 0.78515625, "learning_rate": 0.0002910559463121517, "loss": 0.0431, "step": 1190 }, { "epoch": 0.29033041788143826, "grad_norm": 0.6796875, "learning_rate": 0.0002910147896233701, "loss": 0.0465, "step": 1195 }, { "epoch": 0.2915451895043732, "grad_norm": 0.8203125, "learning_rate": 0.0002909734602261998, "loss": 0.0445, "step": 1200 }, { "epoch": 0.29275996112730807, "grad_norm": 0.97265625, "learning_rate": 0.0002909319581879032, "loss": 0.0385, "step": 1205 }, { "epoch": 0.29397473275024294, "grad_norm": 0.6640625, "learning_rate": 0.0002908902835760232, "loss": 0.0299, "step": 1210 }, { "epoch": 0.29518950437317787, "grad_norm": 0.8515625, "learning_rate": 0.00029084843645838405, "loss": 0.0442, "step": 1215 }, { "epoch": 0.29640427599611274, "grad_norm": 0.8203125, "learning_rate": 0.00029080641690309045, "loss": 0.0457, "step": 1220 }, { "epoch": 0.2976190476190476, "grad_norm": 0.87109375, "learning_rate": 0.0002907642249785277, "loss": 0.0496, "step": 1225 }, { "epoch": 0.2988338192419825, "grad_norm": 0.76171875, "learning_rate": 0.0002907218607533619, "loss": 0.0401, "step": 1230 }, { "epoch": 0.3000485908649174, "grad_norm": 0.66015625, "learning_rate": 0.00029067932429653923, "loss": 0.0423, "step": 1235 }, { "epoch": 0.3012633624878523, "grad_norm": 0.67578125, "learning_rate": 0.0002906366156772864, "loss": 0.0423, "step": 1240 }, { "epoch": 0.30247813411078717, "grad_norm": 0.8359375, "learning_rate": 0.0002905937349651102, "loss": 0.0416, "step": 1245 }, { "epoch": 0.30369290573372204, "grad_norm": 0.65234375, "learning_rate": 0.00029055068222979755, "loss": 0.0393, "step": 1250 }, { "epoch": 0.30490767735665697, "grad_norm": 0.90625, "learning_rate": 0.00029050745754141536, "loss": 0.0428, "step": 1255 }, { "epoch": 0.30612244897959184, "grad_norm": 0.7421875, "learning_rate": 0.0002904640609703103, "loss": 0.0445, "step": 1260 }, { "epoch": 0.3073372206025267, "grad_norm": 0.98046875, "learning_rate": 0.0002904204925871088, "loss": 0.0456, "step": 1265 }, { "epoch": 0.3085519922254616, "grad_norm": 0.77734375, "learning_rate": 0.000290376752462717, "loss": 0.0419, "step": 1270 }, { "epoch": 0.3097667638483965, "grad_norm": 0.85546875, "learning_rate": 0.0002903328406683204, "loss": 0.0449, "step": 1275 }, { "epoch": 0.3109815354713314, "grad_norm": 0.71875, "learning_rate": 0.00029028875727538393, "loss": 0.0408, "step": 1280 }, { "epoch": 0.31219630709426627, "grad_norm": 0.6015625, "learning_rate": 0.00029024450235565186, "loss": 0.0386, "step": 1285 }, { "epoch": 0.31341107871720114, "grad_norm": 0.7734375, "learning_rate": 0.0002902000759811476, "loss": 0.0335, "step": 1290 }, { "epoch": 0.31462585034013607, "grad_norm": 0.74609375, "learning_rate": 0.00029015547822417353, "loss": 0.0414, "step": 1295 }, { "epoch": 0.31584062196307094, "grad_norm": 0.7890625, "learning_rate": 0.00029011070915731094, "loss": 0.0399, "step": 1300 }, { "epoch": 0.3170553935860058, "grad_norm": 0.8828125, "learning_rate": 0.00029006576885342005, "loss": 0.0373, "step": 1305 }, { "epoch": 0.3182701652089407, "grad_norm": 0.7890625, "learning_rate": 0.00029002065738563957, "loss": 0.0357, "step": 1310 }, { "epoch": 0.3194849368318756, "grad_norm": 0.92578125, "learning_rate": 0.000289975374827387, "loss": 0.037, "step": 1315 }, { "epoch": 0.3206997084548105, "grad_norm": 0.80078125, "learning_rate": 0.00028992992125235817, "loss": 0.0347, "step": 1320 }, { "epoch": 0.32191448007774537, "grad_norm": 0.82421875, "learning_rate": 0.0002898842967345271, "loss": 0.037, "step": 1325 }, { "epoch": 0.3231292517006803, "grad_norm": 0.65625, "learning_rate": 0.0002898385013481462, "loss": 0.0344, "step": 1330 }, { "epoch": 0.32434402332361517, "grad_norm": 0.97265625, "learning_rate": 0.00028979253516774604, "loss": 0.0356, "step": 1335 }, { "epoch": 0.32555879494655005, "grad_norm": 0.75, "learning_rate": 0.0002897463982681348, "loss": 0.0288, "step": 1340 }, { "epoch": 0.3267735665694849, "grad_norm": 0.6796875, "learning_rate": 0.00028970009072439885, "loss": 0.0359, "step": 1345 }, { "epoch": 0.32798833819241985, "grad_norm": 0.828125, "learning_rate": 0.00028965361261190214, "loss": 0.0403, "step": 1350 }, { "epoch": 0.3292031098153547, "grad_norm": 0.7265625, "learning_rate": 0.0002896069640062862, "loss": 0.03, "step": 1355 }, { "epoch": 0.3304178814382896, "grad_norm": 0.7734375, "learning_rate": 0.00028956014498346996, "loss": 0.0383, "step": 1360 }, { "epoch": 0.33163265306122447, "grad_norm": 0.703125, "learning_rate": 0.00028951315561964996, "loss": 0.0373, "step": 1365 }, { "epoch": 0.3328474246841594, "grad_norm": 0.8984375, "learning_rate": 0.0002894659959912997, "loss": 0.0419, "step": 1370 }, { "epoch": 0.3333333333333333, "eval_loss": 0.03247929736971855, "eval_runtime": 2.4187, "eval_samples_per_second": 82.689, "eval_steps_per_second": 82.689, "step": 1372 }, { "epoch": 0.3340621963070943, "grad_norm": 0.7421875, "learning_rate": 0.00028941866617516993, "loss": 0.0322, "step": 1375 }, { "epoch": 0.33527696793002915, "grad_norm": 0.765625, "learning_rate": 0.0002893711662482882, "loss": 0.0366, "step": 1380 }, { "epoch": 0.336491739552964, "grad_norm": 0.6875, "learning_rate": 0.0002893234962879591, "loss": 0.0274, "step": 1385 }, { "epoch": 0.33770651117589895, "grad_norm": 0.63671875, "learning_rate": 0.00028927565637176393, "loss": 0.0335, "step": 1390 }, { "epoch": 0.3389212827988338, "grad_norm": 0.859375, "learning_rate": 0.00028922764657756045, "loss": 0.0383, "step": 1395 }, { "epoch": 0.3401360544217687, "grad_norm": 0.71875, "learning_rate": 0.00028917946698348295, "loss": 0.0365, "step": 1400 }, { "epoch": 0.34135082604470357, "grad_norm": 0.66796875, "learning_rate": 0.0002891311176679422, "loss": 0.0331, "step": 1405 }, { "epoch": 0.3425655976676385, "grad_norm": 1.0859375, "learning_rate": 0.000289082598709625, "loss": 0.0403, "step": 1410 }, { "epoch": 0.3437803692905734, "grad_norm": 0.66796875, "learning_rate": 0.0002890339101874943, "loss": 0.0318, "step": 1415 }, { "epoch": 0.34499514091350825, "grad_norm": 0.7890625, "learning_rate": 0.00028898505218078894, "loss": 0.0335, "step": 1420 }, { "epoch": 0.3462099125364432, "grad_norm": 0.734375, "learning_rate": 0.0002889360247690238, "loss": 0.0329, "step": 1425 }, { "epoch": 0.34742468415937805, "grad_norm": 0.7421875, "learning_rate": 0.00028888682803198925, "loss": 0.033, "step": 1430 }, { "epoch": 0.3486394557823129, "grad_norm": 0.7734375, "learning_rate": 0.0002888374620497514, "loss": 0.0299, "step": 1435 }, { "epoch": 0.3498542274052478, "grad_norm": 0.5546875, "learning_rate": 0.00028878792690265157, "loss": 0.0296, "step": 1440 }, { "epoch": 0.3510689990281827, "grad_norm": 0.74609375, "learning_rate": 0.00028873822267130666, "loss": 0.035, "step": 1445 }, { "epoch": 0.3522837706511176, "grad_norm": 0.83984375, "learning_rate": 0.00028868834943660855, "loss": 0.0295, "step": 1450 }, { "epoch": 0.3534985422740525, "grad_norm": 0.9765625, "learning_rate": 0.0002886383072797242, "loss": 0.0346, "step": 1455 }, { "epoch": 0.35471331389698735, "grad_norm": 0.69921875, "learning_rate": 0.00028858809628209563, "loss": 0.0364, "step": 1460 }, { "epoch": 0.3559280855199223, "grad_norm": 0.71484375, "learning_rate": 0.00028853771652543946, "loss": 0.0333, "step": 1465 }, { "epoch": 0.35714285714285715, "grad_norm": 0.671875, "learning_rate": 0.00028848716809174704, "loss": 0.0299, "step": 1470 }, { "epoch": 0.358357628765792, "grad_norm": 0.68359375, "learning_rate": 0.0002884364510632842, "loss": 0.025, "step": 1475 }, { "epoch": 0.3595724003887269, "grad_norm": 0.75390625, "learning_rate": 0.00028838556552259126, "loss": 0.0328, "step": 1480 }, { "epoch": 0.3607871720116618, "grad_norm": 0.65625, "learning_rate": 0.0002883345115524826, "loss": 0.0354, "step": 1485 }, { "epoch": 0.3620019436345967, "grad_norm": 0.8359375, "learning_rate": 0.000288283289236047, "loss": 0.0309, "step": 1490 }, { "epoch": 0.3632167152575316, "grad_norm": 0.6796875, "learning_rate": 0.0002882318986566469, "loss": 0.0319, "step": 1495 }, { "epoch": 0.36443148688046645, "grad_norm": 0.6953125, "learning_rate": 0.00028818033989791875, "loss": 0.0291, "step": 1500 }, { "epoch": 0.36443148688046645, "eval_loss": 0.0316455252468586, "eval_runtime": 2.4199, "eval_samples_per_second": 82.648, "eval_steps_per_second": 82.648, "step": 1500 }, { "epoch": 0.3656462585034014, "grad_norm": 0.59375, "learning_rate": 0.0002881286130437726, "loss": 0.021, "step": 1505 }, { "epoch": 0.36686103012633625, "grad_norm": 0.69921875, "learning_rate": 0.00028807671817839236, "loss": 0.0333, "step": 1510 }, { "epoch": 0.3680758017492711, "grad_norm": 0.63671875, "learning_rate": 0.0002880246553862349, "loss": 0.0282, "step": 1515 }, { "epoch": 0.369290573372206, "grad_norm": 0.6484375, "learning_rate": 0.0002879724247520309, "loss": 0.0339, "step": 1520 }, { "epoch": 0.37050534499514093, "grad_norm": 0.8046875, "learning_rate": 0.0002879200263607837, "loss": 0.0292, "step": 1525 }, { "epoch": 0.3717201166180758, "grad_norm": 0.5, "learning_rate": 0.00028786746029777014, "loss": 0.0277, "step": 1530 }, { "epoch": 0.3729348882410107, "grad_norm": 0.80859375, "learning_rate": 0.0002878147266485396, "loss": 0.0303, "step": 1535 }, { "epoch": 0.3741496598639456, "grad_norm": 0.53515625, "learning_rate": 0.00028776182549891416, "loss": 0.0294, "step": 1540 }, { "epoch": 0.3753644314868805, "grad_norm": 0.78515625, "learning_rate": 0.0002877087569349889, "loss": 0.0309, "step": 1545 }, { "epoch": 0.37657920310981535, "grad_norm": 0.87109375, "learning_rate": 0.00028765552104313095, "loss": 0.0336, "step": 1550 }, { "epoch": 0.3777939747327502, "grad_norm": 0.625, "learning_rate": 0.00028760211790997993, "loss": 0.029, "step": 1555 }, { "epoch": 0.37900874635568516, "grad_norm": 0.921875, "learning_rate": 0.00028754854762244765, "loss": 0.0274, "step": 1560 }, { "epoch": 0.38022351797862003, "grad_norm": 0.71484375, "learning_rate": 0.0002874948102677179, "loss": 0.0264, "step": 1565 }, { "epoch": 0.3814382896015549, "grad_norm": 0.57421875, "learning_rate": 0.00028744090593324647, "loss": 0.0225, "step": 1570 }, { "epoch": 0.3826530612244898, "grad_norm": 0.81640625, "learning_rate": 0.0002873868347067608, "loss": 0.0271, "step": 1575 }, { "epoch": 0.3838678328474247, "grad_norm": 0.90234375, "learning_rate": 0.00028733259667625995, "loss": 0.0314, "step": 1580 }, { "epoch": 0.3850826044703596, "grad_norm": 0.88671875, "learning_rate": 0.0002872781919300145, "loss": 0.0316, "step": 1585 }, { "epoch": 0.38629737609329445, "grad_norm": 0.578125, "learning_rate": 0.0002872236205565663, "loss": 0.0212, "step": 1590 }, { "epoch": 0.3875121477162293, "grad_norm": 0.68359375, "learning_rate": 0.00028716888264472844, "loss": 0.03, "step": 1595 }, { "epoch": 0.38872691933916426, "grad_norm": 0.9375, "learning_rate": 0.000287113978283585, "loss": 0.0252, "step": 1600 }, { "epoch": 0.38994169096209913, "grad_norm": 0.6640625, "learning_rate": 0.0002870589075624909, "loss": 0.0251, "step": 1605 }, { "epoch": 0.391156462585034, "grad_norm": 0.7421875, "learning_rate": 0.000287003670571072, "loss": 0.0313, "step": 1610 }, { "epoch": 0.3923712342079689, "grad_norm": 0.65625, "learning_rate": 0.00028694826739922454, "loss": 0.0243, "step": 1615 }, { "epoch": 0.3935860058309038, "grad_norm": 0.82421875, "learning_rate": 0.00028689269813711536, "loss": 0.0312, "step": 1620 }, { "epoch": 0.3948007774538387, "grad_norm": 0.7890625, "learning_rate": 0.00028683696287518145, "loss": 0.0295, "step": 1625 }, { "epoch": 0.39601554907677355, "grad_norm": 0.921875, "learning_rate": 0.00028678106170413015, "loss": 0.0269, "step": 1630 }, { "epoch": 0.39723032069970843, "grad_norm": 0.57421875, "learning_rate": 0.00028672499471493865, "loss": 0.0226, "step": 1635 }, { "epoch": 0.39844509232264336, "grad_norm": 0.63671875, "learning_rate": 0.0002866687619988541, "loss": 0.025, "step": 1640 }, { "epoch": 0.39965986394557823, "grad_norm": 0.7109375, "learning_rate": 0.00028661236364739334, "loss": 0.0307, "step": 1645 }, { "epoch": 0.4008746355685131, "grad_norm": 0.65625, "learning_rate": 0.00028655579975234277, "loss": 0.0252, "step": 1650 }, { "epoch": 0.40208940719144803, "grad_norm": 0.90234375, "learning_rate": 0.0002864990704057582, "loss": 0.03, "step": 1655 }, { "epoch": 0.4033041788143829, "grad_norm": 0.466796875, "learning_rate": 0.00028644217569996476, "loss": 0.0269, "step": 1660 }, { "epoch": 0.4045189504373178, "grad_norm": 0.65234375, "learning_rate": 0.0002863851157275566, "loss": 0.0242, "step": 1665 }, { "epoch": 0.40573372206025266, "grad_norm": 0.49609375, "learning_rate": 0.0002863278905813969, "loss": 0.0259, "step": 1670 }, { "epoch": 0.4069484936831876, "grad_norm": 0.83203125, "learning_rate": 0.0002862705003546177, "loss": 0.0299, "step": 1675 }, { "epoch": 0.40816326530612246, "grad_norm": 0.64453125, "learning_rate": 0.00028621294514061946, "loss": 0.0244, "step": 1680 }, { "epoch": 0.40937803692905733, "grad_norm": 0.7265625, "learning_rate": 0.00028615522503307156, "loss": 0.0307, "step": 1685 }, { "epoch": 0.4105928085519922, "grad_norm": 0.640625, "learning_rate": 0.0002860973401259114, "loss": 0.0276, "step": 1690 }, { "epoch": 0.41180758017492713, "grad_norm": 0.7109375, "learning_rate": 0.0002860392905133447, "loss": 0.0225, "step": 1695 }, { "epoch": 0.413022351797862, "grad_norm": 0.72265625, "learning_rate": 0.00028598107628984536, "loss": 0.0299, "step": 1700 }, { "epoch": 0.4142371234207969, "grad_norm": 0.66796875, "learning_rate": 0.00028592269755015477, "loss": 0.0252, "step": 1705 }, { "epoch": 0.41545189504373176, "grad_norm": 0.73046875, "learning_rate": 0.0002858641543892827, "loss": 0.0294, "step": 1710 }, { "epoch": 0.4166666666666667, "grad_norm": 0.474609375, "learning_rate": 0.00028580544690250587, "loss": 0.0236, "step": 1715 }, { "epoch": 0.41788143828960156, "grad_norm": 0.7265625, "learning_rate": 0.00028574657518536887, "loss": 0.0313, "step": 1720 }, { "epoch": 0.41909620991253643, "grad_norm": 0.80078125, "learning_rate": 0.00028568753933368336, "loss": 0.0307, "step": 1725 }, { "epoch": 0.4203109815354713, "grad_norm": 0.5859375, "learning_rate": 0.00028562833944352825, "loss": 0.0189, "step": 1730 }, { "epoch": 0.42152575315840624, "grad_norm": 0.91015625, "learning_rate": 0.00028556897561124927, "loss": 0.0266, "step": 1735 }, { "epoch": 0.4227405247813411, "grad_norm": 0.58203125, "learning_rate": 0.00028550944793345913, "loss": 0.0252, "step": 1740 }, { "epoch": 0.423955296404276, "grad_norm": 0.5625, "learning_rate": 0.000285449756507037, "loss": 0.0242, "step": 1745 }, { "epoch": 0.42517006802721086, "grad_norm": 0.59765625, "learning_rate": 0.0002853899014291287, "loss": 0.0195, "step": 1750 }, { "epoch": 0.4263848396501458, "grad_norm": 0.6796875, "learning_rate": 0.0002853298827971464, "loss": 0.0226, "step": 1755 }, { "epoch": 0.42759961127308066, "grad_norm": 0.6484375, "learning_rate": 0.0002852697007087683, "loss": 0.0215, "step": 1760 }, { "epoch": 0.42881438289601553, "grad_norm": 0.4140625, "learning_rate": 0.00028520935526193865, "loss": 0.0201, "step": 1765 }, { "epoch": 0.43002915451895046, "grad_norm": 0.51171875, "learning_rate": 0.0002851488465548678, "loss": 0.0234, "step": 1770 }, { "epoch": 0.43124392614188534, "grad_norm": 0.5859375, "learning_rate": 0.0002850881746860315, "loss": 0.0176, "step": 1775 }, { "epoch": 0.4324586977648202, "grad_norm": 0.51171875, "learning_rate": 0.0002850273397541711, "loss": 0.025, "step": 1780 }, { "epoch": 0.4336734693877551, "grad_norm": 0.87890625, "learning_rate": 0.00028496634185829357, "loss": 0.0306, "step": 1785 }, { "epoch": 0.43488824101069, "grad_norm": 0.77734375, "learning_rate": 0.0002849051810976707, "loss": 0.0239, "step": 1790 }, { "epoch": 0.4361030126336249, "grad_norm": 0.66796875, "learning_rate": 0.0002848438575718397, "loss": 0.0209, "step": 1795 }, { "epoch": 0.43731778425655976, "grad_norm": 0.6015625, "learning_rate": 0.00028478237138060246, "loss": 0.0218, "step": 1800 }, { "epoch": 0.43853255587949463, "grad_norm": 0.6015625, "learning_rate": 0.0002847207226240257, "loss": 0.0267, "step": 1805 }, { "epoch": 0.43974732750242956, "grad_norm": 0.75390625, "learning_rate": 0.0002846589114024407, "loss": 0.0206, "step": 1810 }, { "epoch": 0.44096209912536444, "grad_norm": 0.671875, "learning_rate": 0.000284596937816443, "loss": 0.0239, "step": 1815 }, { "epoch": 0.4421768707482993, "grad_norm": 0.68359375, "learning_rate": 0.00028453480196689266, "loss": 0.0287, "step": 1820 }, { "epoch": 0.4433916423712342, "grad_norm": 0.55859375, "learning_rate": 0.0002844725039549135, "loss": 0.0277, "step": 1825 }, { "epoch": 0.4446064139941691, "grad_norm": 0.84375, "learning_rate": 0.00028441004388189364, "loss": 0.0246, "step": 1830 }, { "epoch": 0.445821185617104, "grad_norm": 0.56640625, "learning_rate": 0.00028434742184948455, "loss": 0.0227, "step": 1835 }, { "epoch": 0.44703595724003886, "grad_norm": 0.69140625, "learning_rate": 0.00028428463795960153, "loss": 0.0263, "step": 1840 }, { "epoch": 0.44825072886297374, "grad_norm": 0.8046875, "learning_rate": 0.00028422169231442327, "loss": 0.0279, "step": 1845 }, { "epoch": 0.44946550048590866, "grad_norm": 0.60546875, "learning_rate": 0.0002841585850163915, "loss": 0.0265, "step": 1850 }, { "epoch": 0.45068027210884354, "grad_norm": 0.69140625, "learning_rate": 0.0002840953161682114, "loss": 0.0249, "step": 1855 }, { "epoch": 0.4518950437317784, "grad_norm": 0.75390625, "learning_rate": 0.00028403188587285084, "loss": 0.0273, "step": 1860 }, { "epoch": 0.45310981535471334, "grad_norm": 0.55078125, "learning_rate": 0.00028396829423354037, "loss": 0.0193, "step": 1865 }, { "epoch": 0.4543245869776482, "grad_norm": 0.69140625, "learning_rate": 0.0002839045413537732, "loss": 0.0254, "step": 1870 }, { "epoch": 0.4555393586005831, "grad_norm": 0.91796875, "learning_rate": 0.00028384062733730514, "loss": 0.0209, "step": 1875 }, { "epoch": 0.45675413022351796, "grad_norm": 0.55859375, "learning_rate": 0.00028377655228815403, "loss": 0.0226, "step": 1880 }, { "epoch": 0.4579689018464529, "grad_norm": 0.55859375, "learning_rate": 0.00028371231631059977, "loss": 0.0244, "step": 1885 }, { "epoch": 0.45918367346938777, "grad_norm": 0.578125, "learning_rate": 0.0002836479195091843, "loss": 0.0235, "step": 1890 }, { "epoch": 0.46039844509232264, "grad_norm": 0.52734375, "learning_rate": 0.00028358336198871115, "loss": 0.0209, "step": 1895 }, { "epoch": 0.4616132167152575, "grad_norm": 0.6171875, "learning_rate": 0.00028351864385424555, "loss": 0.025, "step": 1900 }, { "epoch": 0.46282798833819244, "grad_norm": 0.953125, "learning_rate": 0.000283453765211114, "loss": 0.024, "step": 1905 }, { "epoch": 0.4640427599611273, "grad_norm": 0.859375, "learning_rate": 0.00028338872616490444, "loss": 0.0234, "step": 1910 }, { "epoch": 0.4652575315840622, "grad_norm": 0.73046875, "learning_rate": 0.00028332352682146556, "loss": 0.0248, "step": 1915 }, { "epoch": 0.46647230320699706, "grad_norm": 0.96484375, "learning_rate": 0.00028325816728690714, "loss": 0.0265, "step": 1920 }, { "epoch": 0.467687074829932, "grad_norm": 0.58984375, "learning_rate": 0.0002831926476675996, "loss": 0.0222, "step": 1925 }, { "epoch": 0.46890184645286687, "grad_norm": 0.82421875, "learning_rate": 0.00028312696807017385, "loss": 0.0257, "step": 1930 }, { "epoch": 0.47011661807580174, "grad_norm": 0.6640625, "learning_rate": 0.0002830611286015213, "loss": 0.0257, "step": 1935 }, { "epoch": 0.4713313896987366, "grad_norm": 0.5, "learning_rate": 0.00028299512936879337, "loss": 0.0208, "step": 1940 }, { "epoch": 0.47254616132167154, "grad_norm": 0.56640625, "learning_rate": 0.0002829289704794016, "loss": 0.0234, "step": 1945 }, { "epoch": 0.4737609329446064, "grad_norm": 0.6796875, "learning_rate": 0.0002828626520410173, "loss": 0.0221, "step": 1950 }, { "epoch": 0.4749757045675413, "grad_norm": 0.71484375, "learning_rate": 0.0002827961741615716, "loss": 0.0278, "step": 1955 }, { "epoch": 0.47619047619047616, "grad_norm": 0.79296875, "learning_rate": 0.00028272953694925476, "loss": 0.0216, "step": 1960 }, { "epoch": 0.4774052478134111, "grad_norm": 0.765625, "learning_rate": 0.0002826627405125168, "loss": 0.0264, "step": 1965 }, { "epoch": 0.47862001943634597, "grad_norm": 0.5859375, "learning_rate": 0.0002825957849600665, "loss": 0.02, "step": 1970 }, { "epoch": 0.47983479105928084, "grad_norm": 0.78515625, "learning_rate": 0.0002825286704008719, "loss": 0.0234, "step": 1975 }, { "epoch": 0.48104956268221577, "grad_norm": 0.5546875, "learning_rate": 0.0002824613969441596, "loss": 0.0221, "step": 1980 }, { "epoch": 0.48226433430515064, "grad_norm": 0.75, "learning_rate": 0.0002823939646994148, "loss": 0.0195, "step": 1985 }, { "epoch": 0.4834791059280855, "grad_norm": 0.53515625, "learning_rate": 0.00028232637377638116, "loss": 0.0209, "step": 1990 }, { "epoch": 0.4846938775510204, "grad_norm": 0.671875, "learning_rate": 0.0002822586242850608, "loss": 0.0238, "step": 1995 }, { "epoch": 0.4859086491739553, "grad_norm": 0.75390625, "learning_rate": 0.0002821907163357136, "loss": 0.0269, "step": 2000 }, { "epoch": 0.4859086491739553, "eval_loss": 0.022741403430700302, "eval_runtime": 2.4208, "eval_samples_per_second": 82.618, "eval_steps_per_second": 82.618, "step": 2000 }, { "epoch": 0.4871234207968902, "grad_norm": 0.671875, "learning_rate": 0.0002821226500388574, "loss": 0.0271, "step": 2005 }, { "epoch": 0.48833819241982507, "grad_norm": 0.62890625, "learning_rate": 0.0002820544255052679, "loss": 0.0212, "step": 2010 }, { "epoch": 0.48955296404275994, "grad_norm": 0.8359375, "learning_rate": 0.00028198604284597814, "loss": 0.0236, "step": 2015 }, { "epoch": 0.49076773566569487, "grad_norm": 0.67578125, "learning_rate": 0.00028191750217227855, "loss": 0.0208, "step": 2020 }, { "epoch": 0.49198250728862974, "grad_norm": 0.7890625, "learning_rate": 0.00028184880359571684, "loss": 0.0298, "step": 2025 }, { "epoch": 0.4931972789115646, "grad_norm": 0.71875, "learning_rate": 0.00028177994722809746, "loss": 0.0217, "step": 2030 }, { "epoch": 0.4944120505344995, "grad_norm": 0.640625, "learning_rate": 0.00028171093318148197, "loss": 0.0219, "step": 2035 }, { "epoch": 0.4956268221574344, "grad_norm": 0.734375, "learning_rate": 0.00028164176156818835, "loss": 0.0247, "step": 2040 }, { "epoch": 0.4968415937803693, "grad_norm": 0.79296875, "learning_rate": 0.00028157243250079094, "loss": 0.0282, "step": 2045 }, { "epoch": 0.49805636540330417, "grad_norm": 0.640625, "learning_rate": 0.0002815029460921206, "loss": 0.0199, "step": 2050 }, { "epoch": 0.49927113702623904, "grad_norm": 0.55859375, "learning_rate": 0.000281433302455264, "loss": 0.0215, "step": 2055 }, { "epoch": 0.500485908649174, "grad_norm": 0.6875, "learning_rate": 0.0002813635017035638, "loss": 0.0192, "step": 2060 }, { "epoch": 0.5017006802721088, "grad_norm": 0.578125, "learning_rate": 0.00028129354395061844, "loss": 0.0251, "step": 2065 }, { "epoch": 0.5029154518950437, "grad_norm": 0.453125, "learning_rate": 0.0002812234293102817, "loss": 0.0207, "step": 2070 }, { "epoch": 0.5041302235179786, "grad_norm": 0.55078125, "learning_rate": 0.0002811531578966628, "loss": 0.0212, "step": 2075 }, { "epoch": 0.5053449951409135, "grad_norm": 0.70703125, "learning_rate": 0.00028108272982412604, "loss": 0.0252, "step": 2080 }, { "epoch": 0.5065597667638484, "grad_norm": 0.423828125, "learning_rate": 0.00028101214520729077, "loss": 0.0211, "step": 2085 }, { "epoch": 0.5077745383867833, "grad_norm": 0.46875, "learning_rate": 0.000280941404161031, "loss": 0.0222, "step": 2090 }, { "epoch": 0.5089893100097181, "grad_norm": 0.69140625, "learning_rate": 0.0002808705068004755, "loss": 0.0236, "step": 2095 }, { "epoch": 0.5102040816326531, "grad_norm": 0.427734375, "learning_rate": 0.00028079945324100726, "loss": 0.0218, "step": 2100 }, { "epoch": 0.511418853255588, "grad_norm": 0.59375, "learning_rate": 0.00028072824359826347, "loss": 0.0191, "step": 2105 }, { "epoch": 0.5126336248785228, "grad_norm": 0.69921875, "learning_rate": 0.00028065687798813543, "loss": 0.027, "step": 2110 }, { "epoch": 0.5138483965014577, "grad_norm": 0.671875, "learning_rate": 0.00028058535652676826, "loss": 0.0151, "step": 2115 }, { "epoch": 0.5150631681243926, "grad_norm": 0.5703125, "learning_rate": 0.00028051367933056075, "loss": 0.0233, "step": 2120 }, { "epoch": 0.5162779397473275, "grad_norm": 0.5, "learning_rate": 0.0002804418465161651, "loss": 0.0148, "step": 2125 }, { "epoch": 0.5174927113702624, "grad_norm": 0.5703125, "learning_rate": 0.00028036985820048673, "loss": 0.0183, "step": 2130 }, { "epoch": 0.5187074829931972, "grad_norm": 0.67578125, "learning_rate": 0.00028029771450068414, "loss": 0.0242, "step": 2135 }, { "epoch": 0.5199222546161322, "grad_norm": 0.58203125, "learning_rate": 0.0002802254155341689, "loss": 0.0198, "step": 2140 }, { "epoch": 0.5211370262390671, "grad_norm": 0.53125, "learning_rate": 0.0002801529614186049, "loss": 0.0173, "step": 2145 }, { "epoch": 0.5223517978620019, "grad_norm": 0.5703125, "learning_rate": 0.00028008035227190906, "loss": 0.0207, "step": 2150 }, { "epoch": 0.5235665694849369, "grad_norm": 0.4921875, "learning_rate": 0.00028000758821225, "loss": 0.0188, "step": 2155 }, { "epoch": 0.5247813411078717, "grad_norm": 0.81640625, "learning_rate": 0.00027993466935804893, "loss": 0.025, "step": 2160 }, { "epoch": 0.5259961127308066, "grad_norm": 0.58984375, "learning_rate": 0.00027986159582797876, "loss": 0.0199, "step": 2165 }, { "epoch": 0.5272108843537415, "grad_norm": 0.68359375, "learning_rate": 0.0002797883677409642, "loss": 0.0216, "step": 2170 }, { "epoch": 0.5284256559766763, "grad_norm": 0.6640625, "learning_rate": 0.0002797149852161814, "loss": 0.0209, "step": 2175 }, { "epoch": 0.5296404275996113, "grad_norm": 0.77734375, "learning_rate": 0.00027964144837305804, "loss": 0.0255, "step": 2180 }, { "epoch": 0.5308551992225462, "grad_norm": 0.470703125, "learning_rate": 0.0002795677573312727, "loss": 0.017, "step": 2185 }, { "epoch": 0.532069970845481, "grad_norm": 0.79296875, "learning_rate": 0.0002794939122107552, "loss": 0.0221, "step": 2190 }, { "epoch": 0.533284742468416, "grad_norm": 0.64453125, "learning_rate": 0.00027941991313168587, "loss": 0.0174, "step": 2195 }, { "epoch": 0.5344995140913509, "grad_norm": 0.58984375, "learning_rate": 0.0002793457602144957, "loss": 0.0163, "step": 2200 }, { "epoch": 0.5357142857142857, "grad_norm": 0.46875, "learning_rate": 0.0002792714535798661, "loss": 0.0187, "step": 2205 }, { "epoch": 0.5369290573372206, "grad_norm": 0.6171875, "learning_rate": 0.0002791969933487285, "loss": 0.0236, "step": 2210 }, { "epoch": 0.5381438289601554, "grad_norm": 0.828125, "learning_rate": 0.00027912237964226454, "loss": 0.0178, "step": 2215 }, { "epoch": 0.5393586005830904, "grad_norm": 0.6328125, "learning_rate": 0.0002790476125819054, "loss": 0.0222, "step": 2220 }, { "epoch": 0.5405733722060253, "grad_norm": 0.62890625, "learning_rate": 0.0002789726922893319, "loss": 0.0184, "step": 2225 }, { "epoch": 0.5417881438289601, "grad_norm": 0.7265625, "learning_rate": 0.00027889761888647436, "loss": 0.0211, "step": 2230 }, { "epoch": 0.543002915451895, "grad_norm": 0.51953125, "learning_rate": 0.0002788223924955121, "loss": 0.0206, "step": 2235 }, { "epoch": 0.54421768707483, "grad_norm": 0.7421875, "learning_rate": 0.00027874701323887357, "loss": 0.0176, "step": 2240 }, { "epoch": 0.5454324586977648, "grad_norm": 0.703125, "learning_rate": 0.000278671481239236, "loss": 0.0176, "step": 2245 }, { "epoch": 0.5466472303206997, "grad_norm": 0.82421875, "learning_rate": 0.00027859579661952504, "loss": 0.018, "step": 2250 }, { "epoch": 0.5478620019436345, "grad_norm": 0.6796875, "learning_rate": 0.00027851995950291497, "loss": 0.0188, "step": 2255 }, { "epoch": 0.5490767735665695, "grad_norm": 0.5546875, "learning_rate": 0.000278443970012828, "loss": 0.0177, "step": 2260 }, { "epoch": 0.5502915451895044, "grad_norm": 0.6640625, "learning_rate": 0.0002783678282729345, "loss": 0.0192, "step": 2265 }, { "epoch": 0.5515063168124392, "grad_norm": 0.61328125, "learning_rate": 0.0002782915344071526, "loss": 0.0239, "step": 2270 }, { "epoch": 0.5527210884353742, "grad_norm": 0.375, "learning_rate": 0.0002782150885396479, "loss": 0.0213, "step": 2275 }, { "epoch": 0.5539358600583091, "grad_norm": 0.515625, "learning_rate": 0.0002781384907948335, "loss": 0.0182, "step": 2280 }, { "epoch": 0.5551506316812439, "grad_norm": 0.44921875, "learning_rate": 0.0002780617412973697, "loss": 0.0173, "step": 2285 }, { "epoch": 0.5563654033041788, "grad_norm": 0.59375, "learning_rate": 0.0002779848401721635, "loss": 0.0196, "step": 2290 }, { "epoch": 0.5575801749271136, "grad_norm": 0.431640625, "learning_rate": 0.0002779077875443691, "loss": 0.0175, "step": 2295 }, { "epoch": 0.5587949465500486, "grad_norm": 0.6796875, "learning_rate": 0.00027783058353938686, "loss": 0.0234, "step": 2300 }, { "epoch": 0.5600097181729835, "grad_norm": 0.66796875, "learning_rate": 0.0002777532282828638, "loss": 0.0151, "step": 2305 }, { "epoch": 0.5612244897959183, "grad_norm": 0.6328125, "learning_rate": 0.0002776757219006929, "loss": 0.0173, "step": 2310 }, { "epoch": 0.5624392614188533, "grad_norm": 0.375, "learning_rate": 0.0002775980645190131, "loss": 0.0159, "step": 2315 }, { "epoch": 0.5636540330417882, "grad_norm": 0.451171875, "learning_rate": 0.0002775202562642094, "loss": 0.0169, "step": 2320 }, { "epoch": 0.564868804664723, "grad_norm": 0.56640625, "learning_rate": 0.0002774422972629118, "loss": 0.0171, "step": 2325 }, { "epoch": 0.5660835762876579, "grad_norm": 0.3515625, "learning_rate": 0.0002773641876419961, "loss": 0.0123, "step": 2330 }, { "epoch": 0.5672983479105929, "grad_norm": 0.490234375, "learning_rate": 0.000277285927528583, "loss": 0.0117, "step": 2335 }, { "epoch": 0.5685131195335277, "grad_norm": 0.703125, "learning_rate": 0.0002772075170500382, "loss": 0.018, "step": 2340 }, { "epoch": 0.5697278911564626, "grad_norm": 0.359375, "learning_rate": 0.0002771289563339721, "loss": 0.0144, "step": 2345 }, { "epoch": 0.5709426627793974, "grad_norm": 0.48828125, "learning_rate": 0.00027705024550823954, "loss": 0.0156, "step": 2350 }, { "epoch": 0.5721574344023324, "grad_norm": 0.57421875, "learning_rate": 0.00027697138470093977, "loss": 0.02, "step": 2355 }, { "epoch": 0.5733722060252673, "grad_norm": 0.4609375, "learning_rate": 0.0002768923740404161, "loss": 0.0165, "step": 2360 }, { "epoch": 0.5745869776482021, "grad_norm": 0.61328125, "learning_rate": 0.0002768132136552556, "loss": 0.0261, "step": 2365 }, { "epoch": 0.575801749271137, "grad_norm": 0.63671875, "learning_rate": 0.0002767339036742892, "loss": 0.0174, "step": 2370 }, { "epoch": 0.577016520894072, "grad_norm": 0.609375, "learning_rate": 0.00027665444422659115, "loss": 0.0154, "step": 2375 }, { "epoch": 0.5782312925170068, "grad_norm": 0.70703125, "learning_rate": 0.00027657483544147904, "loss": 0.021, "step": 2380 }, { "epoch": 0.5794460641399417, "grad_norm": 0.63671875, "learning_rate": 0.00027649507744851345, "loss": 0.0182, "step": 2385 }, { "epoch": 0.5806608357628765, "grad_norm": 0.62109375, "learning_rate": 0.0002764151703774977, "loss": 0.0146, "step": 2390 }, { "epoch": 0.5818756073858115, "grad_norm": 0.68359375, "learning_rate": 0.0002763351143584781, "loss": 0.0179, "step": 2395 }, { "epoch": 0.5830903790087464, "grad_norm": 0.53125, "learning_rate": 0.00027625490952174283, "loss": 0.0193, "step": 2400 }, { "epoch": 0.5843051506316812, "grad_norm": 0.52734375, "learning_rate": 0.0002761745559978227, "loss": 0.0162, "step": 2405 }, { "epoch": 0.5855199222546161, "grad_norm": 0.384765625, "learning_rate": 0.00027609405391749027, "loss": 0.0199, "step": 2410 }, { "epoch": 0.5867346938775511, "grad_norm": 0.41796875, "learning_rate": 0.0002760134034117599, "loss": 0.0157, "step": 2415 }, { "epoch": 0.5879494655004859, "grad_norm": 0.515625, "learning_rate": 0.00027593260461188774, "loss": 0.0159, "step": 2420 }, { "epoch": 0.5891642371234208, "grad_norm": 0.828125, "learning_rate": 0.00027585165764937086, "loss": 0.0211, "step": 2425 }, { "epoch": 0.5903790087463557, "grad_norm": 0.50390625, "learning_rate": 0.00027577056265594787, "loss": 0.0147, "step": 2430 }, { "epoch": 0.5915937803692906, "grad_norm": 0.578125, "learning_rate": 0.000275689319763598, "loss": 0.0162, "step": 2435 }, { "epoch": 0.5928085519922255, "grad_norm": 0.59765625, "learning_rate": 0.00027560792910454133, "loss": 0.0216, "step": 2440 }, { "epoch": 0.5940233236151603, "grad_norm": 0.66796875, "learning_rate": 0.0002755263908112384, "loss": 0.0137, "step": 2445 }, { "epoch": 0.5952380952380952, "grad_norm": 0.49609375, "learning_rate": 0.00027544470501639006, "loss": 0.0208, "step": 2450 }, { "epoch": 0.5964528668610302, "grad_norm": 0.490234375, "learning_rate": 0.00027536287185293715, "loss": 0.0194, "step": 2455 }, { "epoch": 0.597667638483965, "grad_norm": 0.33984375, "learning_rate": 0.0002752808914540603, "loss": 0.0174, "step": 2460 }, { "epoch": 0.5988824101068999, "grad_norm": 0.474609375, "learning_rate": 0.00027519876395317984, "loss": 0.023, "step": 2465 }, { "epoch": 0.6000971817298348, "grad_norm": 0.6171875, "learning_rate": 0.00027511648948395554, "loss": 0.0184, "step": 2470 }, { "epoch": 0.6013119533527697, "grad_norm": 0.451171875, "learning_rate": 0.00027503406818028635, "loss": 0.0166, "step": 2475 }, { "epoch": 0.6025267249757046, "grad_norm": 0.47265625, "learning_rate": 0.00027495150017631004, "loss": 0.0173, "step": 2480 }, { "epoch": 0.6037414965986394, "grad_norm": 0.59765625, "learning_rate": 0.0002748687856064032, "loss": 0.0177, "step": 2485 }, { "epoch": 0.6049562682215743, "grad_norm": 0.431640625, "learning_rate": 0.0002747859246051811, "loss": 0.0188, "step": 2490 }, { "epoch": 0.6061710398445093, "grad_norm": 0.5078125, "learning_rate": 0.0002747029173074972, "loss": 0.015, "step": 2495 }, { "epoch": 0.6073858114674441, "grad_norm": 0.482421875, "learning_rate": 0.000274619763848443, "loss": 0.0182, "step": 2500 }, { "epoch": 0.6073858114674441, "eval_loss": 0.01776907965540886, "eval_runtime": 2.4156, "eval_samples_per_second": 82.796, "eval_steps_per_second": 82.796, "step": 2500 }, { "epoch": 0.608600583090379, "grad_norm": 0.546875, "learning_rate": 0.0002745364643633479, "loss": 0.0186, "step": 2505 }, { "epoch": 0.6098153547133139, "grad_norm": 0.5, "learning_rate": 0.0002744530189877791, "loss": 0.018, "step": 2510 }, { "epoch": 0.6110301263362488, "grad_norm": 0.4453125, "learning_rate": 0.00027436942785754096, "loss": 0.0178, "step": 2515 }, { "epoch": 0.6122448979591837, "grad_norm": 0.390625, "learning_rate": 0.0002742856911086753, "loss": 0.0201, "step": 2520 }, { "epoch": 0.6134596695821186, "grad_norm": 0.6796875, "learning_rate": 0.00027420180887746096, "loss": 0.0158, "step": 2525 }, { "epoch": 0.6146744412050534, "grad_norm": 0.38671875, "learning_rate": 0.0002741177813004132, "loss": 0.0191, "step": 2530 }, { "epoch": 0.6158892128279884, "grad_norm": 0.58984375, "learning_rate": 0.0002740336085142841, "loss": 0.0199, "step": 2535 }, { "epoch": 0.6171039844509232, "grad_norm": 0.515625, "learning_rate": 0.0002739492906560621, "loss": 0.0152, "step": 2540 }, { "epoch": 0.6183187560738581, "grad_norm": 0.50390625, "learning_rate": 0.00027386482786297166, "loss": 0.0198, "step": 2545 }, { "epoch": 0.619533527696793, "grad_norm": 0.51953125, "learning_rate": 0.00027378022027247295, "loss": 0.0191, "step": 2550 }, { "epoch": 0.6207482993197279, "grad_norm": 0.419921875, "learning_rate": 0.0002736954680222621, "loss": 0.0132, "step": 2555 }, { "epoch": 0.6219630709426628, "grad_norm": 0.4140625, "learning_rate": 0.0002736105712502704, "loss": 0.017, "step": 2560 }, { "epoch": 0.6231778425655977, "grad_norm": 0.515625, "learning_rate": 0.0002735255300946646, "loss": 0.016, "step": 2565 }, { "epoch": 0.6243926141885325, "grad_norm": 0.3515625, "learning_rate": 0.0002734403446938463, "loss": 0.0181, "step": 2570 }, { "epoch": 0.6256073858114675, "grad_norm": 0.54296875, "learning_rate": 0.0002733550151864516, "loss": 0.0137, "step": 2575 }, { "epoch": 0.6268221574344023, "grad_norm": 0.458984375, "learning_rate": 0.0002732695417113517, "loss": 0.0148, "step": 2580 }, { "epoch": 0.6280369290573372, "grad_norm": 0.72265625, "learning_rate": 0.0002731839244076516, "loss": 0.0156, "step": 2585 }, { "epoch": 0.6292517006802721, "grad_norm": 0.404296875, "learning_rate": 0.0002730981634146905, "loss": 0.0174, "step": 2590 }, { "epoch": 0.630466472303207, "grad_norm": 0.494140625, "learning_rate": 0.0002730122588720417, "loss": 0.0199, "step": 2595 }, { "epoch": 0.6316812439261419, "grad_norm": 0.39453125, "learning_rate": 0.0002729262109195118, "loss": 0.0153, "step": 2600 }, { "epoch": 0.6328960155490768, "grad_norm": 0.486328125, "learning_rate": 0.00027284001969714083, "loss": 0.0196, "step": 2605 }, { "epoch": 0.6341107871720116, "grad_norm": 0.474609375, "learning_rate": 0.0002727536853452023, "loss": 0.0158, "step": 2610 }, { "epoch": 0.6353255587949466, "grad_norm": 0.53515625, "learning_rate": 0.0002726672080042022, "loss": 0.018, "step": 2615 }, { "epoch": 0.6365403304178814, "grad_norm": 0.4296875, "learning_rate": 0.0002725805878148797, "loss": 0.0156, "step": 2620 }, { "epoch": 0.6377551020408163, "grad_norm": 0.52734375, "learning_rate": 0.00027249382491820607, "loss": 0.0175, "step": 2625 }, { "epoch": 0.6389698736637512, "grad_norm": 0.57421875, "learning_rate": 0.000272406919455385, "loss": 0.0157, "step": 2630 }, { "epoch": 0.6401846452866861, "grad_norm": 0.39453125, "learning_rate": 0.0002723198715678521, "loss": 0.0139, "step": 2635 }, { "epoch": 0.641399416909621, "grad_norm": 0.3828125, "learning_rate": 0.00027223268139727505, "loss": 0.0131, "step": 2640 }, { "epoch": 0.6426141885325559, "grad_norm": 0.380859375, "learning_rate": 0.00027214534908555273, "loss": 0.0126, "step": 2645 }, { "epoch": 0.6438289601554907, "grad_norm": 0.63671875, "learning_rate": 0.0002720578747748156, "loss": 0.0154, "step": 2650 }, { "epoch": 0.6450437317784257, "grad_norm": 0.369140625, "learning_rate": 0.0002719702586074251, "loss": 0.0125, "step": 2655 }, { "epoch": 0.6462585034013606, "grad_norm": 0.546875, "learning_rate": 0.0002718825007259736, "loss": 0.0148, "step": 2660 }, { "epoch": 0.6474732750242954, "grad_norm": 0.470703125, "learning_rate": 0.00027179460127328394, "loss": 0.016, "step": 2665 }, { "epoch": 0.6486880466472303, "grad_norm": 0.490234375, "learning_rate": 0.00027170656039240964, "loss": 0.0166, "step": 2670 }, { "epoch": 0.6499028182701652, "grad_norm": 0.59375, "learning_rate": 0.00027161837822663415, "loss": 0.0193, "step": 2675 }, { "epoch": 0.6511175898931001, "grad_norm": 0.4453125, "learning_rate": 0.00027153005491947107, "loss": 0.0194, "step": 2680 }, { "epoch": 0.652332361516035, "grad_norm": 0.37890625, "learning_rate": 0.0002714415906146635, "loss": 0.0181, "step": 2685 }, { "epoch": 0.652332361516035, "eval_loss": 0.017361324280500412, "eval_runtime": 2.3804, "eval_samples_per_second": 84.021, "eval_steps_per_second": 84.021, "step": 2685 }, { "epoch": 0.6535471331389698, "grad_norm": 0.5390625, "learning_rate": 0.00027135298545618404, "loss": 0.0164, "step": 2690 }, { "epoch": 0.6547619047619048, "grad_norm": 0.3671875, "learning_rate": 0.0002712642395882346, "loss": 0.0186, "step": 2695 }, { "epoch": 0.6559766763848397, "grad_norm": 0.5625, "learning_rate": 0.0002711753531552462, "loss": 0.0165, "step": 2700 }, { "epoch": 0.6571914480077745, "grad_norm": 0.56640625, "learning_rate": 0.0002710863263018784, "loss": 0.0184, "step": 2705 }, { "epoch": 0.6584062196307094, "grad_norm": 0.486328125, "learning_rate": 0.0002709971591730193, "loss": 0.0171, "step": 2710 }, { "epoch": 0.6596209912536443, "grad_norm": 0.62109375, "learning_rate": 0.00027090785191378553, "loss": 0.0125, "step": 2715 }, { "epoch": 0.6608357628765792, "grad_norm": 0.40625, "learning_rate": 0.0002708184046695215, "loss": 0.0118, "step": 2720 }, { "epoch": 0.6620505344995141, "grad_norm": 0.6640625, "learning_rate": 0.0002707288175857996, "loss": 0.0209, "step": 2725 }, { "epoch": 0.6632653061224489, "grad_norm": 0.52734375, "learning_rate": 0.0002706390908084198, "loss": 0.0161, "step": 2730 }, { "epoch": 0.6644800777453839, "grad_norm": 0.453125, "learning_rate": 0.0002705492244834093, "loss": 0.0141, "step": 2735 }, { "epoch": 0.6656948493683188, "grad_norm": 0.6875, "learning_rate": 0.0002704592187570226, "loss": 0.0207, "step": 2740 }, { "epoch": 0.6666666666666666, "eval_loss": 0.015805033966898918, "eval_runtime": 2.4212, "eval_samples_per_second": 82.603, "eval_steps_per_second": 82.603, "step": 2744 } ], "logging_steps": 5, "max_steps": 12348, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.3188241862059622e+17, "train_batch_size": 46, "trial_name": null, "trial_params": null }