diff --git "a/outio/mlp-linear-9L_run/training_log.jsonl" "b/outio/mlp-linear-9L_run/training_log.jsonl" new file mode 100644--- /dev/null +++ "b/outio/mlp-linear-9L_run/training_log.jsonl" @@ -0,0 +1,54 @@ +{"step": 20, "epoch": 0.026963262554769128, "timestamp": 1786254867.8820844, "loss": 120.13565673828126, "grad_norm": 19.875, "learning_rate": 0.0005, "train/total_time_seconds": 23.281483590602875, "train/time_per_step_avg": 1.1640741795301437, "train/epoch_time_elapsed": 42.8496764190495, "train/estimated_remaining_minutes": 14.162902517616748, "train/global/act/norm": 45865.29424772523, "train/global/act/mean": 0.0008468838877243953, "train/global/act/std": 0.405950734162207, "train/global/act/max_abs": 8.328570365905762, "train/global/act/frac_near_dtype_limit": 0.0, "train/global/act/frac_near_user_limit": 0.0, "train/global/grad/norm": 7.223068074765932, "train/global/grad/mean": 1.5862884322552294e-06, "train/global/grad/std": 0.0012770101063532878, "train/global/grad/max_abs": 0.1865234375, "train/global/grad/frac_near_dtype_limit": 0.0, "train/global/grad/frac_near_user_limit": 0.0, "train/global/param/norm": 56.8370559383082, "train/global/param/mean": 0.0012002339254830034, "train/global/param/std": 0.040175776880214266, "train/global/param/max_abs": 1.0, "train/global/param/frac_near_dtype_limit": 0.0, "train/global/param/frac_near_user_limit": 0.0, "train/layer__model_layers_4/param/norm": 17.9352881367118, "train/layer__model_layers_4/param/mean": 0.0015472673960669364, "train/layer__model_layers_4/param/std": 0.044252915450776684, "train/layer__model_layers_4/param/max_abs": 1.0, "train/layer__model_layers_4/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_4/param/frac_near_user_limit": 0.0, "train/layer__model_layers_7/param/norm": 17.939752417379538, "train/layer__model_layers_7/param/mean": 0.001527842790957732, "train/layer__model_layers_7/param/std": 0.04426481997403276, "train/layer__model_layers_7/param/max_abs": 1.0, "train/layer__model_layers_7/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_7/param/frac_near_user_limit": 0.0, "train/layer__model_layers_6/param/norm": 17.92636985918022, "train/layer__model_layers_6/param/mean": 0.001631773950157225, "train/layer__model_layers_6/param/std": 0.04422802810460986, "train/layer__model_layers_6/param/max_abs": 1.0, "train/layer__model_layers_6/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_6/param/frac_near_user_limit": 0.0, "train/layer_model_layers_6/act/norm": 14130.943375884945, "train/layer_model_layers_6/act/mean": 0.001090640058884254, "train/layer_model_layers_6/act/std": 0.42790409106686467, "train/layer_model_layers_6/act/max_abs": 5.125, "train/layer_model_layers_6/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_6/act/frac_near_user_limit": 0.0, "train/layer_model_layers_6/grad/norm": 1.1282536394103617, "train/layer_model_layers_6/grad/mean": -7.801037481528316e-07, "train/layer_model_layers_6/grad/std": 0.0006963687337265827, "train/layer_model_layers_6/grad/max_abs": 0.007659912109375, "train/layer_model_layers_6/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_6/grad/frac_near_user_limit": 0.0, "train/layer_model_layers_7/act/norm": 14162.553496833301, "train/layer_model_layers_7/act/mean": 0.0004149681100478539, "train/layer_model_layers_7/act/std": 0.42889934741429514, "train/layer_model_layers_7/act/max_abs": 5.5, "train/layer_model_layers_7/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_7/act/frac_near_user_limit": 0.0, "train/layer_model_layers_7/grad/norm": 1.0656749934054095, "train/layer_model_layers_7/grad/mean": -4.2460115153165227e-07, "train/layer_model_layers_7/grad/std": 0.000657913163571747, "train/layer_model_layers_7/grad/max_abs": 0.00848388671875, "train/layer_model_layers_7/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_7/grad/frac_near_user_limit": 0.0, "train/layer__model_layers_8/param/norm": 17.918659803138876, "train/layer__model_layers_8/param/mean": 0.0014265063400387577, "train/layer__model_layers_8/param/std": 0.044202242984042614, "train/layer__model_layers_8/param/max_abs": 1.0, "train/layer__model_layers_8/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_8/param/frac_near_user_limit": 0.0, "train/layer_model_layers_4/act/norm": 14079.863892348538, "train/layer_model_layers_4/act/mean": 0.0009709768570386446, "train/layer_model_layers_4/act/std": 0.4264060735955697, "train/layer_model_layers_4/act/max_abs": 5.25, "train/layer_model_layers_4/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_4/act/frac_near_user_limit": 0.0, "train/layer_model_layers_4/grad/norm": 1.4315023400178932, "train/layer_model_layers_4/grad/mean": -2.028000673247202e-06, "train/layer_model_layers_4/grad/std": 0.0008836196933127202, "train/layer_model_layers_4/grad/max_abs": 0.00927734375, "train/layer_model_layers_4/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_4/grad/frac_near_user_limit": 0.0, "train/layer_model_layers_8/act/norm": 14188.43172167708, "train/layer_model_layers_8/act/mean": 0.0013178988144947933, "train/layer_model_layers_8/act/std": 0.4296572584517151, "train/layer_model_layers_8/act/max_abs": 5.5625, "train/layer_model_layers_8/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_8/act/frac_near_user_limit": 0.0, "train/layer_model_layers_8/grad/norm": 1.0206292167726159, "train/layer_model_layers_8/grad/mean": 5.3110055200640815e-08, "train/layer_model_layers_8/grad/std": 0.000630075835746595, "train/layer_model_layers_8/grad/max_abs": 0.0072021484375, "train/layer_model_layers_8/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_8/grad/frac_near_user_limit": 0.0, "train/layer_model_layers_5/act/norm": 14117.1315554156, "train/layer_model_layers_5/act/mean": 0.0018905794847971545, "train/layer_model_layers_5/act/std": 0.4275287071610389, "train/layer_model_layers_5/act/max_abs": 5.28125, "train/layer_model_layers_5/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_5/act/frac_near_user_limit": 0.0, "train/layer_model_layers_5/grad/norm": 1.2122966690033181, "train/layer_model_layers_5/grad/mean": -9.892893230103759e-07, "train/layer_model_layers_5/grad/std": 0.0007485524005112892, "train/layer_model_layers_5/grad/max_abs": 0.00830078125, "train/layer_model_layers_5/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_5/grad/frac_near_user_limit": 0.0, "train/layer__model_layers_1/param/norm": 17.933035158611606, "train/layer__model_layers_1/param/mean": 0.0015046377077861436, "train/layer__model_layers_1/param/std": 0.04424885735283964, "train/layer__model_layers_1/param/max_abs": 1.0, "train/layer__model_layers_1/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_1/param/frac_near_user_limit": 0.0, "train/layer_model_layers_3/act/norm": 14066.883930544302, "train/layer_model_layers_3/act/mean": 0.0025618718220637394, "train/layer_model_layers_3/act/std": 0.42613855008964696, "train/layer_model_layers_3/act/max_abs": 4.84375, "train/layer_model_layers_3/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_3/act/frac_near_user_limit": 0.0, "train/layer_model_layers_3/grad/norm": 1.7070210406409134, "train/layer_model_layers_3/grad/mean": 1.9531665070566482e-06, "train/layer_model_layers_3/grad/std": 0.001054004791488333, "train/layer_model_layers_3/grad/max_abs": 0.0103759765625, "train/layer_model_layers_3/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_3/grad/frac_near_user_limit": 0.0, "train/layer_model_layers_1/act/norm": 14001.340936971721, "train/layer_model_layers_1/act/mean": 7.794453547551215e-07, "train/layer_model_layers_1/act/std": 0.4240053066896342, "train/layer_model_layers_1/act/max_abs": 5.3125, "train/layer_model_layers_1/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_1/act/frac_near_user_limit": 0.0, "train/layer_model_layers_1/grad/norm": 2.6490285904002473, "train/layer_model_layers_1/grad/mean": 2.259144367399159e-06, "train/layer_model_layers_1/grad/std": 0.001634984444366829, "train/layer_model_layers_1/grad/max_abs": 0.0179443359375, "train/layer_model_layers_1/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_1/grad/frac_near_user_limit": 0.0, "train/layer__model_layers_3/param/norm": 17.937513610622013, "train/layer__model_layers_3/param/mean": 0.0014466227681700042, "train/layer__model_layers_3/param/std": 0.044262013477257604, "train/layer__model_layers_3/param/max_abs": 1.0, "train/layer__model_layers_3/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_3/param/frac_near_user_limit": 0.0, "train/layer__model_layers_2/param/norm": 17.933035158611606, "train/layer__model_layers_2/param/mean": 0.0015101395605506837, "train/layer__model_layers_2/param/std": 0.044265292316262486, "train/layer__model_layers_2/param/max_abs": 1.0, "train/layer__model_layers_2/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_2/param/frac_near_user_limit": 0.0, "train/layer__model_layers_5/param/norm": 17.929821963003427, "train/layer__model_layers_5/param/mean": 0.001554492111325078, "train/layer__model_layers_5/param/std": 0.04425848149488436, "train/layer__model_layers_5/param/max_abs": 1.0, "train/layer__model_layers_5/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_5/param/frac_near_user_limit": 0.0, "train/layer_model_layers_0/act/norm": 13969.97237396381, "train/layer_model_layers_0/act/mean": -0.0001725346709673221, "train/layer_model_layers_0/act/std": 0.42352815051836784, "train/layer_model_layers_0/act/max_abs": 4.75, "train/layer_model_layers_0/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_0/act/frac_near_user_limit": 0.0, "train/layer_model_layers_0/grad/norm": 4.140204517701514, "train/layer_model_layers_0/grad/mean": -4.7352227277751553e-07, "train/layer_model_layers_0/grad/std": 0.002555505245858976, "train/layer_model_layers_0/grad/max_abs": 0.0361328125, "train/layer_model_layers_0/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_0/grad/frac_near_user_limit": 0.0, "train/layer__model_layers_0/param/norm": 17.93527452440093, "train/layer__model_layers_0/param/mean": 0.001573654865139918, "train/layer__model_layers_0/param/std": 0.044252048307771956, "train/layer__model_layers_0/param/max_abs": 1.0, "train/layer__model_layers_0/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_0/param/frac_near_user_limit": 0.0, "train/layer_model_layers_2/act/norm": 14034.215279860322, "train/layer_model_layers_2/act/mean": 0.0025705924400916467, "train/layer_model_layers_2/act/std": 0.4250360320197809, "train/layer_model_layers_2/act/max_abs": 4.90625, "train/layer_model_layers_2/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_2/act/frac_near_user_limit": 0.0, "train/layer_model_layers_2/grad/norm": 2.2317679743784002, "train/layer_model_layers_2/grad/mean": 2.4813947300702718e-06, "train/layer_model_layers_2/grad/std": 0.0013771787384382957, "train/layer_model_layers_2/grad/max_abs": 0.0146484375, "train/layer_model_layers_2/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_2/grad/frac_near_user_limit": 0.0, "train/tensor_act_model_embed_tokens/norm": 183.14187215122737, "train/tensor_act_model_embed_tokens/mean": -3.91155481338501e-05, "train/tensor_act_model_embed_tokens/std": 0.02001953329041244, "train/tensor_act_model_embed_tokens/max_abs": 0.09619140625, "train/tensor_act_model_embed_tokens/frac_near_dtype_limit": 0.0, "train/tensor_act_model_embed_tokens/frac_near_user_limit": 0.0, "train/tensor_act_model_rotary_emb/norm": 3632.2067871093745, "train/tensor_act_model_rotary_emb/mean": 0.333984375, "train/tensor_act_model_rotary_emb/std": 0.71875, "train/tensor_act_model_rotary_emb/max_abs": 1.0, "train/tensor_act_model_rotary_emb/frac_near_dtype_limit": 0.0, "train/tensor_act_model_rotary_emb/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_input_layernorm/norm": 9146.768310589385, "train/tensor_act_model_layers_0_input_layernorm/mean": -0.0023627281188964844, "train/tensor_act_model_layers_0_input_layernorm/std": 1.000000091723332, "train/tensor_act_model_layers_0_input_layernorm/max_abs": 4.375, "train/tensor_act_model_layers_0_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_q_proj/norm": 2073.7606174205857, "train/tensor_act_model_layers_0_self_attn_q_proj/mean": -0.0006031990051269532, "train/tensor_act_model_layers_0_self_attn_q_proj/std": 0.2265625557654413, "train/tensor_act_model_layers_0_self_attn_q_proj/max_abs": 1.0703125, "train/tensor_act_model_layers_0_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_k_proj/norm": 2089.1339244416013, "train/tensor_act_model_layers_0_self_attn_k_proj/mean": 8.234567940235139e-05, "train/tensor_act_model_layers_0_self_attn_k_proj/std": 0.2281499629770971, "train/tensor_act_model_layers_0_self_attn_k_proj/max_abs": 1.0234375, "train/tensor_act_model_layers_0_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_v_proj/norm": 2107.624164923062, "train/tensor_act_model_layers_0_self_attn_v_proj/mean": -0.0013871192932128906, "train/tensor_act_model_layers_0_self_attn_v_proj/std": 0.23046878774569188, "train/tensor_act_model_layers_0_self_attn_v_proj/max_abs": 1.0703125, "train/tensor_act_model_layers_0_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_o_proj/norm": 78.02399889508851, "train/tensor_act_model_layers_0_self_attn_o_proj/mean": 0.0001543760299682617, "train/tensor_act_model_layers_0_self_attn_o_proj/std": 0.008522998259386573, "train/tensor_act_model_layers_0_self_attn_o_proj/max_abs": 0.2578125, "train/tensor_act_model_layers_0_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn/norm": 78.02399889508851, "train/tensor_act_model_layers_0_self_attn/mean": 0.0001543760299682617, "train/tensor_act_model_layers_0_self_attn/std": 0.008522998259386573, "train/tensor_act_model_layers_0_self_attn/max_abs": 0.2578125, "train/tensor_act_model_layers_0_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_post_attention_layernorm/norm": 9148.850097786815, "train/tensor_act_model_layers_0_post_attention_layernorm/mean": 0.004792213439941406, "train/tensor_act_model_layers_0_post_attention_layernorm/std": 1.000002007208682, "train/tensor_act_model_layers_0_post_attention_layernorm/max_abs": 4.75, "train/tensor_act_model_layers_0_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_mlp_up_proj/norm": 3560.757550565122, "train/tensor_act_model_layers_0_mlp_up_proj/mean": -7.581710815429688e-05, "train/tensor_act_model_layers_0_mlp_up_proj/std": 0.2246094857487788, "train/tensor_act_model_layers_0_mlp_up_proj/max_abs": 1.1796875, "train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_mlp_down_proj/norm": 808.1675831830216, "train/tensor_act_model_layers_0_mlp_down_proj/mean": -0.000986814498901367, "train/tensor_act_model_layers_0_mlp_down_proj/std": 0.08834877783806921, "train/tensor_act_model_layers_0_mlp_down_proj/max_abs": 0.51171875, "train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_mlp/norm": 808.1675831830216, "train/tensor_act_model_layers_0_mlp/mean": -0.000986814498901367, "train/tensor_act_model_layers_0_mlp/std": 0.08834877783806921, "train/tensor_act_model_layers_0_mlp/max_abs": 0.51171875, "train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0/norm": 831.1538419700142, "train/tensor_act_model_layers_0/mean": -0.0008721351623535156, "train/tensor_act_model_layers_0/std": 0.09082059435858165, "train/tensor_act_model_layers_0/max_abs": 0.52734375, "train/tensor_act_model_layers_0/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_input_layernorm/norm": 9158.358703626907, "train/tensor_act_model_layers_1_input_layernorm/mean": -0.008217811584472656, "train/tensor_act_model_layers_1_input_layernorm/std": 1.00000304894128, "train/tensor_act_model_layers_1_input_layernorm/max_abs": 5.3125, "train/tensor_act_model_layers_1_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_q_proj/norm": 2034.8610171837768, "train/tensor_act_model_layers_1_self_attn_q_proj/mean": -0.0059032440185546875, "train/tensor_act_model_layers_1_self_attn_q_proj/std": 0.2220469414917578, "train/tensor_act_model_layers_1_self_attn_q_proj/max_abs": 1.1875, "train/tensor_act_model_layers_1_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_k_proj/norm": 2082.27089692581, "train/tensor_act_model_layers_1_self_attn_k_proj/mean": 0.00048154592514038086, "train/tensor_act_model_layers_1_self_attn_k_proj/std": 0.22747849840050277, "train/tensor_act_model_layers_1_self_attn_k_proj/max_abs": 1.171875, "train/tensor_act_model_layers_1_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_v_proj/norm": 2050.4426360629855, "train/tensor_act_model_layers_1_self_attn_v_proj/mean": -0.000854790210723877, "train/tensor_act_model_layers_1_self_attn_v_proj/std": 0.22369433159830898, "train/tensor_act_model_layers_1_self_attn_v_proj/max_abs": 1.1875, "train/tensor_act_model_layers_1_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_o_proj/norm": 180.58027982936176, "train/tensor_act_model_layers_1_self_attn_o_proj/mean": 0.0011816024780273438, "train/tensor_act_model_layers_1_self_attn_o_proj/std": 0.01968680419952855, "train/tensor_act_model_layers_1_self_attn_o_proj/max_abs": 0.2421875, "train/tensor_act_model_layers_1_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn/norm": 180.58027982936176, "train/tensor_act_model_layers_1_self_attn/mean": 0.0011816024780273438, "train/tensor_act_model_layers_1_self_attn/std": 0.01968680419952855, "train/tensor_act_model_layers_1_self_attn/max_abs": 0.2421875, "train/tensor_act_model_layers_1_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_post_attention_layernorm/norm": 9158.379089361999, "train/tensor_act_model_layers_1_post_attention_layernorm/mean": 0.004539966583251953, "train/tensor_act_model_layers_1_post_attention_layernorm/std": 1.0000031951497133, "train/tensor_act_model_layers_1_post_attention_layernorm/max_abs": 5.25, "train/tensor_act_model_layers_1_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_mlp_up_proj/norm": 3579.287503193819, "train/tensor_act_model_layers_1_mlp_up_proj/mean": 0.0012593269348144531, "train/tensor_act_model_layers_1_mlp_up_proj/std": 0.2255861107294601, "train/tensor_act_model_layers_1_mlp_up_proj/max_abs": 1.1875, "train/tensor_act_model_layers_1_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_mlp_down_proj/norm": 821.0661844308066, "train/tensor_act_model_layers_1_mlp_down_proj/mean": 0.0011713504791259768, "train/tensor_act_model_layers_1_mlp_down_proj/std": 0.08963061949140268, "train/tensor_act_model_layers_1_mlp_down_proj/max_abs": 0.4765625, "train/tensor_act_model_layers_1_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_mlp/norm": 821.0661844308066, "train/tensor_act_model_layers_1_mlp/mean": 0.0011713504791259768, "train/tensor_act_model_layers_1_mlp/std": 0.08963061949140268, "train/tensor_act_model_layers_1_mlp/max_abs": 0.4765625, "train/tensor_act_model_layers_1_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1/norm": 1174.9310743433161, "train/tensor_act_model_layers_1/mean": 0.0014805793762207031, "train/tensor_act_model_layers_1/std": 0.12805229517561986, "train/tensor_act_model_layers_1/max_abs": 0.640625, "train/tensor_act_model_layers_1/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_input_layernorm/norm": 9158.63647461776, "train/tensor_act_model_layers_2_input_layernorm/mean": 0.011058807373046875, "train/tensor_act_model_layers_2_input_layernorm/std": 1.0000010433645015, "train/tensor_act_model_layers_2_input_layernorm/max_abs": 4.875, "train/tensor_act_model_layers_2_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_q_proj/norm": 2065.775366237947, "train/tensor_act_model_layers_2_self_attn_q_proj/mean": -0.011943817138671875, "train/tensor_act_model_layers_2_self_attn_q_proj/std": 0.22522063394043246, "train/tensor_act_model_layers_2_self_attn_q_proj/max_abs": 1.3828125, "train/tensor_act_model_layers_2_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_k_proj/norm": 2092.924444260376, "train/tensor_act_model_layers_2_self_attn_k_proj/mean": 0.008089065551757809, "train/tensor_act_model_layers_2_self_attn_k_proj/std": 0.2284549606805223, "train/tensor_act_model_layers_2_self_attn_k_proj/max_abs": 1.296875, "train/tensor_act_model_layers_2_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_v_proj/norm": 2096.376890747997, "train/tensor_act_model_layers_2_self_attn_v_proj/mean": -0.008035659790039062, "train/tensor_act_model_layers_2_self_attn_v_proj/std": 0.22869949776392487, "train/tensor_act_model_layers_2_self_attn_v_proj/max_abs": 1.2421875, "train/tensor_act_model_layers_2_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_o_proj/norm": 226.16535075261754, "train/tensor_act_model_layers_2_self_attn_o_proj/mean": 0.0012426376342773438, "train/tensor_act_model_layers_2_self_attn_o_proj/std": 0.024668824166795517, "train/tensor_act_model_layers_2_self_attn_o_proj/max_abs": 0.228515625, "train/tensor_act_model_layers_2_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn/norm": 226.16535075261754, "train/tensor_act_model_layers_2_self_attn/mean": 0.0012426376342773438, "train/tensor_act_model_layers_2_self_attn/std": 0.024668824166795517, "train/tensor_act_model_layers_2_self_attn/max_abs": 0.228515625, "train/tensor_act_model_layers_2_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_post_attention_layernorm/norm": 9158.648437517744, "train/tensor_act_model_layers_2_post_attention_layernorm/mean": 0.0203094482421875, "train/tensor_act_model_layers_2_post_attention_layernorm/std": 1.000001718172259, "train/tensor_act_model_layers_2_post_attention_layernorm/max_abs": 4.90625, "train/tensor_act_model_layers_2_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_mlp_up_proj/norm": 3570.9513244909417, "train/tensor_act_model_layers_2_mlp_up_proj/mean": 0.0018334388732910156, "train/tensor_act_model_layers_2_mlp_up_proj/std": 0.22509841710844916, "train/tensor_act_model_layers_2_mlp_up_proj/max_abs": 1.28125, "train/tensor_act_model_layers_2_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_mlp_down_proj/norm": 790.1283816142175, "train/tensor_act_model_layers_2_mlp_down_proj/mean": 0.0010769367218017578, "train/tensor_act_model_layers_2_mlp_down_proj/std": 0.08633508027126516, "train/tensor_act_model_layers_2_mlp_down_proj/max_abs": 0.47265625, "train/tensor_act_model_layers_2_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_mlp/norm": 790.1283816142175, "train/tensor_act_model_layers_2_mlp/mean": 0.0010769367218017578, "train/tensor_act_model_layers_2_mlp/std": 0.08633508027126516, "train/tensor_act_model_layers_2_mlp/max_abs": 0.47265625, "train/tensor_act_model_layers_2_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2/norm": 1432.682090175319, "train/tensor_act_model_layers_2/mean": 0.0038003921508789062, "train/tensor_act_model_layers_2/std": 0.15625055417960487, "train/tensor_act_model_layers_2/max_abs": 0.8359375, "train/tensor_act_model_layers_2/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_input_layernorm/norm": 9158.735351567297, "train/tensor_act_model_layers_3_input_layernorm/mean": 0.02446746826171875, "train/tensor_act_model_layers_3_input_layernorm/std": 1.0000034318886946, "train/tensor_act_model_layers_3_input_layernorm/max_abs": 4.78125, "train/tensor_act_model_layers_3_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_q_proj/norm": 2092.894250965192, "train/tensor_act_model_layers_3_self_attn_q_proj/mean": 0.002222776412963867, "train/tensor_act_model_layers_3_self_attn_q_proj/std": 0.22851672499565404, "train/tensor_act_model_layers_3_self_attn_q_proj/max_abs": 1.1953125, "train/tensor_act_model_layers_3_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_k_proj/norm": 2052.9258628307634, "train/tensor_act_model_layers_3_self_attn_k_proj/mean": -1.609325408935547e-05, "train/tensor_act_model_layers_3_self_attn_k_proj/std": 0.22418327748137298, "train/tensor_act_model_layers_3_self_attn_k_proj/max_abs": 1.1328125, "train/tensor_act_model_layers_3_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_v_proj/norm": 2073.2135136194793, "train/tensor_act_model_layers_3_self_attn_v_proj/mean": -0.006084442138671875, "train/tensor_act_model_layers_3_self_attn_v_proj/std": 0.2263803761978546, "train/tensor_act_model_layers_3_self_attn_v_proj/max_abs": 1.203125, "train/tensor_act_model_layers_3_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_o_proj/norm": 223.4814746474767, "train/tensor_act_model_layers_3_self_attn_o_proj/mean": 0.0013904571533203125, "train/tensor_act_model_layers_3_self_attn_o_proj/std": 0.02435658282244344, "train/tensor_act_model_layers_3_self_attn_o_proj/max_abs": 0.2255859375, "train/tensor_act_model_layers_3_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn/norm": 223.4814746474767, "train/tensor_act_model_layers_3_self_attn/mean": 0.0013904571533203125, "train/tensor_act_model_layers_3_self_attn/std": 0.02435658282244344, "train/tensor_act_model_layers_3_self_attn/max_abs": 0.2255859375, "train/tensor_act_model_layers_3_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_post_attention_layernorm/norm": 9158.734741215712, "train/tensor_act_model_layers_3_post_attention_layernorm/mean": 0.03290557861328125, "train/tensor_act_model_layers_3_post_attention_layernorm/std": 1.0000052582043284, "train/tensor_act_model_layers_3_post_attention_layernorm/max_abs": 4.84375, "train/tensor_act_model_layers_3_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_mlp_up_proj/norm": 3594.7566943629945, "train/tensor_act_model_layers_3_mlp_up_proj/mean": -0.0059356689453125, "train/tensor_act_model_layers_3_mlp_up_proj/std": 0.22656261638317735, "train/tensor_act_model_layers_3_mlp_up_proj/max_abs": 1.296875, "train/tensor_act_model_layers_3_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_mlp_down_proj/norm": 829.2458262629668, "train/tensor_act_model_layers_3_mlp_down_proj/mean": -0.0034513473510742188, "train/tensor_act_model_layers_3_mlp_down_proj/std": 0.09039351059760549, "train/tensor_act_model_layers_3_mlp_down_proj/max_abs": 0.431640625, "train/tensor_act_model_layers_3_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_mlp/norm": 829.2458262629668, "train/tensor_act_model_layers_3_mlp/mean": -0.0034513473510742188, "train/tensor_act_model_layers_3_mlp/std": 0.09039351059760549, "train/tensor_act_model_layers_3_mlp/max_abs": 0.431640625, "train/tensor_act_model_layers_3_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3/norm": 1679.8756164997528, "train/tensor_act_model_layers_3/mean": 0.001737833023071289, "train/tensor_act_model_layers_3/std": 0.18353348927121566, "train/tensor_act_model_layers_3/max_abs": 0.984375, "train/tensor_act_model_layers_3/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_input_layernorm/norm": 9158.782958988662, "train/tensor_act_model_layers_4_input_layernorm/mean": 0.009237289428710938, "train/tensor_act_model_layers_4_input_layernorm/std": 1.0000033612375674, "train/tensor_act_model_layers_4_input_layernorm/max_abs": 5.0625, "train/tensor_act_model_layers_4_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_q_proj/norm": 2066.455070534267, "train/tensor_act_model_layers_4_self_attn_q_proj/mean": -0.009563446044921875, "train/tensor_act_model_layers_4_self_attn_q_proj/std": 0.22540440079163515, "train/tensor_act_model_layers_4_self_attn_q_proj/max_abs": 1.203125, "train/tensor_act_model_layers_4_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_k_proj/norm": 2100.324965169152, "train/tensor_act_model_layers_4_self_attn_k_proj/mean": 0.0060024261474609375, "train/tensor_act_model_layers_4_self_attn_k_proj/std": 0.22943195828941673, "train/tensor_act_model_layers_4_self_attn_k_proj/max_abs": 1.1875, "train/tensor_act_model_layers_4_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_v_proj/norm": 2030.455616326556, "train/tensor_act_model_layers_4_self_attn_v_proj/mean": -0.004791259765624999, "train/tensor_act_model_layers_4_self_attn_v_proj/std": 0.2216801315147726, "train/tensor_act_model_layers_4_self_attn_v_proj/max_abs": 1.171875, "train/tensor_act_model_layers_4_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_o_proj/norm": 250.93902724467202, "train/tensor_act_model_layers_4_self_attn_o_proj/mean": 0.0006207823753356934, "train/tensor_act_model_layers_4_self_attn_o_proj/std": 0.027385711249535913, "train/tensor_act_model_layers_4_self_attn_o_proj/max_abs": 0.2373046875, "train/tensor_act_model_layers_4_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn/norm": 250.93902724467202, "train/tensor_act_model_layers_4_self_attn/mean": 0.0006207823753356934, "train/tensor_act_model_layers_4_self_attn/std": 0.027385711249535913, "train/tensor_act_model_layers_4_self_attn/max_abs": 0.2373046875, "train/tensor_act_model_layers_4_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_post_attention_layernorm/norm": 9158.788757328228, "train/tensor_act_model_layers_4_post_attention_layernorm/mean": 0.012622833251953125, "train/tensor_act_model_layers_4_post_attention_layernorm/std": 1.0000021418577287, "train/tensor_act_model_layers_4_post_attention_layernorm/max_abs": 5.25, "train/tensor_act_model_layers_4_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_mlp_up_proj/norm": 3555.8362572354035, "train/tensor_act_model_layers_4_mlp_up_proj/mean": -0.00014309585094451904, "train/tensor_act_model_layers_4_mlp_up_proj/std": 0.22418291445047742, "train/tensor_act_model_layers_4_mlp_up_proj/max_abs": 1.234375, "train/tensor_act_model_layers_4_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_mlp_down_proj/norm": 811.0240760131593, "train/tensor_act_model_layers_4_mlp_down_proj/mean": -0.0013518333435058594, "train/tensor_act_model_layers_4_mlp_down_proj/std": 0.08850153981303953, "train/tensor_act_model_layers_4_mlp_down_proj/max_abs": 0.484375, "train/tensor_act_model_layers_4_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_mlp/norm": 811.0240760131593, "train/tensor_act_model_layers_4_mlp/mean": -0.0013518333435058594, "train/tensor_act_model_layers_4_mlp/std": 0.08850153981303953, "train/tensor_act_model_layers_4_mlp/max_abs": 0.484375, "train/tensor_act_model_layers_4_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4/norm": 1893.6912433949042, "train/tensor_act_model_layers_4/mean": 0.0010062456130981445, "train/tensor_act_model_layers_4/std": 0.20678798842065674, "train/tensor_act_model_layers_4/max_abs": 1.140625, "train/tensor_act_model_layers_4/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_input_layernorm/norm": 9158.812072765204, "train/tensor_act_model_layers_5_input_layernorm/mean": 0.004483461380004883, "train/tensor_act_model_layers_5_input_layernorm/std": 1.0000021717879695, "train/tensor_act_model_layers_5_input_layernorm/max_abs": 5.25, "train/tensor_act_model_layers_5_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_q_proj/norm": 2100.6405818001044, "train/tensor_act_model_layers_5_self_attn_q_proj/mean": 0.01197052001953125, "train/tensor_act_model_layers_5_self_attn_q_proj/std": 0.22906618031553744, "train/tensor_act_model_layers_5_self_attn_q_proj/max_abs": 1.1953125, "train/tensor_act_model_layers_5_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_k_proj/norm": 2051.5121024181535, "train/tensor_act_model_layers_5_self_attn_k_proj/mean": 0.001157522201538086, "train/tensor_act_model_layers_5_self_attn_k_proj/std": 0.22393874789383927, "train/tensor_act_model_layers_5_self_attn_k_proj/max_abs": 1.1640625, "train/tensor_act_model_layers_5_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_v_proj/norm": 2075.85469408804, "train/tensor_act_model_layers_5_self_attn_v_proj/mean": 0.00022197276121005416, "train/tensor_act_model_layers_5_self_attn_v_proj/std": 0.22662457978015543, "train/tensor_act_model_layers_5_self_attn_v_proj/max_abs": 1.2578125, "train/tensor_act_model_layers_5_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_o_proj/norm": 254.5151423734983, "train/tensor_act_model_layers_5_self_attn_o_proj/mean": 0.0008132457733154297, "train/tensor_act_model_layers_5_self_attn_o_proj/std": 0.02778320703029389, "train/tensor_act_model_layers_5_self_attn_o_proj/max_abs": 0.220703125, "train/tensor_act_model_layers_5_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn/norm": 254.5151423734983, "train/tensor_act_model_layers_5_self_attn/mean": 0.0008132457733154297, "train/tensor_act_model_layers_5_self_attn/std": 0.02778320703029389, "train/tensor_act_model_layers_5_self_attn/max_abs": 0.220703125, "train/tensor_act_model_layers_5_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_post_attention_layernorm/norm": 9158.816345220177, "train/tensor_act_model_layers_5_post_attention_layernorm/mean": 0.008457183837890625, "train/tensor_act_model_layers_5_post_attention_layernorm/std": 1.0000021982608298, "train/tensor_act_model_layers_5_post_attention_layernorm/max_abs": 5.28125, "train/tensor_act_model_layers_5_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_mlp_up_proj/norm": 3573.0466421568854, "train/tensor_act_model_layers_5_mlp_up_proj/mean": -0.0011423826217651367, "train/tensor_act_model_layers_5_mlp_up_proj/std": 0.22540349692495276, "train/tensor_act_model_layers_5_mlp_up_proj/max_abs": 1.1875, "train/tensor_act_model_layers_5_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_mlp_down_proj/norm": 799.3515006834078, "train/tensor_act_model_layers_5_mlp_down_proj/mean": -0.0005774497985839844, "train/tensor_act_model_layers_5_mlp_down_proj/std": 0.08740284699963051, "train/tensor_act_model_layers_5_mlp_down_proj/max_abs": 0.462890625, "train/tensor_act_model_layers_5_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_mlp/norm": 799.3515006834078, "train/tensor_act_model_layers_5_mlp/mean": -0.0005774497985839844, "train/tensor_act_model_layers_5_mlp/std": 0.08740284699963051, "train/tensor_act_model_layers_5_mlp/max_abs": 0.462890625, "train/tensor_act_model_layers_5_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5/norm": 2102.6028122912185, "train/tensor_act_model_layers_5/mean": 0.0012424290180206299, "train/tensor_act_model_layers_5/std": 0.22961531855631992, "train/tensor_act_model_layers_5/max_abs": 1.2421875, "train/tensor_act_model_layers_5/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_input_layernorm/norm": 9158.833007819172, "train/tensor_act_model_layers_6_input_layernorm/mean": 0.005686476826667785, "train/tensor_act_model_layers_6_input_layernorm/std": 1.0000025146593547, "train/tensor_act_model_layers_6_input_layernorm/max_abs": 5.125, "train/tensor_act_model_layers_6_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_q_proj/norm": 2024.70933516154, "train/tensor_act_model_layers_6_self_attn_q_proj/mean": 0.008039474487304688, "train/tensor_act_model_layers_6_self_attn_q_proj/std": 0.22082672623882046, "train/tensor_act_model_layers_6_self_attn_q_proj/max_abs": 1.1875, "train/tensor_act_model_layers_6_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_k_proj/norm": 2052.910089178976, "train/tensor_act_model_layers_6_self_attn_k_proj/mean": -0.01146697998046875, "train/tensor_act_model_layers_6_self_attn_k_proj/std": 0.22381880042885957, "train/tensor_act_model_layers_6_self_attn_k_proj/max_abs": 1.1171875, "train/tensor_act_model_layers_6_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_v_proj/norm": 2090.9327299066867, "train/tensor_act_model_layers_6_self_attn_v_proj/mean": 0.01435089111328125, "train/tensor_act_model_layers_6_self_attn_v_proj/std": 0.22772393664304802, "train/tensor_act_model_layers_6_self_attn_v_proj/max_abs": 1.265625, "train/tensor_act_model_layers_6_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_o_proj/norm": 248.66062033676886, "train/tensor_act_model_layers_6_self_attn_o_proj/mean": 0.0006154179573059082, "train/tensor_act_model_layers_6_self_attn_o_proj/std": 0.027142998303483507, "train/tensor_act_model_layers_6_self_attn_o_proj/max_abs": 0.2236328125, "train/tensor_act_model_layers_6_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn/norm": 248.66062033676886, "train/tensor_act_model_layers_6_self_attn/mean": 0.0006154179573059082, "train/tensor_act_model_layers_6_self_attn/std": 0.027142998303483507, "train/tensor_act_model_layers_6_self_attn/max_abs": 0.2236328125, "train/tensor_act_model_layers_6_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_post_attention_layernorm/norm": 9158.83203125751, "train/tensor_act_model_layers_6_post_attention_layernorm/mean": 0.008283138275146484, "train/tensor_act_model_layers_6_post_attention_layernorm/std": 1.0000041493962357, "train/tensor_act_model_layers_6_post_attention_layernorm/max_abs": 5.09375, "train/tensor_act_model_layers_6_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_mlp_up_proj/norm": 3565.7061851279122, "train/tensor_act_model_layers_6_mlp_up_proj/mean": -0.004791259765625, "train/tensor_act_model_layers_6_mlp_up_proj/std": 0.2246097779788673, "train/tensor_act_model_layers_6_mlp_up_proj/max_abs": 1.2265625, "train/tensor_act_model_layers_6_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_mlp_down_proj/norm": 821.2329713025825, "train/tensor_act_model_layers_6_mlp_down_proj/mean": 0.0001903623342514038, "train/tensor_act_model_layers_6_mlp_down_proj/std": 0.08963114505276222, "train/tensor_act_model_layers_6_mlp_down_proj/max_abs": 0.52734375, "train/tensor_act_model_layers_6_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_mlp/norm": 821.2329713025825, "train/tensor_act_model_layers_6_mlp/mean": 0.0001903623342514038, "train/tensor_act_model_layers_6_mlp/std": 0.08963114505276222, "train/tensor_act_model_layers_6_mlp/max_abs": 0.52734375, "train/tensor_act_model_layers_6_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6/norm": 2245.545601906354, "train/tensor_act_model_layers_6/mean": 0.0020475387573242188, "train/tensor_act_model_layers_6/std": 0.24524060481554763, "train/tensor_act_model_layers_6/max_abs": 1.515625, "train/tensor_act_model_layers_6/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_input_layernorm/norm": 9158.841613782926, "train/tensor_act_model_layers_7_input_layernorm/mean": 0.0080718994140625, "train/tensor_act_model_layers_7_input_layernorm/std": 1.0000036152712841, "train/tensor_act_model_layers_7_input_layernorm/max_abs": 5.5, "train/tensor_act_model_layers_7_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_q_proj/norm": 2094.243451175893, "train/tensor_act_model_layers_7_self_attn_q_proj/mean": -0.0008530020713806152, "train/tensor_act_model_layers_7_self_attn_q_proj/std": 0.2287007431041426, "train/tensor_act_model_layers_7_self_attn_q_proj/max_abs": 1.15625, "train/tensor_act_model_layers_7_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_k_proj/norm": 2070.246830624731, "train/tensor_act_model_layers_7_self_attn_k_proj/mean": -0.0004820823669433594, "train/tensor_act_model_layers_7_self_attn_k_proj/std": 0.22607542128992095, "train/tensor_act_model_layers_7_self_attn_k_proj/max_abs": 1.21875, "train/tensor_act_model_layers_7_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_v_proj/norm": 2034.9890479320418, "train/tensor_act_model_layers_7_self_attn_v_proj/mean": -0.005054473876953125, "train/tensor_act_model_layers_7_self_attn_v_proj/std": 0.22210886029447952, "train/tensor_act_model_layers_7_self_attn_v_proj/max_abs": 1.1953125, "train/tensor_act_model_layers_7_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_o_proj/norm": 244.24156031417377, "train/tensor_act_model_layers_7_self_attn_o_proj/mean": -0.0015883445739746094, "train/tensor_act_model_layers_7_self_attn_o_proj/std": 0.026614338566017588, "train/tensor_act_model_layers_7_self_attn_o_proj/max_abs": 0.228515625, "train/tensor_act_model_layers_7_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn/norm": 244.24156031417377, "train/tensor_act_model_layers_7_self_attn/mean": -0.0015883445739746094, "train/tensor_act_model_layers_7_self_attn/std": 0.026614338566017588, "train/tensor_act_model_layers_7_self_attn/max_abs": 0.228515625, "train/tensor_act_model_layers_7_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_post_attention_layernorm/norm": 9158.846984883812, "train/tensor_act_model_layers_7_post_attention_layernorm/mean": 0.0016190111637115479, "train/tensor_act_model_layers_7_post_attention_layernorm/std": 1.0000036257512501, "train/tensor_act_model_layers_7_post_attention_layernorm/max_abs": 5.40625, "train/tensor_act_model_layers_7_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_mlp_up_proj/norm": 3593.3060081563526, "train/tensor_act_model_layers_7_mlp_up_proj/mean": -0.00042695552110671997, "train/tensor_act_model_layers_7_mlp_up_proj/std": 0.22656268376185978, "train/tensor_act_model_layers_7_mlp_up_proj/max_abs": 1.2734375, "train/tensor_act_model_layers_7_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_mlp_down_proj/norm": 790.095908420183, "train/tensor_act_model_layers_7_mlp_down_proj/mean": 0.0020303726196289062, "train/tensor_act_model_layers_7_mlp_down_proj/std": 0.08627386209580751, "train/tensor_act_model_layers_7_mlp_down_proj/max_abs": 0.458984375, "train/tensor_act_model_layers_7_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_mlp/norm": 790.095908420183, "train/tensor_act_model_layers_7_mlp/mean": 0.0020303726196289062, "train/tensor_act_model_layers_7_mlp/std": 0.08627386209580751, "train/tensor_act_model_layers_7_mlp/max_abs": 0.458984375, "train/tensor_act_model_layers_7_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7/norm": 2390.9091821424804, "train/tensor_act_model_layers_7/mean": 0.0024900436401367188, "train/tensor_act_model_layers_7/std": 0.2612325815294042, "train/tensor_act_model_layers_7/max_abs": 1.5859375, "train/tensor_act_model_layers_7/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_input_layernorm/norm": 9158.859985368514, "train/tensor_act_model_layers_8_input_layernorm/mean": 0.009693145751953127, "train/tensor_act_model_layers_8_input_layernorm/std": 1.00000284127924, "train/tensor_act_model_layers_8_input_layernorm/max_abs": 5.5625, "train/tensor_act_model_layers_8_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_q_proj/norm": 2055.8883424244605, "train/tensor_act_model_layers_8_self_attn_q_proj/mean": -0.0019369125366210938, "train/tensor_act_model_layers_8_self_attn_q_proj/std": 0.22442729413672624, "train/tensor_act_model_layers_8_self_attn_q_proj/max_abs": 1.1484375, "train/tensor_act_model_layers_8_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_k_proj/norm": 2068.8739646072754, "train/tensor_act_model_layers_8_self_attn_k_proj/mean": -0.0036063194274902344, "train/tensor_act_model_layers_8_self_attn_k_proj/std": 0.22570981265453868, "train/tensor_act_model_layers_8_self_attn_k_proj/max_abs": 1.3203125, "train/tensor_act_model_layers_8_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_v_proj/norm": 2068.861311438254, "train/tensor_act_model_layers_8_self_attn_v_proj/mean": 0.008327484130859375, "train/tensor_act_model_layers_8_self_attn_v_proj/std": 0.22570992749941532, "train/tensor_act_model_layers_8_self_attn_v_proj/max_abs": 1.234375, "train/tensor_act_model_layers_8_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_o_proj/norm": 252.43754597084012, "train/tensor_act_model_layers_8_self_attn_o_proj/mean": 0.0007788538932800293, "train/tensor_act_model_layers_8_self_attn_o_proj/std": 0.02753775469306995, "train/tensor_act_model_layers_8_self_attn_o_proj/max_abs": 0.2490234375, "train/tensor_act_model_layers_8_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn/norm": 252.43754597084012, "train/tensor_act_model_layers_8_self_attn/mean": 0.0007788538932800293, "train/tensor_act_model_layers_8_self_attn/std": 0.02753775469306995, "train/tensor_act_model_layers_8_self_attn/max_abs": 0.2490234375, "train/tensor_act_model_layers_8_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_post_attention_layernorm/norm": 9158.848205577773, "train/tensor_act_model_layers_8_post_attention_layernorm/mean": 0.012630462646484375, "train/tensor_act_model_layers_8_post_attention_layernorm/std": 1.0000028783574142, "train/tensor_act_model_layers_8_post_attention_layernorm/max_abs": 5.5, "train/tensor_act_model_layers_8_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_mlp_up_proj/norm": 3580.865034948006, "train/tensor_act_model_layers_8_mlp_up_proj/mean": 0.00017113983631134033, "train/tensor_act_model_layers_8_mlp_up_proj/std": 0.2256475356138171, "train/tensor_act_model_layers_8_mlp_up_proj/max_abs": 1.3671875, "train/tensor_act_model_layers_8_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_mlp_down_proj/norm": 809.8662183360632, "train/tensor_act_model_layers_8_mlp_down_proj/mean": -0.0044384002685546875, "train/tensor_act_model_layers_8_mlp_down_proj/std": 0.08825753633051737, "train/tensor_act_model_layers_8_mlp_down_proj/max_abs": 0.515625, "train/tensor_act_model_layers_8_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_mlp/norm": 809.8662183360632, "train/tensor_act_model_layers_8_mlp/mean": -0.0044384002685546875, "train/tensor_act_model_layers_8_mlp/std": 0.08825753633051737, "train/tensor_act_model_layers_8_mlp/max_abs": 0.515625, "train/tensor_act_model_layers_8_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8/norm": 2548.227647097366, "train/tensor_act_model_layers_8/mean": -0.0011695027351379395, "train/tensor_act_model_layers_8/std": 0.27820098038329805, "train/tensor_act_model_layers_8/max_abs": 1.6171875, "train/tensor_act_model_layers_8/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8/frac_near_user_limit": 0.0, "train/tensor_act_model_norm/norm": 9158.86169434579, "train/tensor_act_model_norm/mean": -0.004282474517822266, "train/tensor_act_model_norm/std": 1.0000037655109555, "train/tensor_act_model_norm/max_abs": 5.40625, "train/tensor_act_model_norm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_norm/frac_near_user_limit": 0.0, "train/tensor_act_model/norm": 9158.86169434579, "train/tensor_act_model/mean": -0.004282474517822266, "train/tensor_act_model/std": 1.0000037655109555, "train/tensor_act_model/max_abs": 5.40625, "train/tensor_act_model/frac_near_dtype_limit": 0.0, "train/tensor_act_model/frac_near_user_limit": 0.0, "train/tensor_act_lm_head/norm": 11725.399748464048, "train/tensor_act_lm_head/mean": -0.002635955810546875, "train/tensor_act_lm_head/std": 0.22656260601017586, "train/tensor_act_lm_head/max_abs": 1.3046875, "train/tensor_act_lm_head/frac_near_dtype_limit": 0.0, "train/tensor_act_lm_head/frac_near_user_limit": 0.0, "train/tensor_act_/norm": 33.30561320829714, "train/tensor_act_/mean": 8.326403200626372, "train/tensor_act_/std": 0.0, "train/tensor_act_/max_abs": 8.328570365905762, "train/tensor_act_/frac_near_dtype_limit": 0.0, "train/tensor_act_/frac_near_user_limit": 0.0, "train/tensor_grad_model_norm_weight/norm": 0.04188363882885196, "train/tensor_grad_model_norm_weight/mean": 0.0002678632736206055, "train/tensor_grad_model_norm_weight/std": 0.0008890040181361811, "train/tensor_grad_model_norm_weight/max_abs": 0.0028839111328125, "train/tensor_grad_model_norm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_norm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/norm": 0.6567039736043584, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/mean": -9.6810981631279e-07, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/std": 0.0007410135862090632, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/max_abs": 0.006195068359375, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/norm": 0.6515465164968496, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/mean": 8.295464795082808e-07, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/std": 0.000734766420680706, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/max_abs": 0.0072021484375, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/norm": 0.01359782430549884, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/mean": -2.0615756511688232e-05, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/std": 0.0003009088541924834, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/max_abs": 0.0018768310546875, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/norm": 0.2942602555165827, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/mean": 1.780688762664795e-06, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/std": 0.0005747273290534046, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/max_abs": 0.0050048828125, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/norm": 0.31477405922147494, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/mean": -6.610644049942493e-07, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/std": 0.0006147932948693195, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/max_abs": 0.006011962890625, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/norm": 0.001750753845104515, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/mean": -2.6364432414993644e-08, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/std": 3.419446456839792e-06, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/max_abs": 4.00543212890625e-05, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/norm": 0.0017998297966950977, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/mean": 1.907392288558185e-08, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/std": 3.5152944340062413e-06, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/max_abs": 3.361701965332031e-05, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_input_layernorm_weight/norm": 0.0069292377166829105, "train/tensor_grad_model_layers_8_input_layernorm_weight/mean": -4.675639502238482e-07, "train/tensor_grad_model_layers_8_input_layernorm_weight/std": 0.00015373373291674794, "train/tensor_grad_model_layers_8_input_layernorm_weight/max_abs": 0.000705718994140625, "train/tensor_grad_model_layers_8_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/norm": 0.7141149589250648, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/mean": -2.352462615817785e-07, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/std": 0.0008054169332475143, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/max_abs": 0.006134033203125, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/norm": 0.6564795682913401, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/mean": -3.329805622342974e-07, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/std": 0.0007407871686613992, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/max_abs": 0.00848388671875, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/norm": 0.012920870122618318, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/mean": 3.403838491067289e-07, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/std": 0.00028670502751474385, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/max_abs": 0.00121307373046875, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/norm": 0.3028268980337274, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/mean": -1.289532519876957e-06, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/std": 0.0005914590815408416, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/max_abs": 0.004180908203125, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/norm": 0.3206335180389203, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/mean": -1.4007091522216797e-06, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/std": 0.0006262375418262379, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/max_abs": 0.004974365234375, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/norm": 0.0021741666189685196, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/mean": -3.8708094507455826e-08, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/std": 4.246421515060917e-06, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/max_abs": 5.364418029785156e-05, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/norm": 0.002567798513375777, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/mean": -3.0499904823955144e-09, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/std": 5.0152389834807915e-06, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/max_abs": 6.437301635742188e-05, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_input_layernorm_weight/norm": 0.007024306935671228, "train/tensor_grad_model_layers_7_input_layernorm_weight/mean": 2.321600914001465e-05, "train/tensor_grad_model_layers_7_input_layernorm_weight/std": 0.00015395906571011544, "train/tensor_grad_model_layers_7_input_layernorm_weight/max_abs": 0.000885009765625, "train/tensor_grad_model_layers_7_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/norm": 0.7438265720988673, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/mean": -2.0747538655996327e-06, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/std": 0.0008384931686117645, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/max_abs": 0.005950927734375, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/norm": 0.6993919456413047, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/mean": -3.5176053643226624e-06, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/std": 0.0007891246411385598, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/max_abs": 0.007659912109375, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/norm": 0.01472038244348852, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/mean": 8.637085556983948e-06, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/std": 0.0003264389268301327, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/max_abs": 0.00183868408203125, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/norm": 0.34701616318845746, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/mean": 7.051974534988403e-06, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/std": 0.0006777664703541301, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/max_abs": 0.005035400390625, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/norm": 0.33140774695504827, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/mean": 1.7903803382068872e-06, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/std": 0.0006472813368124866, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/max_abs": 0.005767822265625, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/norm": 0.0022034954129965608, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/mean": -1.4113084034761412e-08, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/std": 4.303716816398566e-06, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/max_abs": 6.198883056640625e-05, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/norm": 0.0021091067565236657, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/mean": -6.679329089820386e-08, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/std": 4.119352436859102e-06, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/max_abs": 3.933906555175781e-05, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_input_layernorm_weight/norm": 0.007204596862996378, "train/tensor_grad_model_layers_6_input_layernorm_weight/mean": 1.7270445823669434e-05, "train/tensor_grad_model_layers_6_input_layernorm_weight/std": 0.0001589390006203737, "train/tensor_grad_model_layers_6_input_layernorm_weight/max_abs": 0.0006866455078125, "train/tensor_grad_model_layers_6_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/norm": 0.747758695306347, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/mean": -3.4459662856534123e-07, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/std": 0.000843754609081815, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/max_abs": 0.0072021484375, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/norm": 0.7760631037744542, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/mean": -2.996530383825302e-06, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/std": 0.0008756717372626727, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/max_abs": 0.00830078125, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/norm": 0.017407784045094903, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/mean": 3.597140312194824e-05, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/std": 0.0003842433628006087, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/max_abs": 0.00136566162109375, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/norm": 0.41318894853685667, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/mean": 2.4502514861524105e-07, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/std": 0.0008070099821470191, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/max_abs": 0.005706787109375, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/norm": 0.37033420933695094, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/mean": -3.3291871659457684e-07, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/std": 0.0007233092280854832, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/max_abs": 0.007568359375, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/norm": 0.002440637228965039, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/mean": -3.9814040064811707e-08, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/std": 4.766879032479843e-06, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/max_abs": 6.389617919921875e-05, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/norm": 0.002526216840896826, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/mean": -3.939203452318907e-08, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/std": 4.934022192967669e-06, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/max_abs": 5.054473876953125e-05, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_input_layernorm_weight/norm": 0.0076356404487144145, "train/tensor_grad_model_layers_5_input_layernorm_weight/mean": 1.4121178537607193e-07, "train/tensor_grad_model_layers_5_input_layernorm_weight/std": 0.00016932095066547807, "train/tensor_grad_model_layers_5_input_layernorm_weight/max_abs": 0.000720977783203125, "train/tensor_grad_model_layers_5_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/norm": 0.882807638779481, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/mean": 5.54340658709407e-07, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/std": 0.0009956603127519643, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/max_abs": 0.0081787109375, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/norm": 0.9121088522147858, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/mean": -5.8319419622421265e-06, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/std": 0.0010288251542380133, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/max_abs": 0.006866455078125, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/norm": 0.01801550628411251, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/mean": 2.5529414415359497e-05, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/std": 0.0003992425801541201, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/max_abs": 0.00174713134765625, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/norm": 0.46096025830998805, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/mean": -1.1819647625088692e-06, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/std": 0.0009003131973670483, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/max_abs": 0.00927734375, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/norm": 0.474326971987658, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/mean": -3.4016557037830353e-06, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/std": 0.000926420855110026, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/max_abs": 0.006683349609375, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/norm": 0.002494692435009133, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/mean": 6.381014827638865e-08, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/std": 4.872465469938096e-06, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/max_abs": 4.935264587402344e-05, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/norm": 0.0026511816667665676, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/mean": -2.6222551241517067e-08, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/std": 5.178094080596203e-06, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/max_abs": 4.744529724121094e-05, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_input_layernorm_weight/norm": 0.009940688270318328, "train/tensor_grad_model_layers_4_input_layernorm_weight/mean": -1.693516969680786e-05, "train/tensor_grad_model_layers_4_input_layernorm_weight/std": 0.00021997906412640544, "train/tensor_grad_model_layers_4_input_layernorm_weight/max_abs": 0.00101470947265625, "train/tensor_grad_model_layers_4_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/norm": 1.0388073141763723, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/mean": 1.942069502547383e-06, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/std": 0.0011718623522265713, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/max_abs": 0.0103759765625, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/norm": 1.0325180118643056, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/mean": 2.0922016119584437e-06, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/std": 0.00116522222764922, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/max_abs": 0.0091552734375, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/norm": 0.020544972132187877, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/mean": -7.319450378417969e-05, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/std": 0.0004498627859734642, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/max_abs": 0.00141143798828125, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/norm": 0.6386494763847563, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/mean": 5.392357707023621e-06, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/std": 0.0012478367145385219, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/max_abs": 0.008544921875, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/norm": 0.6001999521867529, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/mean": 2.564862370491028e-06, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/std": 0.001172265692604121, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/max_abs": 0.01031494140625, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/norm": 0.0040055756316137005, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/mean": 1.5011755749583244e-07, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/std": 7.821619938549773e-06, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/max_abs": 0.00010395050048828125, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/norm": 0.00361869831233591, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/mean": 1.5302794054150581e-07, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/std": 7.067774610758166e-06, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/max_abs": 6.008148193359375e-05, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_input_layernorm_weight/norm": 0.01193233402177522, "train/tensor_grad_model_layers_3_input_layernorm_weight/mean": -2.933293581008911e-05, "train/tensor_grad_model_layers_3_input_layernorm_weight/std": 0.0002630412620747739, "train/tensor_grad_model_layers_3_input_layernorm_weight/max_abs": 0.0011444091796875, "train/tensor_grad_model_layers_3_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/norm": 1.3397569099955633, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/mean": -5.597248673439026e-06, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/std": 0.0015105998717445585, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/max_abs": 0.0106201171875, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/norm": 1.3695431714754949, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/mean": 5.347654223442078e-06, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/std": 0.0015439644136133954, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/max_abs": 0.01214599609375, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/norm": 0.02947732664685429, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/mean": -4.059821367263794e-05, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/std": 0.0006524139082055273, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/max_abs": 0.0024566650390625, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/norm": 0.7961176845258154, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/mean": 2.1919608116149902e-05, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/std": 0.0015549180956571612, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/max_abs": 0.01141357421875, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/norm": 0.8217354195429605, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/mean": 4.168599843978883e-06, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/std": 0.001604952290437103, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/max_abs": 0.0146484375, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/norm": 0.003785946264460507, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/mean": -1.1560132406884804e-08, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/std": 7.394430060790757e-06, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/max_abs": 7.200241088867188e-05, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/norm": 0.00380295089392798, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/mean": -1.0211692824668717e-08, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/std": 7.427640735439923e-06, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/max_abs": 6.818771362304688e-05, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_input_layernorm_weight/norm": 0.015525433584795202, "train/tensor_grad_model_layers_2_input_layernorm_weight/mean": -1.8913298845291138e-05, "train/tensor_grad_model_layers_2_input_layernorm_weight/std": 0.00034395847835876135, "train/tensor_grad_model_layers_2_input_layernorm_weight/max_abs": 0.00156402587890625, "train/tensor_grad_model_layers_2_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/norm": 1.6028886468373764, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/mean": -2.7641654014587402e-06, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/std": 0.0018071383851468192, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/max_abs": 0.01165771484375, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/norm": 1.6307447564512847, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/mean": 6.681308150291443e-06, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/std": 0.0018395991081736921, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/max_abs": 0.01409912109375, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/norm": 0.030599392894608033, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/mean": 8.785724639892578e-05, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/std": 0.0006726479946911412, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/max_abs": 0.002288818359375, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/norm": 0.9184200395012729, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/mean": 8.452334441244602e-07, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/std": 0.001793789573474741, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/max_abs": 0.01202392578125, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/norm": 0.9715736829740469, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/mean": 9.313225746154785e-06, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/std": 0.0018976140795652556, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/max_abs": 0.0179443359375, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/norm": 0.004660286237673629, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/mean": 2.700289769563824e-09, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/std": 9.102143103533235e-06, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/max_abs": 0.00010967254638671875, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/norm": 0.005419593448826403, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/mean": -2.140740207323688e-08, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/std": 1.0585167823149843e-05, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/max_abs": 0.00010013580322265625, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_input_layernorm_weight/norm": 0.01827004084958102, "train/tensor_grad_model_layers_1_input_layernorm_weight/mean": 6.294751074165106e-06, "train/tensor_grad_model_layers_1_input_layernorm_weight/std": 0.0004053867194984944, "train/tensor_grad_model_layers_1_input_layernorm_weight/max_abs": 0.0017547607421875, "train/tensor_grad_model_layers_1_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/norm": 2.1033224798165313, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/mean": -2.6656780391931534e-06, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/std": 0.002371735952388378, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/max_abs": 0.0167236328125, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/norm": 2.220554531363239, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/mean": -1.013778273772914e-06, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/std": 0.002505295719311074, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/max_abs": 0.0220947265625, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/norm": 0.047405460099621974, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/mean": -3.2326788641512394e-06, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/std": 0.0010510953850146644, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/max_abs": 0.005035400390625, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/norm": 2.0027208893636077, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/mean": 1.0168878361582756e-07, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/std": 0.003911565519785202, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/max_abs": 0.0361328125, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/norm": 1.942051617141671, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/mean": 6.8140216171741486e-06, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/std": 0.003793071416533045, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/max_abs": 0.0284423828125, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/norm": 0.016645681436829967, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/mean": 3.5588163882493973e-07, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/std": 3.251112734692224e-05, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/max_abs": 0.000301361083984375, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/norm": 0.018046961449750452, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/mean": -3.7724385038018227e-07, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/std": 3.524805191464278e-05, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/max_abs": 0.000621795654296875, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_input_layernorm_weight/norm": 0.03405985944469724, "train/tensor_grad_model_layers_0_input_layernorm_weight/mean": -7.338821887969971e-05, "train/tensor_grad_model_layers_0_input_layernorm_weight/std": 0.000752159456492524, "train/tensor_grad_model_layers_0_input_layernorm_weight/max_abs": 0.003204345703125, "train/tensor_grad_model_layers_0_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_embed_tokens_weight/norm": 3.6260774260900717, "train/tensor_grad_model_embed_tokens_weight/mean": 5.347654223442078e-06, "train/tensor_grad_model_embed_tokens_weight/std": 0.0012535215353413787, "train/tensor_grad_model_embed_tokens_weight/max_abs": 0.1865234375, "train/tensor_grad_model_embed_tokens_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_embed_tokens_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_embed_tokens_weight/norm": 14.4375, "train/tensor_param_model_embed_tokens_weight/mean": 4.220008850097656e-05, "train/tensor_param_model_embed_tokens_weight/std": 0.02001953125, "train/tensor_param_model_embed_tokens_weight/max_abs": 0.0966796875, "train/tensor_param_model_embed_tokens_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_embed_tokens_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/mean": -0.00022792816162109375, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/max_abs": 0.083984375, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/mean": 0.00017547607421875, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/max_abs": 0.08349609375, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/mean": 0.00013065338134765625, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/max_abs": 0.0830078125, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/mean": -3.933906555175781e-05, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/max_abs": 0.08642578125, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_0_mlp_up_proj_weight/mean": -3.5762786865234375e-05, "train/tensor_param_model_layers_0_mlp_up_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_0_mlp_up_proj_weight/max_abs": 0.08984375, "train/tensor_param_model_layers_0_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_mlp_down_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_0_mlp_down_proj_weight/mean": 6.818771362304688e-05, "train/tensor_param_model_layers_0_mlp_down_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_0_mlp_down_proj_weight/max_abs": 0.08642578125, "train/tensor_param_model_layers_0_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_0_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_0_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_0_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_0_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/mean": 3.361701965332031e-05, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/max_abs": 0.08447265625, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/mean": -2.8252601623535156e-05, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/max_abs": 0.08837890625, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/mean": -0.0002040863037109375, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/max_abs": 0.08056640625, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/mean": 2.6673078536987305e-06, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/max_abs": 0.076171875, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_1_mlp_up_proj_weight/mean": -6.628036499023438e-05, "train/tensor_param_model_layers_1_mlp_up_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_1_mlp_up_proj_weight/max_abs": 0.080078125, "train/tensor_param_model_layers_1_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_mlp_down_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_1_mlp_down_proj_weight/mean": -5.340576171875e-05, "train/tensor_param_model_layers_1_mlp_down_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_1_mlp_down_proj_weight/max_abs": 0.07958984375, "train/tensor_param_model_layers_1_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_1_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_1_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_1_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_1_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/mean": -0.000156402587890625, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/max_abs": 0.0869140625, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/mean": -3.6209821701049805e-06, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/max_abs": 0.08349609375, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/mean": 2.7179718017578125e-05, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/max_abs": 0.08544921875, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/mean": -4.8160552978515625e-05, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/max_abs": 0.08447265625, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_2_mlp_up_proj_weight/mean": 3.7670135498046875e-05, "train/tensor_param_model_layers_2_mlp_up_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_2_mlp_up_proj_weight/max_abs": 0.080078125, "train/tensor_param_model_layers_2_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_mlp_down_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_2_mlp_down_proj_weight/mean": -0.00014400482177734375, "train/tensor_param_model_layers_2_mlp_down_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_2_mlp_down_proj_weight/max_abs": 0.09130859375, "train/tensor_param_model_layers_2_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_2_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_2_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_2_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_2_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/mean": -9.632110595703125e-05, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/max_abs": 0.0830078125, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/mean": 7.05718994140625e-05, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/max_abs": 0.0810546875, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/mean": 2.518296241760254e-06, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/max_abs": 0.080078125, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/mean": -0.00020885467529296875, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/max_abs": 0.07958984375, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_3_mlp_up_proj_weight/mean": -0.00010204315185546875, "train/tensor_param_model_layers_3_mlp_up_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_3_mlp_up_proj_weight/max_abs": 0.083984375, "train/tensor_param_model_layers_3_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_mlp_down_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_3_mlp_down_proj_weight/mean": -0.00019931793212890625, "train/tensor_param_model_layers_3_mlp_down_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_3_mlp_down_proj_weight/max_abs": 0.08544921875, "train/tensor_param_model_layers_3_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_3_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_3_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_3_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_3_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/mean": -8.153915405273438e-05, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/max_abs": 0.0869140625, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/mean": 5.8650970458984375e-05, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/max_abs": 0.078125, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/norm": 2.546875, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/mean": -8.440017700195312e-05, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/max_abs": 0.0810546875, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/mean": -9.775161743164062e-05, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/max_abs": 0.091796875, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_4_mlp_up_proj_weight/mean": -1.728534698486328e-05, "train/tensor_param_model_layers_4_mlp_up_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_4_mlp_up_proj_weight/max_abs": 0.08740234375, "train/tensor_param_model_layers_4_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_mlp_down_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_4_mlp_down_proj_weight/mean": 4.291534423828125e-05, "train/tensor_param_model_layers_4_mlp_down_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_4_mlp_down_proj_weight/max_abs": 0.0888671875, "train/tensor_param_model_layers_4_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_4_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_4_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_4_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_4_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/mean": -0.00011014938354492188, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/max_abs": 0.08056640625, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/mean": -6.198883056640625e-05, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/max_abs": 0.0859375, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/norm": 2.546875, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/mean": -0.0001392364501953125, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/max_abs": 0.09033203125, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/mean": 0.00015544891357421875, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/max_abs": 0.0908203125, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_5_mlp_up_proj_weight/mean": -0.0001354217529296875, "train/tensor_param_model_layers_5_mlp_up_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_5_mlp_up_proj_weight/max_abs": 0.09033203125, "train/tensor_param_model_layers_5_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_mlp_down_proj_weight/norm": 4.40625, "train/tensor_param_model_layers_5_mlp_down_proj_weight/mean": 0.00016880035400390625, "train/tensor_param_model_layers_5_mlp_down_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_5_mlp_down_proj_weight/max_abs": 0.087890625, "train/tensor_param_model_layers_5_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_5_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_5_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_5_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_5_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/norm": 2.53125, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/mean": 1.7762184143066406e-05, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/std": 0.019775390625, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/max_abs": 0.08349609375, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/mean": 0.00016307830810546875, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/max_abs": 0.07958984375, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/mean": -0.0002498626708984375, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/max_abs": 0.0791015625, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/norm": 2.546875, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/mean": 0.00021076202392578125, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/max_abs": 0.0791015625, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_6_mlp_up_proj_weight/mean": 8.916854858398438e-05, "train/tensor_param_model_layers_6_mlp_up_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_6_mlp_up_proj_weight/max_abs": 0.08056640625, "train/tensor_param_model_layers_6_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_mlp_down_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_6_mlp_down_proj_weight/mean": 0.000102996826171875, "train/tensor_param_model_layers_6_mlp_down_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_6_mlp_down_proj_weight/max_abs": 0.0830078125, "train/tensor_param_model_layers_6_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_6_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_6_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_6_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_6_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/mean": -0.0002689361572265625, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/max_abs": 0.07861328125, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/mean": 0.00031280517578125, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/max_abs": 0.08056640625, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/mean": -0.00011873245239257812, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/max_abs": 0.08251953125, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/norm": 2.578125, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/mean": -8.296966552734375e-05, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/std": 0.0201416015625, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/max_abs": 0.078125, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_7_mlp_up_proj_weight/mean": -8.249282836914062e-05, "train/tensor_param_model_layers_7_mlp_up_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_7_mlp_up_proj_weight/max_abs": 0.0830078125, "train/tensor_param_model_layers_7_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_mlp_down_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_7_mlp_down_proj_weight/mean": 2.753734588623047e-05, "train/tensor_param_model_layers_7_mlp_down_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_7_mlp_down_proj_weight/max_abs": 0.09033203125, "train/tensor_param_model_layers_7_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_7_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_7_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_7_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_7_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/norm": 2.546875, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/mean": 1.0609626770019531e-05, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/max_abs": 0.08154296875, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/mean": 8.630752563476562e-05, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/max_abs": 0.0810546875, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/norm": 2.53125, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/mean": -0.0002593994140625, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/std": 0.019775390625, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/max_abs": 0.07958984375, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/mean": -1.3589859008789062e-05, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/max_abs": 0.07666015625, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_mlp_up_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_8_mlp_up_proj_weight/mean": -0.00018310546875, "train/tensor_param_model_layers_8_mlp_up_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_8_mlp_up_proj_weight/max_abs": 0.1025390625, "train/tensor_param_model_layers_8_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_mlp_down_proj_weight/norm": 4.40625, "train/tensor_param_model_layers_8_mlp_down_proj_weight/mean": -0.0002040863037109375, "train/tensor_param_model_layers_8_mlp_down_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_8_mlp_down_proj_weight/max_abs": 0.0830078125, "train/tensor_param_model_layers_8_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_8_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_8_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_8_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_8_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_norm_weight/norm": 11.3125, "train/tensor_param_model_norm_weight/mean": 1.0, "train/tensor_param_model_norm_weight/std": 0.0, "train/tensor_param_model_norm_weight/max_abs": 1.0, "train/tensor_param_model_norm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_norm_weight/frac_near_user_limit": 0.0} +{"step": 40, "epoch": 0.053926525109538256, "timestamp": 1786254905.1471906, "loss": 102.05034790039062, "grad_norm": 24.625, "learning_rate": 0.0005, "train/total_time_seconds": 41.32444467023015, "train/time_per_step_avg": 1.0331111167557538, "train/epoch_time_elapsed": 80.11485634371638, "train/estimated_remaining_minutes": 12.225148214943088} +{"step": 50, "epoch": 0.06740815638692282, "timestamp": 1786254932.9985719, "eval_loss": 5.665860652923584, "eval_runtime": 9.5524, "eval_samples_per_second": 997.346, "eval_steps_per_second": 12.562, "train/total_time_seconds": 50.11429492011666, "train/time_per_step_avg": 1.0022858984023333, "train/epoch_time_elapsed": 107.96623866260052, "train/estimated_remaining_minutes": 11.693335481360554} +{"step": 60, "epoch": 0.08088978766430738, "timestamp": 1786254951.3890784, "loss": 90.97202758789062, "grad_norm": 18.125, "learning_rate": 0.0005, "train/total_time_seconds": 58.94606887176633, "train/time_per_step_avg": 0.9824344811961054, "train/epoch_time_elapsed": 126.35674532875419, "train/estimated_remaining_minutes": 11.297996533755214} +{"step": 80, "epoch": 0.10785305021907651, "timestamp": 1786254989.0803852, "loss": 83.10302734375, "grad_norm": 40.75, "learning_rate": 0.0005, "train/total_time_seconds": 77.25812346488237, "train/time_per_step_avg": 0.9657265433110297, "train/epoch_time_elapsed": 164.04805217683315, "train/estimated_remaining_minutes": 10.783946400306498} +{"step": 100, "epoch": 0.13481631277384565, "timestamp": 1786255023.7892716, "loss": 77.51190185546875, "grad_norm": 29.625, "learning_rate": 0.0005, "train/total_time_seconds": 92.4002431370318, "train/time_per_step_avg": 0.9240024313703179, "train/epoch_time_elapsed": 198.7569378837943, "train/estimated_remaining_minutes": 10.01002633984511} +{"step": 100, "epoch": 0.13481631277384565, "timestamp": 1786255032.9020689, "eval_loss": 4.689935684204102, "eval_runtime": 9.1111, "eval_samples_per_second": 1045.652, "eval_steps_per_second": 13.171, "train/total_time_seconds": 92.4002431370318, "train/time_per_step_avg": 0.9240024313703179, "train/epoch_time_elapsed": 207.8697351180017, "train/estimated_remaining_minutes": 10.01002633984511} +{"step": 120, "epoch": 0.16177957532861476, "timestamp": 1786255064.323373, "loss": 73.29612426757812, "grad_norm": 19.5, "learning_rate": 0.0005, "train/total_time_seconds": 104.50122643262148, "train/time_per_step_avg": 0.812197428420186, "train/epoch_time_elapsed": 239.29103926569223, "train/estimated_remaining_minutes": 9.14385731285438} +{"step": 140, "epoch": 0.1887428378833839, "timestamp": 1786255101.9086154, "loss": 70.37640380859375, "grad_norm": 25.25, "learning_rate": 0.0005, "train/total_time_seconds": 122.9972688369453, "train/time_per_step_avg": 0.8167282416671514, "train/epoch_time_elapsed": 276.87628524005413, "train/estimated_remaining_minutes": 8.931944522682931} +{"step": 150, "epoch": 0.20222446916076844, "timestamp": 1786255130.0236912, "eval_loss": 4.263797760009766, "eval_runtime": 9.4931, "eval_samples_per_second": 1003.568, "eval_steps_per_second": 12.641, "train/total_time_seconds": 131.93278025463223, "train/time_per_step_avg": 0.8181848533451557, "train/epoch_time_elapsed": 304.9913580864668, "train/estimated_remaining_minutes": 8.795518683642149} +{"step": 160, "epoch": 0.21570610043815303, "timestamp": 1786255148.6720192, "loss": 68.2427978515625, "grad_norm": 14.625, "learning_rate": 0.0005, "train/total_time_seconds": 141.14684723690152, "train/time_per_step_avg": 0.822007783651352, "train/epoch_time_elapsed": 323.6396882608533, "train/estimated_remaining_minutes": 8.674649986434572} +{"step": 180, "epoch": 0.24266936299292213, "timestamp": 1786255185.931212, "loss": 66.13766479492188, "grad_norm": 13.0625, "learning_rate": 0.0005, "train/total_time_seconds": 159.10167576372623, "train/time_per_step_avg": 0.8184355229884386, "train/epoch_time_elapsed": 360.8988819755614, "train/estimated_remaining_minutes": 8.397032887529996} +{"step": 200, "epoch": 0.2696326255476913, "timestamp": 1786255222.6511283, "loss": 63.81178588867188, "grad_norm": 18.5, "learning_rate": 0.0005, "train/total_time_seconds": 176.25136033818126, "train/time_per_step_avg": 0.8385111720114946, "train/epoch_time_elapsed": 397.61879746988416, "train/estimated_remaining_minutes": 8.078187348833307} +{"step": 200, "epoch": 0.2696326255476913, "timestamp": 1786255232.0393953, "eval_loss": 3.9343974590301514, "eval_runtime": 9.3868, "eval_samples_per_second": 1014.939, "eval_steps_per_second": 12.784, "train/total_time_seconds": 176.25136033818126, "train/time_per_step_avg": 0.8385111720114946, "train/epoch_time_elapsed": 407.00706396251917, "train/estimated_remaining_minutes": 8.078187348833307} +{"step": 220, "epoch": 0.2965958881024604, "timestamp": 1786255269.9923177, "loss": 62.16768188476563, "grad_norm": 16.125, "learning_rate": 0.0005, "train/total_time_seconds": 194.7538175098598, "train/time_per_step_avg": 0.9025259107723832, "train/epoch_time_elapsed": 444.9599856287241, "train/estimated_remaining_minutes": 7.819660854562553} +{"step": 240, "epoch": 0.3235591506572295, "timestamp": 1786255307.355241, "loss": 61.1105712890625, "grad_norm": 21.25, "learning_rate": 0.0005, "train/total_time_seconds": 212.70383574068546, "train/time_per_step_avg": 0.8970656690374017, "train/epoch_time_elapsed": 482.3229112736881, "train/estimated_remaining_minutes": 7.5332608491492765} +{"step": 250, "epoch": 0.33704078193461406, "timestamp": 1786255336.121311, "eval_loss": 3.748317241668701, "eval_runtime": 9.4777, "eval_samples_per_second": 1005.204, "eval_steps_per_second": 12.661, "train/total_time_seconds": 222.2051606848836, "train/time_per_step_avg": 0.9027238043025136, "train/epoch_time_elapsed": 511.08898059278727, "train/estimated_remaining_minutes": 7.40683868949612} +{"step": 260, "epoch": 0.3505224132119987, "timestamp": 1786255353.3154516, "loss": 60.05653686523438, "grad_norm": 42.25, "learning_rate": 0.0005, "train/total_time_seconds": 229.90829008817673, "train/time_per_step_avg": 0.8876144285127521, "train/epoch_time_elapsed": 528.2831210829318, "train/estimated_remaining_minutes": 7.221478342513243} +{"step": 280, "epoch": 0.3774856757667678, "timestamp": 1786255390.8281882, "loss": 59.25806884765625, "grad_norm": 27.5, "learning_rate": 0.0005, "train/total_time_seconds": 248.29544523730874, "train/time_per_step_avg": 0.8919376947358251, "train/epoch_time_elapsed": 565.7958568930626, "train/estimated_remaining_minutes": 6.9463606703294705} +{"step": 300, "epoch": 0.4044489383215369, "timestamp": 1786255428.5006192, "loss": 58.334844970703124, "grad_norm": 14.375, "learning_rate": 0.0005, "train/total_time_seconds": 266.7115136086941, "train/time_per_step_avg": 0.9046015327051282, "train/epoch_time_elapsed": 603.468289192766, "train/estimated_remaining_minutes": 6.667787840217352} +{"step": 300, "epoch": 0.4044489383215369, "timestamp": 1786255438.167693, "eval_loss": 3.6137855052948, "eval_runtime": 9.6654, "eval_samples_per_second": 985.685, "eval_steps_per_second": 12.415, "train/total_time_seconds": 266.7115136086941, "train/time_per_step_avg": 0.9046015327051282, "train/epoch_time_elapsed": 613.1353628858924, "train/estimated_remaining_minutes": 6.667787840217352} +{"step": 320, "epoch": 0.43141220087630605, "timestamp": 1786255475.8042827, "loss": 57.341180419921876, "grad_norm": 32.75, "learning_rate": 0.0005, "train/total_time_seconds": 284.8533755801618, "train/time_per_step_avg": 0.9009955807030201, "train/epoch_time_elapsed": 650.7719515115023, "train/estimated_remaining_minutes": 6.379528723930707} +{"step": 340, "epoch": 0.45837546343107516, "timestamp": 1786255511.6513586, "loss": 56.699591064453124, "grad_norm": 12.5625, "learning_rate": 0.0005, "train/total_time_seconds": 301.7134180255234, "train/time_per_step_avg": 0.8900958228483796, "train/epoch_time_elapsed": 686.6190287470818, "train/estimated_remaining_minutes": 6.0638481073757164} +{"step": 350, "epoch": 0.4718570947084597, "timestamp": 1786255540.1244693, "eval_loss": 3.492727518081665, "eval_runtime": 9.4437, "eval_samples_per_second": 1008.824, "eval_steps_per_second": 12.707, "train/total_time_seconds": 311.0745892226696, "train/time_per_step_avg": 0.8886942853778601, "train/epoch_time_elapsed": 715.0921384617686, "train/estimated_remaining_minutes": 5.925230270907992} +{"step": 360, "epoch": 0.48533872598584427, "timestamp": 1786255558.9333723, "loss": 55.840753173828126, "grad_norm": 21.5, "learning_rate": 0.0005, "train/total_time_seconds": 320.1871528066695, "train/time_per_step_avg": 0.9027886271849275, "train/epoch_time_elapsed": 733.9010420665145, "train/estimated_remaining_minutes": 5.781156925675977} +{"step": 380, "epoch": 0.5123019885406134, "timestamp": 1786255596.6807182, "loss": 55.377203369140624, "grad_norm": 14.5625, "learning_rate": 0.0005, "train/total_time_seconds": 338.4666022621095, "train/time_per_step_avg": 0.9017115702480077, "train/epoch_time_elapsed": 771.6483867913485, "train/estimated_remaining_minutes": 5.492659773551777} +{"step": 400, "epoch": 0.5392652510953826, "timestamp": 1786255633.9909048, "loss": 54.936090087890626, "grad_norm": 14.6875, "learning_rate": 0.0005, "train/total_time_seconds": 356.61116948351264, "train/time_per_step_avg": 0.8989965587481856, "train/epoch_time_elapsed": 808.9585740156472, "train/estimated_remaining_minutes": 5.200579554967892} +{"step": 400, "epoch": 0.5392652510953826, "timestamp": 1786255643.176145, "eval_loss": 3.41583251953125, "eval_runtime": 9.1837, "eval_samples_per_second": 1037.382, "eval_steps_per_second": 13.067, "train/total_time_seconds": 356.61116948351264, "train/time_per_step_avg": 0.8989965587481856, "train/epoch_time_elapsed": 818.1438147202134, "train/estimated_remaining_minutes": 5.200579554967892} +{"step": 420, "epoch": 0.5662285136501517, "timestamp": 1786255680.8474326, "loss": 54.31259765625, "grad_norm": 22.0, "learning_rate": 0.0005, "train/total_time_seconds": 374.4849713034928, "train/time_per_step_avg": 0.8963159572333097, "train/epoch_time_elapsed": 855.8150995858014, "train/estimated_remaining_minutes": 4.903969862307644} +{"step": 440, "epoch": 0.5931917762049208, "timestamp": 1786255718.4085093, "loss": 53.894476318359374, "grad_norm": 22.5, "learning_rate": 0.0005, "train/total_time_seconds": 392.4683515615761, "train/time_per_step_avg": 0.9075493353605271, "train/epoch_time_elapsed": 893.3761757835746, "train/estimated_remaining_minutes": 4.608529885760932} +{"step": 450, "epoch": 0.6066734074823054, "timestamp": 1786255746.9943676, "eval_loss": 3.3446545600891113, "eval_runtime": 9.6871, "eval_samples_per_second": 983.477, "eval_steps_per_second": 12.388, "train/total_time_seconds": 401.84830053150654, "train/time_per_step_avg": 0.9077371130883694, "train/epoch_time_elapsed": 921.962036266923, "train/estimated_remaining_minutes": 4.464981117016739} +{"step": 460, "epoch": 0.6201550387596899, "timestamp": 1786255765.591648, "loss": 53.53094482421875, "grad_norm": 21.875, "learning_rate": 0.0005, "train/total_time_seconds": 410.88976757600904, "train/time_per_step_avg": 0.9070261476933956, "train/epoch_time_elapsed": 940.5593165978789, "train/estimated_remaining_minutes": 4.317320021631979} +{"step": 480, "epoch": 0.647118301314459, "timestamp": 1786255801.5716844, "loss": 53.14410400390625, "grad_norm": 20.625, "learning_rate": 0.0005, "train/total_time_seconds": 427.66226352751255, "train/time_per_step_avg": 0.8919566126540304, "train/epoch_time_elapsed": 976.5393532849848, "train/estimated_remaining_minutes": 4.00933372057043} +{"step": 500, "epoch": 0.6740815638692281, "timestamp": 1786255838.9319963, "loss": 52.86866455078125, "grad_norm": 19.75, "learning_rate": 0.0005, "train/total_time_seconds": 445.7218977920711, "train/time_per_step_avg": 0.8911072830855846, "train/epoch_time_elapsed": 1013.899667005986, "train/estimated_remaining_minutes": 3.7143491482672593} +{"step": 500, "epoch": 0.6740815638692281, "timestamp": 1786255848.527109, "eval_loss": 3.2967636585235596, "eval_runtime": 9.5934, "eval_samples_per_second": 993.08, "eval_steps_per_second": 12.509, "train/total_time_seconds": 445.7218977920711, "train/time_per_step_avg": 0.8911072830855846, "train/epoch_time_elapsed": 1023.4947780184448, "train/estimated_remaining_minutes": 3.7143491482672593} +{"step": 520, "epoch": 0.7010448264239973, "timestamp": 1786255886.4791985, "loss": 52.4890625, "grad_norm": 31.0, "learning_rate": 0.0005, "train/total_time_seconds": 464.1531522870064, "train/time_per_step_avg": 0.8966818098351359, "train/epoch_time_elapsed": 1061.446867160499, "train/estimated_remaining_minutes": 3.421641827756778} +{"step": 540, "epoch": 0.7280080889787665, "timestamp": 1786255924.1253083, "loss": 52.321435546875, "grad_norm": 16.875, "learning_rate": 0.0005, "train/total_time_seconds": 482.53898264840245, "train/time_per_step_avg": 0.9007063108682632, "train/epoch_time_elapsed": 1099.0929772891104, "train/estimated_remaining_minutes": 3.1275674801285342} +{"step": 550, "epoch": 0.741489720256151, "timestamp": 1786255951.6409235, "eval_loss": 3.250918388366699, "eval_runtime": 9.1469, "eval_samples_per_second": 1041.558, "eval_steps_per_second": 13.119, "train/total_time_seconds": 490.9854051284492, "train/time_per_step_avg": 0.8913710459694266, "train/epoch_time_elapsed": 1126.6085901521146, "train/estimated_remaining_minutes": 2.975669121990601} +{"step": 560, "epoch": 0.7549713515335356, "timestamp": 1786255971.0950038, "loss": 52.020050048828125, "grad_norm": 18.5, "learning_rate": 0.0005, "train/total_time_seconds": 500.46789940074086, "train/time_per_step_avg": 0.8957813182473182, "train/epoch_time_elapsed": 1146.0626736655831, "train/estimated_remaining_minutes": 2.8300268120875227} +{"step": 580, "epoch": 0.7819346140883047, "timestamp": 1786256008.5453694, "loss": 51.72322387695313, "grad_norm": 23.875, "learning_rate": 0.0005, "train/total_time_seconds": 518.4827314689755, "train/time_per_step_avg": 0.9082046794146299, "train/epoch_time_elapsed": 1183.5130392313004, "train/estimated_remaining_minutes": 2.532817941084076} +{"step": 600, "epoch": 0.8088978766430738, "timestamp": 1786256046.9037464, "loss": 51.40700073242188, "grad_norm": 17.125, "learning_rate": 0.0005, "train/total_time_seconds": 537.0862419344485, "train/time_per_step_avg": 0.9136434414237737, "train/epoch_time_elapsed": 1221.8714155852795, "train/estimated_remaining_minutes": 2.2378593413935355} +{"step": 600, "epoch": 0.8088978766430738, "timestamp": 1786256056.4047332, "eval_loss": 3.21195650100708, "eval_runtime": 9.4995, "eval_samples_per_second": 1002.9, "eval_steps_per_second": 12.632, "train/total_time_seconds": 537.0862419344485, "train/time_per_step_avg": 0.9136434414237737, "train/epoch_time_elapsed": 1231.3724030666053, "train/estimated_remaining_minutes": 2.2378593413935355} +{"step": 620, "epoch": 0.8358611391978429, "timestamp": 1786256093.7350392, "loss": 51.1299072265625, "grad_norm": 18.125, "learning_rate": 0.0005, "train/total_time_seconds": 554.5250961445272, "train/time_per_step_avg": 0.9037194385752082, "train/epoch_time_elapsed": 1268.702707707882, "train/estimated_remaining_minutes": 1.9378565187846382} +{"step": 640, "epoch": 0.8628244017526121, "timestamp": 1786256130.7095737, "loss": 50.86155700683594, "grad_norm": 18.875, "learning_rate": 0.0005, "train/total_time_seconds": 571.9027761295438, "train/time_per_step_avg": 0.8936379348114133, "train/epoch_time_elapsed": 1305.6772438436747, "train/estimated_remaining_minutes": 1.6382631607877556} +{"step": 650, "epoch": 0.8763060330299967, "timestamp": 1786256159.5274856, "eval_loss": 3.1778173446655273, "eval_runtime": 9.5123, "eval_samples_per_second": 1001.54, "eval_steps_per_second": 12.615, "train/total_time_seconds": 581.2734086625278, "train/time_per_step_avg": 0.902880035340786, "train/epoch_time_elapsed": 1334.4951537139714, "train/estimated_remaining_minutes": 1.4904446375962253} +{"step": 660, "epoch": 0.8897876643073812, "timestamp": 1786256178.165015, "loss": 50.78846435546875, "grad_norm": 30.125, "learning_rate": 0.0005, "train/total_time_seconds": 590.354661539197, "train/time_per_step_avg": 0.8988676213845611, "train/epoch_time_elapsed": 1353.1326842531562, "train/estimated_remaining_minutes": 1.3417151398618115} +{"step": 680, "epoch": 0.9167509268621503, "timestamp": 1786256216.171869, "loss": 50.50668640136719, "grad_norm": 23.0, "learning_rate": 0.0005, "train/total_time_seconds": 608.6652480624616, "train/time_per_step_avg": 0.9018251659348607, "train/epoch_time_elapsed": 1391.1395382620394, "train/estimated_remaining_minutes": 1.0442786118718703} +{"step": 700, "epoch": 0.9437141894169194, "timestamp": 1786256251.677505, "loss": 50.196780395507815, "grad_norm": 18.25, "learning_rate": 0.0005, "train/total_time_seconds": 624.9607063494623, "train/time_per_step_avg": 0.8787446441501379, "train/epoch_time_elapsed": 1426.645174805075, "train/estimated_remaining_minutes": 0.7440008408922171} +{"step": 700, "epoch": 0.9437141894169194, "timestamp": 1786256261.0661898, "eval_loss": 3.135035991668701, "eval_runtime": 9.3872, "eval_samples_per_second": 1014.894, "eval_steps_per_second": 12.783, "train/total_time_seconds": 624.9607063494623, "train/time_per_step_avg": 0.8787446441501379, "train/epoch_time_elapsed": 1436.0338580720127, "train/estimated_remaining_minutes": 0.7440008408922171} +{"step": 720, "epoch": 0.9706774519716885, "timestamp": 1786256298.7307463, "loss": 49.94974365234375, "grad_norm": 21.75, "learning_rate": 0.0005, "train/total_time_seconds": 643.4756709970534, "train/time_per_step_avg": 0.8895057485252619, "train/epoch_time_elapsed": 1473.6984132528305, "train/estimated_remaining_minutes": 0.44685810485906485} +{"step": 740, "epoch": 0.9976407145264578, "timestamp": 1786256336.3365912, "loss": 49.74850769042969, "grad_norm": 25.125, "learning_rate": 0.0005, "train/total_time_seconds": 661.7013132050633, "train/time_per_step_avg": 0.8979853707551956, "train/epoch_time_elapsed": 1511.3042608723044, "train/estimated_remaining_minutes": 0.1490318272984377} +{"step": 750, "epoch": 1.0107853050219076, "timestamp": 1786256369.8029494, "eval_loss": 3.108103036880493, "eval_runtime": 9.4956, "eval_samples_per_second": 1003.31, "eval_steps_per_second": 12.637, "train/total_time_seconds": 676.0385475568473, "train/time_per_step_avg": 0.9476513889431953, "train/epoch_time_elapsed": 24.854905635118484, "train/estimated_remaining_minutes": 0.0, "train/global/act/norm": 150185.3480440026, "train/global/act/mean": -0.42774814351682083, "train/global/act/std": 1.2584756013799252, "train/global/act/max_abs": 11.8125, "train/global/act/frac_near_dtype_limit": 0.0, "train/global/act/frac_near_user_limit": 0.0, "train/global/grad/norm": 4.998155692517693, "train/global/grad/mean": 1.7156429580753228e-07, "train/global/grad/std": 0.0008832509986677723, "train/global/grad/max_abs": 0.05859375, "train/global/grad/frac_near_dtype_limit": 0.0, "train/global/grad/frac_near_user_limit": 0.0, "train/global/param/norm": 75.44594149383137, "train/global/param/mean": 0.0009513001034806474, "train/global/param/std": 0.05331836449904397, "train/global/param/max_abs": 1.0, "train/global/param/frac_near_dtype_limit": 0.0, "train/global/param/frac_near_user_limit": 0.0, "train/layer__model_layers_4/param/norm": 18.830361641010775, "train/layer__model_layers_4/param/mean": 0.0016009677404918462, "train/layer__model_layers_4/param/std": 0.04647544995312572, "train/layer__model_layers_4/param/max_abs": 1.0, "train/layer__model_layers_4/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_4/param/frac_near_user_limit": 0.0, "train/layer__model_layers_7/param/norm": 19.057209819219338, "train/layer__model_layers_7/param/mean": 0.001528687856498635, "train/layer__model_layers_7/param/std": 0.04701331013729768, "train/layer__model_layers_7/param/max_abs": 1.0, "train/layer__model_layers_7/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_7/param/frac_near_user_limit": 0.0, "train/layer__model_layers_6/param/norm": 19.296900303627133, "train/layer__model_layers_6/param/mean": 0.0016313573685525545, "train/layer__model_layers_6/param/std": 0.047603568559157615, "train/layer__model_layers_6/param/max_abs": 1.0, "train/layer__model_layers_6/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_6/param/frac_near_user_limit": 0.0, "train/layer_model_layers_6/act/norm": 20266.952184443417, "train/layer_model_layers_6/act/mean": -0.005417345808102534, "train/layer_model_layers_6/act/std": 0.6138518434558304, "train/layer_model_layers_6/act/max_abs": 6.03125, "train/layer_model_layers_6/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_6/act/frac_near_user_limit": 0.0, "train/layer_model_layers_6/grad/norm": 1.1219461188048783, "train/layer_model_layers_6/grad/mean": 1.0562621859046114e-06, "train/layer_model_layers_6/grad/std": 0.0006925265544513297, "train/layer_model_layers_6/grad/max_abs": 0.0098876953125, "train/layer_model_layers_6/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_6/grad/frac_near_user_limit": 0.0, "train/layer_model_layers_7/act/norm": 20479.295498580417, "train/layer_model_layers_7/act/mean": -0.004186410170335036, "train/layer_model_layers_7/act/std": 0.6202687217424423, "train/layer_model_layers_7/act/max_abs": 7.0, "train/layer_model_layers_7/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_7/act/frac_near_user_limit": 0.0, "train/layer_model_layers_7/grad/norm": 0.9808154580741602, "train/layer_model_layers_7/grad/mean": -6.818339608568995e-08, "train/layer_model_layers_7/grad/std": 0.0006054649694080247, "train/layer_model_layers_7/grad/max_abs": 0.0093994140625, "train/layer_model_layers_7/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_7/grad/frac_near_user_limit": 0.0, "train/layer__model_layers_8/param/norm": 19.81155114052784, "train/layer__model_layers_8/param/mean": 0.0013863359710169657, "train/layer__model_layers_8/param/std": 0.04890227832752276, "train/layer__model_layers_8/param/max_abs": 1.0, "train/layer__model_layers_8/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_8/param/frac_near_user_limit": 0.0, "train/layer_model_layers_4/act/norm": 18073.148360412022, "train/layer_model_layers_4/act/mean": 0.011836038185999943, "train/layer_model_layers_4/act/std": 0.5473840823442112, "train/layer_model_layers_4/act/max_abs": 5.21875, "train/layer_model_layers_4/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_4/act/frac_near_user_limit": 0.0, "train/layer_model_layers_4/grad/norm": 1.0366429293152521, "train/layer_model_layers_4/grad/mean": 1.076114903002187e-06, "train/layer_model_layers_4/grad/std": 0.0006396265473420889, "train/layer_model_layers_4/grad/max_abs": 0.00689697265625, "train/layer_model_layers_4/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_4/grad/frac_near_user_limit": 0.0, "train/layer_model_layers_8/act/norm": 22737.438562436826, "train/layer_model_layers_8/act/mean": -0.0016579261192908655, "train/layer_model_layers_8/act/std": 0.6887773225057738, "train/layer_model_layers_8/act/max_abs": 6.375, "train/layer_model_layers_8/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_8/act/frac_near_user_limit": 0.0, "train/layer_model_layers_8/grad/norm": 0.936803955234771, "train/layer_model_layers_8/grad/mean": 1.9631800408854315e-07, "train/layer_model_layers_8/grad/std": 0.0005782672798617279, "train/layer_model_layers_8/grad/max_abs": 0.009765625, "train/layer_model_layers_8/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_8/grad/frac_near_user_limit": 0.0, "train/layer_model_layers_5/act/norm": 18287.03101790653, "train/layer_model_layers_5/act/mean": 0.005246024865370531, "train/layer_model_layers_5/act/std": 0.5537264622185337, "train/layer_model_layers_5/act/max_abs": 6.0, "train/layer_model_layers_5/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_5/act/frac_near_user_limit": 0.0, "train/layer_model_layers_5/grad/norm": 1.1070405366170881, "train/layer_model_layers_5/grad/mean": 3.8479168589885073e-07, "train/layer_model_layers_5/grad/std": 0.0006830734147017943, "train/layer_model_layers_5/grad/max_abs": 0.01092529296875, "train/layer_model_layers_5/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_5/grad/frac_near_user_limit": 0.0, "train/layer__model_layers_1/param/norm": 18.983731984995075, "train/layer__model_layers_1/param/mean": 0.0015187018003181064, "train/layer__model_layers_1/param/std": 0.046850783894402705, "train/layer__model_layers_1/param/max_abs": 1.0, "train/layer__model_layers_1/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_1/param/frac_near_user_limit": 0.0, "train/layer_model_layers_3/act/norm": 19206.574143126698, "train/layer_model_layers_3/act/mean": 0.0260999844624446, "train/layer_model_layers_3/act/std": 0.5813081153399244, "train/layer_model_layers_3/act/max_abs": 6.21875, "train/layer_model_layers_3/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_3/act/frac_near_user_limit": 0.0, "train/layer_model_layers_3/grad/norm": 1.1688936654531, "train/layer_model_layers_3/grad/mean": 1.3687615914854357e-06, "train/layer_model_layers_3/grad/std": 0.0007216427637524477, "train/layer_model_layers_3/grad/max_abs": 0.00823974609375, "train/layer_model_layers_3/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_3/grad/frac_near_user_limit": 0.0, "train/layer_model_layers_1/act/norm": 17389.814008941397, "train/layer_model_layers_1/act/mean": 0.005572208991417518, "train/layer_model_layers_1/act/std": 0.5266370859241487, "train/layer_model_layers_1/act/max_abs": 5.5, "train/layer_model_layers_1/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_1/act/frac_near_user_limit": 0.0, "train/layer_model_layers_1/grad/norm": 1.748869284242822, "train/layer_model_layers_1/grad/mean": 1.9777443967527144e-06, "train/layer_model_layers_1/grad/std": 0.0010789055805118235, "train/layer_model_layers_1/grad/max_abs": 0.01153564453125, "train/layer_model_layers_1/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_1/grad/frac_near_user_limit": 0.0, "train/layer__model_layers_3/param/norm": 19.16069101254245, "train/layer__model_layers_3/param/mean": 0.0015184280466921801, "train/layer__model_layers_3/param/std": 0.04727126222105599, "train/layer__model_layers_3/param/max_abs": 1.0, "train/layer__model_layers_3/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_3/param/frac_near_user_limit": 0.0, "train/layer__model_layers_2/param/norm": 19.07513669266226, "train/layer__model_layers_2/param/mean": 0.0015293722405634506, "train/layer__model_layers_2/param/std": 0.04707263888163651, "train/layer__model_layers_2/param/max_abs": 1.0, "train/layer__model_layers_2/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_2/param/frac_near_user_limit": 0.0, "train/layer__model_layers_5/param/norm": 18.903182860714885, "train/layer__model_layers_5/param/mean": 0.001528687856498635, "train/layer__model_layers_5/param/std": 0.046641797054845655, "train/layer__model_layers_5/param/max_abs": 1.0, "train/layer__model_layers_5/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_5/param/frac_near_user_limit": 0.0, "train/layer_model_layers_0/act/norm": 17591.951382313935, "train/layer_model_layers_0/act/mean": -0.0008019591824939618, "train/layer_model_layers_0/act/std": 0.5327684547972705, "train/layer_model_layers_0/act/max_abs": 6.21875, "train/layer_model_layers_0/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_0/act/frac_near_user_limit": 0.0, "train/layer_model_layers_0/grad/norm": 3.358869449977567, "train/layer_model_layers_0/grad/mean": 8.951448334174666e-07, "train/layer_model_layers_0/grad/std": 0.002073075775157821, "train/layer_model_layers_0/grad/max_abs": 0.0286865234375, "train/layer_model_layers_0/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_0/grad/frac_near_user_limit": 0.0, "train/layer__model_layers_0/param/norm": 18.78089251947641, "train/layer__model_layers_0/param/mean": 0.0015775290740633531, "train/layer__model_layers_0/param/std": 0.046327244641872406, "train/layer__model_layers_0/param/max_abs": 1.0, "train/layer__model_layers_0/param/frac_near_dtype_limit": 0.0, "train/layer__model_layers_0/param/frac_near_user_limit": 0.0, "train/layer_model_layers_2/act/norm": 18632.33940555953, "train/layer_model_layers_2/act/mean": 0.008575276722415136, "train/layer_model_layers_2/act/std": 0.5642383070261626, "train/layer_model_layers_2/act/max_abs": 5.25, "train/layer_model_layers_2/act/frac_near_dtype_limit": 0.0, "train/layer_model_layers_2/act/frac_near_user_limit": 0.0, "train/layer_model_layers_2/grad/norm": 1.3519265251055885, "train/layer_model_layers_2/grad/mean": 2.437561762035358e-06, "train/layer_model_layers_2/grad/std": 0.0008341103202784663, "train/layer_model_layers_2/grad/max_abs": 0.007598876953125, "train/layer_model_layers_2/grad/frac_near_dtype_limit": 0.0, "train/layer_model_layers_2/grad/frac_near_user_limit": 0.0, "train/tensor_act_model_embed_tokens/norm": 686.0245066748595, "train/tensor_act_model_embed_tokens/mean": 0.0006635189056396484, "train/tensor_act_model_embed_tokens/std": 0.07476825003052505, "train/tensor_act_model_embed_tokens/max_abs": 0.25, "train/tensor_act_model_embed_tokens/frac_near_dtype_limit": 0.0, "train/tensor_act_model_embed_tokens/frac_near_user_limit": 0.0, "train/tensor_act_model_rotary_emb/norm": 3632.2067871093745, "train/tensor_act_model_rotary_emb/mean": 0.333984375, "train/tensor_act_model_rotary_emb/std": 0.71875, "train/tensor_act_model_rotary_emb/max_abs": 1.0, "train/tensor_act_model_rotary_emb/frac_near_dtype_limit": 0.0, "train/tensor_act_model_rotary_emb/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_input_layernorm/norm": 9158.321228096187, "train/tensor_act_model_layers_0_input_layernorm/mean": 0.009479522705078125, "train/tensor_act_model_layers_0_input_layernorm/std": 1.000000133579297, "train/tensor_act_model_layers_0_input_layernorm/max_abs": 3.71875, "train/tensor_act_model_layers_0_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_q_proj/norm": 8242.797600267277, "train/tensor_act_model_layers_0_self_attn_q_proj/mean": -0.017574310302734375, "train/tensor_act_model_layers_0_self_attn_q_proj/std": 0.8996636131643495, "train/tensor_act_model_layers_0_self_attn_q_proj/max_abs": 6.21875, "train/tensor_act_model_layers_0_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_k_proj/norm": 7571.323294073769, "train/tensor_act_model_layers_0_self_attn_k_proj/mean": -0.012340545654296875, "train/tensor_act_model_layers_0_self_attn_k_proj/std": 0.8269067291263272, "train/tensor_act_model_layers_0_self_attn_k_proj/max_abs": 4.3125, "train/tensor_act_model_layers_0_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_v_proj/norm": 1815.8166580376064, "train/tensor_act_model_layers_0_self_attn_v_proj/mean": -0.0010931491851806638, "train/tensor_act_model_layers_0_self_attn_v_proj/std": 0.198242266075022, "train/tensor_act_model_layers_0_self_attn_v_proj/max_abs": 0.98828125, "train/tensor_act_model_layers_0_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_o_proj/norm": 139.19229095220038, "train/tensor_act_model_layers_0_self_attn_o_proj/mean": -0.0005276203155517578, "train/tensor_act_model_layers_0_self_attn_o_proj/std": 0.01518657306789068, "train/tensor_act_model_layers_0_self_attn_o_proj/max_abs": 0.224609375, "train/tensor_act_model_layers_0_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_self_attn/norm": 139.19229095220038, "train/tensor_act_model_layers_0_self_attn/mean": -0.0005276203155517578, "train/tensor_act_model_layers_0_self_attn/std": 0.01518657306789068, "train/tensor_act_model_layers_0_self_attn/max_abs": 0.224609375, "train/tensor_act_model_layers_0_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_post_attention_layernorm/norm": 9158.038940433684, "train/tensor_act_model_layers_0_post_attention_layernorm/mean": 0.0021638870239257812, "train/tensor_act_model_layers_0_post_attention_layernorm/std": 1.0000004657698636, "train/tensor_act_model_layers_0_post_attention_layernorm/max_abs": 4.53125, "train/tensor_act_model_layers_0_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_mlp_up_proj/norm": 3148.9947247149603, "train/tensor_act_model_layers_0_mlp_up_proj/mean": 0.003276824951171875, "train/tensor_act_model_layers_0_mlp_up_proj/std": 0.19842569797190573, "train/tensor_act_model_layers_0_mlp_up_proj/max_abs": 1.1328125, "train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_mlp_down_proj/norm": 1014.9781179029341, "train/tensor_act_model_layers_0_mlp_down_proj/mean": 9.156763553619385e-06, "train/tensor_act_model_layers_0_mlp_down_proj/std": 0.11087058315602684, "train/tensor_act_model_layers_0_mlp_down_proj/max_abs": 0.60546875, "train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0_mlp/norm": 1014.9781179029341, "train/tensor_act_model_layers_0_mlp/mean": 9.156763553619385e-06, "train/tensor_act_model_layers_0_mlp/std": 0.11087058315602684, "train/tensor_act_model_layers_0_mlp/max_abs": 0.60546875, "train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_0/norm": 1072.8987485266305, "train/tensor_act_model_layers_0/mean": 0.0001455782912671566, "train/tensor_act_model_layers_0/std": 0.11718775424792081, "train/tensor_act_model_layers_0/max_abs": 0.72265625, "train/tensor_act_model_layers_0/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_0/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_input_layernorm/norm": 9158.515502939657, "train/tensor_act_model_layers_1_input_layernorm/mean": 0.003910541534423829, "train/tensor_act_model_layers_1_input_layernorm/std": 1.0000012806912975, "train/tensor_act_model_layers_1_input_layernorm/max_abs": 4.875, "train/tensor_act_model_layers_1_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_q_proj/norm": 7272.671681066942, "train/tensor_act_model_layers_1_self_attn_q_proj/mean": 0.0333709716796875, "train/tensor_act_model_layers_1_self_attn_q_proj/std": 0.7934583210567848, "train/tensor_act_model_layers_1_self_attn_q_proj/max_abs": 5.5, "train/tensor_act_model_layers_1_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_k_proj/norm": 7514.913359677975, "train/tensor_act_model_layers_1_self_attn_k_proj/mean": 0.047149658203125, "train/tensor_act_model_layers_1_self_attn_k_proj/std": 0.8195828502245655, "train/tensor_act_model_layers_1_self_attn_k_proj/max_abs": 4.84375, "train/tensor_act_model_layers_1_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_v_proj/norm": 2493.6288743965956, "train/tensor_act_model_layers_1_self_attn_v_proj/mean": 0.0036802291870117188, "train/tensor_act_model_layers_1_self_attn_v_proj/std": 0.271851848590517, "train/tensor_act_model_layers_1_self_attn_v_proj/max_abs": 1.40625, "train/tensor_act_model_layers_1_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_o_proj/norm": 301.4580922175665, "train/tensor_act_model_layers_1_self_attn_o_proj/mean": -0.0022516250610351562, "train/tensor_act_model_layers_1_self_attn_o_proj/std": 0.03286092571977793, "train/tensor_act_model_layers_1_self_attn_o_proj/max_abs": 0.35546875, "train/tensor_act_model_layers_1_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_self_attn/norm": 301.4580922175665, "train/tensor_act_model_layers_1_self_attn/mean": -0.0022516250610351562, "train/tensor_act_model_layers_1_self_attn/std": 0.03286092571977793, "train/tensor_act_model_layers_1_self_attn/max_abs": 0.35546875, "train/tensor_act_model_layers_1_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_post_attention_layernorm/norm": 9158.569824228702, "train/tensor_act_model_layers_1_post_attention_layernorm/mean": -0.01399993896484375, "train/tensor_act_model_layers_1_post_attention_layernorm/std": 1.0000054609987319, "train/tensor_act_model_layers_1_post_attention_layernorm/max_abs": 4.96875, "train/tensor_act_model_layers_1_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_mlp_up_proj/norm": 3503.9026158574925, "train/tensor_act_model_layers_1_mlp_up_proj/mean": -0.00506591796875, "train/tensor_act_model_layers_1_mlp_up_proj/std": 0.2207643275831124, "train/tensor_act_model_layers_1_mlp_up_proj/max_abs": 1.2265625, "train/tensor_act_model_layers_1_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_mlp_down_proj/norm": 1282.0529812759387, "train/tensor_act_model_layers_1_mlp_down_proj/mean": 0.0067119598388671875, "train/tensor_act_model_layers_1_mlp_down_proj/std": 0.13964852814435932, "train/tensor_act_model_layers_1_mlp_down_proj/max_abs": 0.88671875, "train/tensor_act_model_layers_1_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1_mlp/norm": 1282.0529812759387, "train/tensor_act_model_layers_1_mlp/mean": 0.0067119598388671875, "train/tensor_act_model_layers_1_mlp/std": 0.13964852814435932, "train/tensor_act_model_layers_1_mlp/max_abs": 0.88671875, "train/tensor_act_model_layers_1_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_1/norm": 1821.4157893504037, "train/tensor_act_model_layers_1/mean": 0.004604339599609375, "train/tensor_act_model_layers_1/std": 0.1989142884855857, "train/tensor_act_model_layers_1/max_abs": 1.1015625, "train/tensor_act_model_layers_1/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_1/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_input_layernorm/norm": 9158.78973389141, "train/tensor_act_model_layers_2_input_layernorm/mean": 0.02327728271484375, "train/tensor_act_model_layers_2_input_layernorm/std": 1.0000010241923734, "train/tensor_act_model_layers_2_input_layernorm/max_abs": 4.46875, "train/tensor_act_model_layers_2_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_q_proj/norm": 9736.292863798752, "train/tensor_act_model_layers_2_self_attn_q_proj/mean": 0.016788482666015625, "train/tensor_act_model_layers_2_self_attn_q_proj/std": 1.0625039114311987, "train/tensor_act_model_layers_2_self_attn_q_proj/max_abs": 5.25, "train/tensor_act_model_layers_2_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_k_proj/norm": 7735.051202050646, "train/tensor_act_model_layers_2_self_attn_k_proj/mean": 0.015628814697265625, "train/tensor_act_model_layers_2_self_attn_k_proj/std": 0.8444851065697362, "train/tensor_act_model_layers_2_self_attn_k_proj/max_abs": 4.75, "train/tensor_act_model_layers_2_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_v_proj/norm": 2736.5449248623486, "train/tensor_act_model_layers_2_self_attn_v_proj/mean": -0.0029439926147460938, "train/tensor_act_model_layers_2_self_attn_v_proj/std": 0.29882832015005995, "train/tensor_act_model_layers_2_self_attn_v_proj/max_abs": 1.8671875, "train/tensor_act_model_layers_2_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_o_proj/norm": 408.9549750343595, "train/tensor_act_model_layers_2_self_attn_o_proj/mean": 0.0020008087158203125, "train/tensor_act_model_layers_2_self_attn_o_proj/std": 0.0446176132967603, "train/tensor_act_model_layers_2_self_attn_o_proj/max_abs": 0.578125, "train/tensor_act_model_layers_2_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_self_attn/norm": 408.9549750343595, "train/tensor_act_model_layers_2_self_attn/mean": 0.0020008087158203125, "train/tensor_act_model_layers_2_self_attn/std": 0.0446176132967603, "train/tensor_act_model_layers_2_self_attn/max_abs": 0.578125, "train/tensor_act_model_layers_2_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_post_attention_layernorm/norm": 9158.794067390949, "train/tensor_act_model_layers_2_post_attention_layernorm/mean": 0.0318145751953125, "train/tensor_act_model_layers_2_post_attention_layernorm/std": 1.0000009535574466, "train/tensor_act_model_layers_2_post_attention_layernorm/max_abs": 4.59375, "train/tensor_act_model_layers_2_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_mlp_up_proj/norm": 3125.8167549285604, "train/tensor_act_model_layers_2_mlp_up_proj/mean": 2.9494520276784897e-05, "train/tensor_act_model_layers_2_mlp_up_proj/std": 0.1972049672413496, "train/tensor_act_model_layers_2_mlp_up_proj/max_abs": 1.1484375, "train/tensor_act_model_layers_2_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_mlp_down_proj/norm": 1050.6969802776157, "train/tensor_act_model_layers_2_mlp_down_proj/mean": 0.005405426025390625, "train/tensor_act_model_layers_2_mlp_down_proj/std": 0.11462433009314828, "train/tensor_act_model_layers_2_mlp_down_proj/max_abs": 0.66796875, "train/tensor_act_model_layers_2_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2_mlp/norm": 1050.6969802776157, "train/tensor_act_model_layers_2_mlp/mean": 0.005405426025390625, "train/tensor_act_model_layers_2_mlp/std": 0.11462433009314828, "train/tensor_act_model_layers_2_mlp/max_abs": 0.66796875, "train/tensor_act_model_layers_2_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_2/norm": 2229.1012974584337, "train/tensor_act_model_layers_2/mean": 0.012012481689453125, "train/tensor_act_model_layers_2/std": 0.24310367211460596, "train/tensor_act_model_layers_2/max_abs": 1.328125, "train/tensor_act_model_layers_2/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_2/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_input_layernorm/norm": 9158.836547869432, "train/tensor_act_model_layers_3_input_layernorm/mean": 0.04978942871093751, "train/tensor_act_model_layers_3_input_layernorm/std": 1.0000012683441275, "train/tensor_act_model_layers_3_input_layernorm/max_abs": 4.65625, "train/tensor_act_model_layers_3_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_q_proj/norm": 10520.92980011775, "train/tensor_act_model_layers_3_self_attn_q_proj/mean": 0.15374755859375, "train/tensor_act_model_layers_3_self_attn_q_proj/std": 1.138189614442459, "train/tensor_act_model_layers_3_self_attn_q_proj/max_abs": 6.21875, "train/tensor_act_model_layers_3_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_k_proj/norm": 7931.644892515877, "train/tensor_act_model_layers_3_self_attn_k_proj/mean": 0.08953857421875, "train/tensor_act_model_layers_3_self_attn_k_proj/std": 0.8610920463597765, "train/tensor_act_model_layers_3_self_attn_k_proj/max_abs": 4.03125, "train/tensor_act_model_layers_3_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_v_proj/norm": 3054.7713515068785, "train/tensor_act_model_layers_3_self_attn_v_proj/mean": -0.002701282501220703, "train/tensor_act_model_layers_3_self_attn_v_proj/std": 0.3339849269576031, "train/tensor_act_model_layers_3_self_attn_v_proj/max_abs": 1.6328125, "train/tensor_act_model_layers_3_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_o_proj/norm": 486.0344744237919, "train/tensor_act_model_layers_3_self_attn_o_proj/mean": -0.00029712915420532227, "train/tensor_act_model_layers_3_self_attn_o_proj/std": 0.05308823489047627, "train/tensor_act_model_layers_3_self_attn_o_proj/max_abs": 0.47265625, "train/tensor_act_model_layers_3_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_self_attn/norm": 486.0344744237919, "train/tensor_act_model_layers_3_self_attn/mean": -0.00029712915420532227, "train/tensor_act_model_layers_3_self_attn/std": 0.05308823489047627, "train/tensor_act_model_layers_3_self_attn/max_abs": 0.47265625, "train/tensor_act_model_layers_3_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_post_attention_layernorm/norm": 9158.835632337961, "train/tensor_act_model_layers_3_post_attention_layernorm/mean": 0.04740905761718751, "train/tensor_act_model_layers_3_post_attention_layernorm/std": 1.0000005670588714, "train/tensor_act_model_layers_3_post_attention_layernorm/max_abs": 4.8125, "train/tensor_act_model_layers_3_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_mlp_up_proj/norm": 3097.754188140022, "train/tensor_act_model_layers_3_mlp_up_proj/mean": -0.0009462833404541016, "train/tensor_act_model_layers_3_mlp_up_proj/std": 0.19531258106913943, "train/tensor_act_model_layers_3_mlp_up_proj/max_abs": 1.2109375, "train/tensor_act_model_layers_3_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_mlp_down_proj/norm": 998.9542597675202, "train/tensor_act_model_layers_3_mlp_down_proj/mean": -0.0022554397583007812, "train/tensor_act_model_layers_3_mlp_down_proj/std": 0.10897847648259888, "train/tensor_act_model_layers_3_mlp_down_proj/max_abs": 0.66015625, "train/tensor_act_model_layers_3_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3_mlp/norm": 998.9542597675202, "train/tensor_act_model_layers_3_mlp/mean": -0.0022554397583007812, "train/tensor_act_model_layers_3_mlp/std": 0.10897847648259888, "train/tensor_act_model_layers_3_mlp/max_abs": 0.66015625, "train/tensor_act_model_layers_3_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_3/norm": 2475.276032622091, "train/tensor_act_model_layers_3/mean": 0.00946044921875, "train/tensor_act_model_layers_3/std": 0.2701432434459629, "train/tensor_act_model_layers_3/max_abs": 1.484375, "train/tensor_act_model_layers_3/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_3/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_input_layernorm/norm": 9158.859802255498, "train/tensor_act_model_layers_4_input_layernorm/mean": 0.03276824951171874, "train/tensor_act_model_layers_4_input_layernorm/std": 1.0000005615582506, "train/tensor_act_model_layers_4_input_layernorm/max_abs": 4.8125, "train/tensor_act_model_layers_4_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_q_proj/norm": 8444.509770831344, "train/tensor_act_model_layers_4_self_attn_q_proj/mean": 0.062774658203125, "train/tensor_act_model_layers_4_self_attn_q_proj/std": 0.9201686668813257, "train/tensor_act_model_layers_4_self_attn_q_proj/max_abs": 4.78125, "train/tensor_act_model_layers_4_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_k_proj/norm": 7745.710212624892, "train/tensor_act_model_layers_4_self_attn_k_proj/mean": 0.017276763916015625, "train/tensor_act_model_layers_4_self_attn_k_proj/std": 0.845461853783858, "train/tensor_act_model_layers_4_self_attn_k_proj/max_abs": 4.21875, "train/tensor_act_model_layers_4_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_v_proj/norm": 3085.8902545445458, "train/tensor_act_model_layers_4_self_attn_v_proj/mean": 0.0008850693702697754, "train/tensor_act_model_layers_4_self_attn_v_proj/std": 0.33703761500531826, "train/tensor_act_model_layers_4_self_attn_v_proj/max_abs": 1.7734375, "train/tensor_act_model_layers_4_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_o_proj/norm": 580.2747154684458, "train/tensor_act_model_layers_4_self_attn_o_proj/mean": 0.0011477470397949219, "train/tensor_act_model_layers_4_self_attn_o_proj/std": 0.06326528385724953, "train/tensor_act_model_layers_4_self_attn_o_proj/max_abs": 0.60546875, "train/tensor_act_model_layers_4_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_self_attn/norm": 580.2747154684458, "train/tensor_act_model_layers_4_self_attn/mean": 0.0011477470397949219, "train/tensor_act_model_layers_4_self_attn/std": 0.06326528385724953, "train/tensor_act_model_layers_4_self_attn/max_abs": 0.60546875, "train/tensor_act_model_layers_4_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_post_attention_layernorm/norm": 9158.856872565368, "train/tensor_act_model_layers_4_post_attention_layernorm/mean": 0.0382232666015625, "train/tensor_act_model_layers_4_post_attention_layernorm/std": 1.000000227126267, "train/tensor_act_model_layers_4_post_attention_layernorm/max_abs": 5.21875, "train/tensor_act_model_layers_4_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_mlp_up_proj/norm": 3015.185914880472, "train/tensor_act_model_layers_4_mlp_up_proj/mean": -0.000986814498901367, "train/tensor_act_model_layers_4_mlp_up_proj/std": 0.19018606370318258, "train/tensor_act_model_layers_4_mlp_up_proj/max_abs": 1.1015625, "train/tensor_act_model_layers_4_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_mlp_down_proj/norm": 921.3529462980846, "train/tensor_act_model_layers_4_mlp_down_proj/mean": -0.0026712417602539062, "train/tensor_act_model_layers_4_mlp_down_proj/std": 0.10058596968487546, "train/tensor_act_model_layers_4_mlp_down_proj/max_abs": 0.5390625, "train/tensor_act_model_layers_4_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4_mlp/norm": 921.3529462980846, "train/tensor_act_model_layers_4_mlp/mean": -0.0026712417602539062, "train/tensor_act_model_layers_4_mlp/std": 0.10058596968487546, "train/tensor_act_model_layers_4_mlp/max_abs": 0.5390625, "train/tensor_act_model_layers_4_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_4/norm": 2564.812437940014, "train/tensor_act_model_layers_4/mean": 0.007947921752929688, "train/tensor_act_model_layers_4/std": 0.2797865139362316, "train/tensor_act_model_layers_4/max_abs": 1.65625, "train/tensor_act_model_layers_4/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_4/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_input_layernorm/norm": 9158.861267098808, "train/tensor_act_model_layers_5_input_layernorm/mean": 0.0275726318359375, "train/tensor_act_model_layers_5_input_layernorm/std": 1.0000002960441194, "train/tensor_act_model_layers_5_input_layernorm/max_abs": 4.84375, "train/tensor_act_model_layers_5_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_q_proj/norm": 8626.440264451365, "train/tensor_act_model_layers_5_self_attn_q_proj/mean": -0.0014693737030029297, "train/tensor_act_model_layers_5_self_attn_q_proj/std": 0.9414076213487585, "train/tensor_act_model_layers_5_self_attn_q_proj/max_abs": 6.0, "train/tensor_act_model_layers_5_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_k_proj/norm": 8086.794526499998, "train/tensor_act_model_layers_5_self_attn_k_proj/mean": 0.014064788818359375, "train/tensor_act_model_layers_5_self_attn_k_proj/std": 0.8823257181255008, "train/tensor_act_model_layers_5_self_attn_k_proj/max_abs": 5.15625, "train/tensor_act_model_layers_5_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_v_proj/norm": 2959.718677812412, "train/tensor_act_model_layers_5_self_attn_v_proj/mean": -0.003086090087890625, "train/tensor_act_model_layers_5_self_attn_v_proj/std": 0.32312162517924214, "train/tensor_act_model_layers_5_self_attn_v_proj/max_abs": 1.84375, "train/tensor_act_model_layers_5_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_o_proj/norm": 497.6350976881482, "train/tensor_act_model_layers_5_self_attn_o_proj/mean": -0.0008254051208496094, "train/tensor_act_model_layers_5_self_attn_o_proj/std": 0.05436818972384846, "train/tensor_act_model_layers_5_self_attn_o_proj/max_abs": 0.4375, "train/tensor_act_model_layers_5_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_self_attn/norm": 497.6350976881482, "train/tensor_act_model_layers_5_self_attn/mean": -0.0008254051208496094, "train/tensor_act_model_layers_5_self_attn/std": 0.05436818972384846, "train/tensor_act_model_layers_5_self_attn/max_abs": 0.4375, "train/tensor_act_model_layers_5_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_post_attention_layernorm/norm": 9158.866821301317, "train/tensor_act_model_layers_5_post_attention_layernorm/mean": 0.0240020751953125, "train/tensor_act_model_layers_5_post_attention_layernorm/std": 1.00000024016478, "train/tensor_act_model_layers_5_post_attention_layernorm/max_abs": 4.71875, "train/tensor_act_model_layers_5_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_mlp_up_proj/norm": 3031.677025734979, "train/tensor_act_model_layers_5_mlp_up_proj/mean": -0.0006145238876342773, "train/tensor_act_model_layers_5_mlp_up_proj/std": 0.19134540618480564, "train/tensor_act_model_layers_5_mlp_up_proj/max_abs": 1.1171875, "train/tensor_act_model_layers_5_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_mlp_down_proj/norm": 929.9160394931031, "train/tensor_act_model_layers_5_mlp_down_proj/mean": 0.0011644363403320312, "train/tensor_act_model_layers_5_mlp_down_proj/std": 0.1015626140108337, "train/tensor_act_model_layers_5_mlp_down_proj/max_abs": 0.55859375, "train/tensor_act_model_layers_5_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5_mlp/norm": 929.9160394931031, "train/tensor_act_model_layers_5_mlp/mean": 0.0011644363403320312, "train/tensor_act_model_layers_5_mlp/std": 0.1015626140108337, "train/tensor_act_model_layers_5_mlp/max_abs": 0.55859375, "train/tensor_act_model_layers_5_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_5/norm": 2580.3944732393816, "train/tensor_act_model_layers_5/mean": 0.008279800415039062, "train/tensor_act_model_layers_5/std": 0.2813725806040801, "train/tensor_act_model_layers_5/max_abs": 1.5, "train/tensor_act_model_layers_5/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_5/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_input_layernorm/norm": 9158.862487805487, "train/tensor_act_model_layers_6_input_layernorm/mean": 0.02984619140625, "train/tensor_act_model_layers_6_input_layernorm/std": 1.0000004451720916, "train/tensor_act_model_layers_6_input_layernorm/max_abs": 4.65625, "train/tensor_act_model_layers_6_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_q_proj/norm": 10739.079023412945, "train/tensor_act_model_layers_6_self_attn_q_proj/mean": -0.05267333984375, "train/tensor_act_model_layers_6_self_attn_q_proj/std": 1.172365214812159, "train/tensor_act_model_layers_6_self_attn_q_proj/max_abs": 6.03125, "train/tensor_act_model_layers_6_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_k_proj/norm": 9821.311569001531, "train/tensor_act_model_layers_6_self_attn_k_proj/mean": -0.085968017578125, "train/tensor_act_model_layers_6_self_attn_k_proj/std": 1.068372004136195, "train/tensor_act_model_layers_6_self_attn_k_proj/max_abs": 4.40625, "train/tensor_act_model_layers_6_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_v_proj/norm": 3351.5042061824015, "train/tensor_act_model_layers_6_self_attn_v_proj/mean": -0.0036039352416992188, "train/tensor_act_model_layers_6_self_attn_v_proj/std": 0.36547945254426323, "train/tensor_act_model_layers_6_self_attn_v_proj/max_abs": 2.328125, "train/tensor_act_model_layers_6_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_o_proj/norm": 798.792740246835, "train/tensor_act_model_layers_6_self_attn_o_proj/mean": -0.002144336700439453, "train/tensor_act_model_layers_6_self_attn_o_proj/std": 0.08719287717656642, "train/tensor_act_model_layers_6_self_attn_o_proj/max_abs": 1.046875, "train/tensor_act_model_layers_6_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_self_attn/norm": 798.792740246835, "train/tensor_act_model_layers_6_self_attn/mean": -0.002144336700439453, "train/tensor_act_model_layers_6_self_attn/std": 0.08719287717656642, "train/tensor_act_model_layers_6_self_attn/max_abs": 1.046875, "train/tensor_act_model_layers_6_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_post_attention_layernorm/norm": 9158.868591321168, "train/tensor_act_model_layers_6_post_attention_layernorm/mean": 0.02191925048828125, "train/tensor_act_model_layers_6_post_attention_layernorm/std": 1.000000366911923, "train/tensor_act_model_layers_6_post_attention_layernorm/max_abs": 4.875, "train/tensor_act_model_layers_6_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_mlp_up_proj/norm": 3078.6657922183363, "train/tensor_act_model_layers_6_mlp_up_proj/mean": 0.0003501623868942261, "train/tensor_act_model_layers_6_mlp_up_proj/std": 0.19427530100764198, "train/tensor_act_model_layers_6_mlp_up_proj/max_abs": 1.0859375, "train/tensor_act_model_layers_6_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_mlp_down_proj/norm": 1012.1440503813626, "train/tensor_act_model_layers_6_mlp_down_proj/mean": 0.0057201385498046875, "train/tensor_act_model_layers_6_mlp_down_proj/std": 0.11035170806644656, "train/tensor_act_model_layers_6_mlp_down_proj/max_abs": 0.6171875, "train/tensor_act_model_layers_6_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6_mlp/norm": 1012.1440503813626, "train/tensor_act_model_layers_6_mlp/mean": 0.0057201385498046875, "train/tensor_act_model_layers_6_mlp/std": 0.11035170806644656, "train/tensor_act_model_layers_6_mlp/max_abs": 0.6171875, "train/tensor_act_model_layers_6_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_6/norm": 2675.436665474263, "train/tensor_act_model_layers_6/mean": 0.011852264404296877, "train/tensor_act_model_layers_6/std": 0.2915051843774514, "train/tensor_act_model_layers_6/max_abs": 1.6640625, "train/tensor_act_model_layers_6/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_6/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_input_layernorm/norm": 9158.866333015456, "train/tensor_act_model_layers_7_input_layernorm/mean": 0.04217529296875, "train/tensor_act_model_layers_7_input_layernorm/std": 1.0000001769512734, "train/tensor_act_model_layers_7_input_layernorm/max_abs": 4.78125, "train/tensor_act_model_layers_7_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_q_proj/norm": 10461.691153606722, "train/tensor_act_model_layers_7_self_attn_q_proj/mean": -0.0406341552734375, "train/tensor_act_model_layers_7_self_attn_q_proj/std": 1.1416046069727064, "train/tensor_act_model_layers_7_self_attn_q_proj/max_abs": 7.0, "train/tensor_act_model_layers_7_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_k_proj/norm": 10485.176929176645, "train/tensor_act_model_layers_7_self_attn_k_proj/mean": -0.0906982421875, "train/tensor_act_model_layers_7_self_attn_k_proj/std": 1.1411216973846043, "train/tensor_act_model_layers_7_self_attn_k_proj/max_abs": 5.21875, "train/tensor_act_model_layers_7_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_v_proj/norm": 3279.989591989278, "train/tensor_act_model_layers_7_self_attn_v_proj/mean": 0.01746368408203125, "train/tensor_act_model_layers_7_self_attn_v_proj/std": 0.35742205340675426, "train/tensor_act_model_layers_7_self_attn_v_proj/max_abs": 2.046875, "train/tensor_act_model_layers_7_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_o_proj/norm": 870.6736716013772, "train/tensor_act_model_layers_7_self_attn_o_proj/mean": -0.0035886764526367188, "train/tensor_act_model_layers_7_self_attn_o_proj/std": 0.0950324238613928, "train/tensor_act_model_layers_7_self_attn_o_proj/max_abs": 0.8203125, "train/tensor_act_model_layers_7_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_self_attn/norm": 870.6736716013772, "train/tensor_act_model_layers_7_self_attn/mean": -0.0035886764526367188, "train/tensor_act_model_layers_7_self_attn/std": 0.0950324238613928, "train/tensor_act_model_layers_7_self_attn/max_abs": 0.8203125, "train/tensor_act_model_layers_7_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_post_attention_layernorm/norm": 9158.870239264383, "train/tensor_act_model_layers_7_post_attention_layernorm/mean": 0.02803802490234375, "train/tensor_act_model_layers_7_post_attention_layernorm/std": 1.0000002372252939, "train/tensor_act_model_layers_7_post_attention_layernorm/max_abs": 4.6875, "train/tensor_act_model_layers_7_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_mlp_up_proj/norm": 3136.1940636118106, "train/tensor_act_model_layers_7_mlp_up_proj/mean": -0.0019998550415039067, "train/tensor_act_model_layers_7_mlp_up_proj/std": 0.1975713855186142, "train/tensor_act_model_layers_7_mlp_up_proj/max_abs": 1.1953125, "train/tensor_act_model_layers_7_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_mlp_down_proj/norm": 1157.7220554563974, "train/tensor_act_model_layers_7_mlp_down_proj/mean": -0.0019550323486328125, "train/tensor_act_model_layers_7_mlp_down_proj/std": 0.12609909852702159, "train/tensor_act_model_layers_7_mlp_down_proj/max_abs": 0.73046875, "train/tensor_act_model_layers_7_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7_mlp/norm": 1157.7220554563974, "train/tensor_act_model_layers_7_mlp/mean": -0.0019550323486328125, "train/tensor_act_model_layers_7_mlp/std": 0.12609909852702159, "train/tensor_act_model_layers_7_mlp/max_abs": 0.73046875, "train/tensor_act_model_layers_7_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_7/norm": 2730.395501469702, "train/tensor_act_model_layers_7/mean": 0.0063190460205078125, "train/tensor_act_model_layers_7/std": 0.29797527457897055, "train/tensor_act_model_layers_7/max_abs": 1.640625, "train/tensor_act_model_layers_7/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_7/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_input_layernorm/norm": 9158.865478523945, "train/tensor_act_model_layers_8_input_layernorm/mean": 0.021881103515625003, "train/tensor_act_model_layers_8_input_layernorm/std": 1.000000241678179, "train/tensor_act_model_layers_8_input_layernorm/max_abs": 4.53125, "train/tensor_act_model_layers_8_input_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_input_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_q_proj/norm": 12639.429603678956, "train/tensor_act_model_layers_8_self_attn_q_proj/mean": -0.048736572265625, "train/tensor_act_model_layers_8_self_attn_q_proj/std": 1.3794029002653125, "train/tensor_act_model_layers_8_self_attn_q_proj/max_abs": 6.09375, "train/tensor_act_model_layers_8_self_attn_q_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_q_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_k_proj/norm": 11854.747864460993, "train/tensor_act_model_layers_8_self_attn_k_proj/mean": -0.0522308349609375, "train/tensor_act_model_layers_8_self_attn_k_proj/std": 1.293951040201286, "train/tensor_act_model_layers_8_self_attn_k_proj/max_abs": 6.375, "train/tensor_act_model_layers_8_self_attn_k_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_k_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_v_proj/norm": 3463.3056672450866, "train/tensor_act_model_layers_8_self_attn_v_proj/mean": -0.0057849884033203125, "train/tensor_act_model_layers_8_self_attn_v_proj/std": 0.37829724816102006, "train/tensor_act_model_layers_8_self_attn_v_proj/max_abs": 1.921875, "train/tensor_act_model_layers_8_self_attn_v_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_v_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_o_proj/norm": 1078.046025070771, "train/tensor_act_model_layers_8_self_attn_o_proj/mean": 0.0038623809814453125, "train/tensor_act_model_layers_8_self_attn_o_proj/std": 0.11758523080684756, "train/tensor_act_model_layers_8_self_attn_o_proj/max_abs": 0.8125, "train/tensor_act_model_layers_8_self_attn_o_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn_o_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_self_attn/norm": 1078.046025070771, "train/tensor_act_model_layers_8_self_attn/mean": 0.0038623809814453125, "train/tensor_act_model_layers_8_self_attn/std": 0.11758523080684756, "train/tensor_act_model_layers_8_self_attn/max_abs": 0.8125, "train/tensor_act_model_layers_8_self_attn/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_self_attn/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_post_attention_layernorm/norm": 9158.873291019005, "train/tensor_act_model_layers_8_post_attention_layernorm/mean": 0.03253173828125, "train/tensor_act_model_layers_8_post_attention_layernorm/std": 1.0000002402811954, "train/tensor_act_model_layers_8_post_attention_layernorm/max_abs": 4.71875, "train/tensor_act_model_layers_8_post_attention_layernorm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_post_attention_layernorm/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_mlp_up_proj/norm": 3753.7269197260766, "train/tensor_act_model_layers_8_mlp_up_proj/mean": 0.00576019287109375, "train/tensor_act_model_layers_8_mlp_up_proj/std": 0.23651187933555926, "train/tensor_act_model_layers_8_mlp_up_proj/max_abs": 1.3671875, "train/tensor_act_model_layers_8_mlp_up_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_mlp_up_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_mlp_down_proj/norm": 1833.4078311255546, "train/tensor_act_model_layers_8_mlp_down_proj/mean": -0.0014677047729492188, "train/tensor_act_model_layers_8_mlp_down_proj/std": 0.20031891610751495, "train/tensor_act_model_layers_8_mlp_down_proj/max_abs": 1.1640625, "train/tensor_act_model_layers_8_mlp_down_proj/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_mlp_down_proj/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8_mlp/norm": 1833.4078311255546, "train/tensor_act_model_layers_8_mlp/mean": -0.0014677047729492188, "train/tensor_act_model_layers_8_mlp/std": 0.20031891610751495, "train/tensor_act_model_layers_8_mlp/max_abs": 1.1640625, "train/tensor_act_model_layers_8_mlp/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8_mlp/frac_near_user_limit": 0.0, "train/tensor_act_model_layers_8/norm": 3714.703350497436, "train/tensor_act_model_layers_8/mean": 0.008716583251953125, "train/tensor_act_model_layers_8/std": 0.40576329341056694, "train/tensor_act_model_layers_8/max_abs": 2.03125, "train/tensor_act_model_layers_8/frac_near_dtype_limit": 0.0, "train/tensor_act_model_layers_8/frac_near_user_limit": 0.0, "train/tensor_act_model_norm/norm": 9158.885131843323, "train/tensor_act_model_norm/mean": 0.0232391357421875, "train/tensor_act_model_norm/std": 1.0000002746237064, "train/tensor_act_model_norm/max_abs": 4.75, "train/tensor_act_model_norm/frac_near_dtype_limit": 0.0, "train/tensor_act_model_norm/frac_near_user_limit": 0.0, "train/tensor_act_model/norm": 9158.885131843323, "train/tensor_act_model/mean": 0.0232391357421875, "train/tensor_act_model/std": 1.0000002746237064, "train/tensor_act_model/max_abs": 4.75, "train/tensor_act_model/frac_near_dtype_limit": 0.0, "train/tensor_act_model/frac_near_user_limit": 0.0, "train/tensor_act_lm_head/norm": 137978.5112112536, "train/tensor_act_lm_head/mean": -2.0576171875000004, "train/tensor_act_lm_head/std": 1.6914375425620019, "train/tensor_act_lm_head/max_abs": 11.8125, "train/tensor_act_lm_head/frac_near_dtype_limit": 0.0, "train/tensor_act_lm_head/frac_near_user_limit": 0.0, "train/tensor_act_/norm": 12.34277911184733, "train/tensor_act_/mean": 3.085545063018799, "train/tensor_act_/std": 0.0, "train/tensor_act_/max_abs": 3.1596059799194336, "train/tensor_act_/frac_near_dtype_limit": 0.0, "train/tensor_act_/frac_near_user_limit": 0.0, "train/tensor_grad_model_norm_weight/norm": 0.3140373561530066, "train/tensor_grad_model_norm_weight/mean": -0.006618499755859375, "train/tensor_grad_model_norm_weight/std": 0.002068276652680219, "train/tensor_grad_model_norm_weight/max_abs": 0.01385498046875, "train/tensor_grad_model_norm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_norm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/norm": 0.26025230307022634, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/mean": -2.4600012693554163e-08, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/std": 0.00029343398646999646, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/max_abs": 0.002655029296875, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/norm": 0.4110867073502657, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/mean": -4.274479579180479e-07, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/std": 0.00046367620843929094, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/max_abs": 0.002716064453125, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/norm": 0.019447025851964624, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/mean": 3.9157457649707794e-05, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/std": 0.000429591868268785, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/max_abs": 0.0015716552734375, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/norm": 0.30612391776426706, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/mean": -4.833564162254333e-07, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/std": 0.0005979014626018539, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/max_abs": 0.004791259765625, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/norm": 0.7119194208474616, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/mean": 4.765111953020096e-06, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/std": 0.0013908427641118966, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/max_abs": 0.009765625, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/norm": 0.16623753694556406, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/mean": 1.1397423804737628e-06, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/std": 0.000324684607977906, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/max_abs": 0.0038604736328125, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/norm": 0.10740945917684312, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/mean": -1.043081283569336e-06, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/std": 0.00020978625517021878, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/max_abs": 0.0018463134765625, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_8_input_layernorm_weight/norm": 0.028055232988969746, "train/tensor_grad_model_layers_8_input_layernorm_weight/mean": -0.00017432868480682373, "train/tensor_grad_model_layers_8_input_layernorm_weight/std": 0.0005966479081292068, "train/tensor_grad_model_layers_8_input_layernorm_weight/max_abs": 0.0020599365234375, "train/tensor_grad_model_layers_8_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_8_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/norm": 0.4239274009773825, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/mean": 6.979462341405451e-07, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/std": 0.00047807733058092964, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/max_abs": 0.0040283203125, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/norm": 0.5500951511265744, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/mean": 8.427305147051811e-07, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/std": 0.0006207572805987063, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/max_abs": 0.00592041015625, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/norm": 0.018391493845650374, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/mean": -1.1431053280830383e-05, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/std": 0.0004077178083436662, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/max_abs": 0.0019989013671875, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/norm": 0.2792116048333057, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/mean": -1.1397060006856918e-06, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/std": 0.0005453423260938054, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/max_abs": 0.004913330078125, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/norm": 0.5816282374777465, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/mean": -3.025401383638382e-06, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/std": 0.0011359983194955572, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/max_abs": 0.0093994140625, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/norm": 0.2207897995078383, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/mean": 1.3531680451706052e-06, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/std": 0.0004312305883395487, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/max_abs": 0.006072998046875, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/norm": 0.11642218871094213, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/mean": -2.4102628231048584e-06, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/std": 0.0002273880887448863, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/max_abs": 0.00244140625, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_7_input_layernorm_weight/norm": 0.02808577331898204, "train/tensor_grad_model_layers_7_input_layernorm_weight/mean": 8.419447112828502e-07, "train/tensor_grad_model_layers_7_input_layernorm_weight/std": 0.000623451731167683, "train/tensor_grad_model_layers_7_input_layernorm_weight/max_abs": 0.0028076171875, "train/tensor_grad_model_layers_7_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_7_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/norm": 0.5091221281177153, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/mean": 1.9668368622660633e-06, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/std": 0.0005738216679627089, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/max_abs": 0.005035400390625, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/norm": 0.6348685313220278, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/mean": 2.6694033294916153e-07, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/std": 0.0007164730821052101, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/max_abs": 0.006103515625, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/norm": 0.020273390128607707, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/mean": 5.274266004562378e-05, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/std": 0.0004466476153536851, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/max_abs": 0.0020751953125, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/norm": 0.330183565352083, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/mean": -1.8938444554805756e-06, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/std": 0.0006448974090784716, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/max_abs": 0.004425048828125, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/norm": 0.6757650208040404, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/mean": 8.448958396911621e-06, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/std": 0.0013198556532964516, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/max_abs": 0.0098876953125, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/norm": 0.1486808388473866, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/mean": -1.889653503894806e-06, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/std": 0.0002903939882593242, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/max_abs": 0.003509521484375, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/norm": 0.08525953765832373, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/mean": -2.3588654585182667e-07, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/std": 0.00016652373622645598, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/max_abs": 0.00115203857421875, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_6_input_layernorm_weight/norm": 0.03215523252833009, "train/tensor_grad_model_layers_6_input_layernorm_weight/mean": -0.0001233704388141632, "train/tensor_grad_model_layers_6_input_layernorm_weight/std": 0.0007029179815078741, "train/tensor_grad_model_layers_6_input_layernorm_weight/max_abs": 0.0034332275390625, "train/tensor_grad_model_layers_6_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_6_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/norm": 0.5447748457558951, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/mean": -6.993068382143974e-07, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/std": 0.000614104388010392, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/max_abs": 0.004608154296875, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/norm": 0.7220449800719276, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/mean": 1.3120006769895554e-07, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/std": 0.0008139678337106606, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/max_abs": 0.005706787109375, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/norm": 0.018823162034157223, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/mean": 4.1157007217407227e-05, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/std": 0.00041555377899105605, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/max_abs": 0.00140380859375, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/norm": 0.3505199657200831, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/mean": 1.3037933968007565e-06, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/std": 0.0006846107163238569, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/max_abs": 0.007171630859375, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/norm": 0.520757618804886, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/mean": 1.1994852684438229e-06, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/std": 0.001017107616730838, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/max_abs": 0.01092529296875, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/norm": 0.09609577828104279, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/mean": 1.6889534890651703e-06, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/std": 0.00018768759095130736, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/max_abs": 0.0019989013671875, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/norm": 0.05909136233456057, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/mean": 5.144684109836817e-07, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/std": 0.00011541363059973877, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/max_abs": 0.00162506103515625, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_5_input_layernorm_weight/norm": 0.01664093901557326, "train/tensor_grad_model_layers_5_input_layernorm_weight/mean": 6.784126162528992e-05, "train/tensor_grad_model_layers_5_input_layernorm_weight/std": 0.00036285050479602693, "train/tensor_grad_model_layers_5_input_layernorm_weight/max_abs": 0.001708984375, "train/tensor_grad_model_layers_5_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_5_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/norm": 0.569249665150902, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/mean": 2.1673622541129593e-06, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/std": 0.0006417847780511843, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/max_abs": 0.00494384765625, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/norm": 0.6969099232771115, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/mean": 3.027264028787613e-06, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/std": 0.0007855715454180655, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/max_abs": 0.00537109375, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/norm": 0.01828787353542204, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/mean": -7.230043411254883e-05, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/std": 0.0003992499171670238, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/max_abs": 0.0018768310546875, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/norm": 0.32410548426276165, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/mean": -1.3430617400445044e-06, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/std": 0.0006330197896350134, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/max_abs": 0.005279541015625, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/norm": 0.38665123552465125, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/mean": -1.292908564209938e-06, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/std": 0.0007551836297561284, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/max_abs": 0.00689697265625, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/norm": 0.07685140577189588, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/mean": -1.5028781490400434e-06, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/std": 0.00015010444818410604, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/max_abs": 0.001800537109375, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/norm": 0.06249469496146752, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/mean": 8.378628990612924e-07, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/std": 0.00012209175806172248, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/max_abs": 0.00142669677734375, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_4_input_layernorm_weight/norm": 0.014499166008893285, "train/tensor_grad_model_layers_4_input_layernorm_weight/mean": -0.00012033060193061829, "train/tensor_grad_model_layers_4_input_layernorm_weight/std": 0.0002978021794515658, "train/tensor_grad_model_layers_4_input_layernorm_weight/max_abs": 0.001190185546875, "train/tensor_grad_model_layers_4_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_4_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/norm": 0.6348835527475227, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/mean": 2.726039383560419e-06, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/std": 0.0007156685057058643, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/max_abs": 0.00628662109375, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/norm": 0.7933408869322305, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/mean": 3.46451997756958e-06, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/std": 0.0008954833779846271, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/max_abs": 0.00823974609375, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/norm": 0.02216423019948128, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/mean": -8.822977542877197e-05, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/std": 0.0004835319855374909, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/max_abs": 0.002593994140625, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/norm": 0.30735278195334903, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/mean": -5.939946277067065e-07, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/std": 0.0006003041614608425, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/max_abs": 0.00531005859375, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/norm": 0.47152372510489016, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/mean": -1.801163307391107e-06, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/std": 0.0009209493170190383, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/max_abs": 0.007171630859375, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/norm": 0.11293648181112204, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/mean": -1.7615966498851776e-06, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/std": 0.00022058114423191606, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/max_abs": 0.0022735595703125, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/norm": 0.059437744968443, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/mean": 1.8550781533122063e-07, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/std": 0.00011609377149315461, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/max_abs": 0.00091552734375, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_3_input_layernorm_weight/norm": 0.016322047857146693, "train/tensor_grad_model_layers_3_input_layernorm_weight/mean": -2.587307244539261e-05, "train/tensor_grad_model_layers_3_input_layernorm_weight/std": 0.0003610962964440077, "train/tensor_grad_model_layers_3_input_layernorm_weight/max_abs": 0.001678466796875, "train/tensor_grad_model_layers_3_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_3_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/norm": 0.7576419599101569, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/mean": -2.082379069179297e-06, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/std": 0.0008548833918412956, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/max_abs": 0.007598876953125, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/norm": 0.9297782789516292, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/mean": 6.190501153469086e-06, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/std": 0.0010473705549273293, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/max_abs": 0.0074462890625, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/norm": 0.02594651082943509, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/mean": -7.686018943786621e-05, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/std": 0.0005703787486938851, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/max_abs": 0.00193023681640625, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/norm": 0.32488650761207233, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/mean": 4.579778760671616e-06, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/std": 0.000634546290983288, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/max_abs": 0.005889892578125, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/norm": 0.5176637974496008, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/mean": 6.784684956073761e-06, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/std": 0.001011064996978713, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/max_abs": 0.00714111328125, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/norm": 0.10246288558032977, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/mean": -3.6008714232593775e-07, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/std": 0.00020012373680981202, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/max_abs": 0.0022430419921875, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/norm": 0.0647402350765535, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/mean": 7.437483873218298e-07, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/std": 0.00012644644580173545, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/max_abs": 0.001495361328125, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_2_input_layernorm_weight/norm": 0.017496555534344645, "train/tensor_grad_model_layers_2_input_layernorm_weight/mean": 0.00012053549289703369, "train/tensor_grad_model_layers_2_input_layernorm_weight/std": 0.00036869786499644087, "train/tensor_grad_model_layers_2_input_layernorm_weight/max_abs": 0.0019378662109375, "train/tensor_grad_model_layers_2_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_2_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/norm": 1.0471109152906861, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/mean": 4.7208741307258614e-06, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/std": 0.0011805190822957745, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/max_abs": 0.01129150390625, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/norm": 1.1280915907881908, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/mean": 1.3246608432382343e-06, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/std": 0.0012711289102917448, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/max_abs": 0.00927734375, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/norm": 0.03569999716599103, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/mean": -5.647540092468262e-05, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/std": 0.0007896023136567698, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/max_abs": 0.00347900390625, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/norm": 0.43539001650984194, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/mean": 9.60018951445818e-07, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/std": 0.0008503758163232629, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/max_abs": 0.0111083984375, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/norm": 0.6962897473261009, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/mean": 1.1696829460561277e-07, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/std": 0.0013599450739407621, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/max_abs": 0.01153564453125, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/norm": 0.0906099734509409, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/mean": 8.337037797900848e-07, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/std": 0.00017697632508598447, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/max_abs": 0.002410888671875, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/norm": 0.0728063202556278, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/mean": 1.557054929435253e-08, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/std": 0.00014220218988788194, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/max_abs": 0.0015869140625, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_1_input_layernorm_weight/norm": 0.018508678412802338, "train/tensor_grad_model_layers_1_input_layernorm_weight/mean": 2.3896805942058563e-05, "train/tensor_grad_model_layers_1_input_layernorm_weight/std": 0.0004098031937883901, "train/tensor_grad_model_layers_1_input_layernorm_weight/max_abs": 0.0017547607421875, "train/tensor_grad_model_layers_1_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_1_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/norm": 1.4804172154618904, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/mean": -4.631292540580035e-06, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/std": 0.0016695101003668653, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/max_abs": 0.01483154296875, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/norm": 2.206872228784369, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/mean": 7.352093234658241e-06, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/std": 0.002488334277224233, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/max_abs": 0.015380859375, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/norm": 0.08442042505521935, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/mean": 5.408190190792084e-05, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/std": 0.0018718482317452295, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/max_abs": 0.007232666015625, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/norm": 1.0784712525676086, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/mean": 6.760121323168278e-06, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/std": 0.0021064004423660735, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/max_abs": 0.027099609375, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/norm": 1.7430773459698234, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/mean": -7.91158527135849e-06, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/std": 0.0034055304413431733, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/max_abs": 0.0286865234375, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/norm": 0.07944339313752548, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/mean": 1.2395321391522884e-07, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/std": 0.0001551661666112421, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/max_abs": 0.00147247314453125, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/norm": 0.057045541566442495, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/mean": 4.0802115108817816e-07, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/std": 0.00011141785897713587, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/max_abs": 0.001007080078125, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_layers_0_input_layernorm_weight/norm": 0.044414914575084743, "train/tensor_grad_model_layers_0_input_layernorm_weight/mean": 0.00012800097465515137, "train/tensor_grad_model_layers_0_input_layernorm_weight/std": 0.0009775568531857459, "train/tensor_grad_model_layers_0_input_layernorm_weight/max_abs": 0.00445556640625, "train/tensor_grad_model_layers_0_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_layers_0_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_grad_model_embed_tokens_weight/norm": 1.3963682753312472, "train/tensor_grad_model_embed_tokens_weight/mean": -6.477348506450653e-07, "train/tensor_grad_model_embed_tokens_weight/std": 0.00048201806107111585, "train/tensor_grad_model_embed_tokens_weight/max_abs": 0.05859375, "train/tensor_grad_model_embed_tokens_weight/frac_near_dtype_limit": 0.0, "train/tensor_grad_model_embed_tokens_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_embed_tokens_weight/norm": 47.75, "train/tensor_param_model_embed_tokens_weight/mean": -0.00093841552734375, "train/tensor_param_model_embed_tokens_weight/std": 0.06591796875, "train/tensor_param_model_embed_tokens_weight/max_abs": 0.25, "train/tensor_param_model_embed_tokens_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_embed_tokens_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/norm": 4.625, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/mean": -4.673004150390625e-05, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/std": 0.0361328125, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/max_abs": 0.138671875, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/norm": 4.21875, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/mean": 0.0001049041748046875, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/std": 0.032958984375, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/max_abs": 0.1328125, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/norm": 2.5625, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/mean": 0.0001068115234375, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/max_abs": 0.08251953125, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/norm": 2.546875, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/mean": 1.424551010131836e-05, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/max_abs": 0.08544921875, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_mlp_up_proj_weight/norm": 4.6875, "train/tensor_param_model_layers_0_mlp_up_proj_weight/mean": -7.200241088867188e-05, "train/tensor_param_model_layers_0_mlp_up_proj_weight/std": 0.0211181640625, "train/tensor_param_model_layers_0_mlp_up_proj_weight/max_abs": 0.0859375, "train/tensor_param_model_layers_0_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_mlp_down_proj_weight/norm": 4.75, "train/tensor_param_model_layers_0_mlp_down_proj_weight/mean": 7.05718994140625e-05, "train/tensor_param_model_layers_0_mlp_down_proj_weight/std": 0.0213623046875, "train/tensor_param_model_layers_0_mlp_down_proj_weight/max_abs": 0.09033203125, "train/tensor_param_model_layers_0_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_0_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_0_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_0_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_0_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_0_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/norm": 4.78125, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/mean": -9.870529174804688e-05, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/std": 0.037353515625, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/max_abs": 0.1494140625, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/norm": 4.84375, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/mean": 0.00026702880859375, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/std": 0.037841796875, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/max_abs": 0.166015625, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/norm": 2.796875, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/mean": -0.00028228759765625, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/std": 0.0218505859375, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/max_abs": 0.080078125, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/norm": 2.84375, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/mean": -4.38690185546875e-05, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/std": 0.022216796875, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/max_abs": 0.076171875, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_mlp_up_proj_weight/norm": 4.59375, "train/tensor_param_model_layers_1_mlp_up_proj_weight/mean": -5.602836608886719e-05, "train/tensor_param_model_layers_1_mlp_up_proj_weight/std": 0.020751953125, "train/tensor_param_model_layers_1_mlp_up_proj_weight/max_abs": 0.08154296875, "train/tensor_param_model_layers_1_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_mlp_down_proj_weight/norm": 4.59375, "train/tensor_param_model_layers_1_mlp_down_proj_weight/mean": -2.944469451904297e-05, "train/tensor_param_model_layers_1_mlp_down_proj_weight/std": 0.020751953125, "train/tensor_param_model_layers_1_mlp_down_proj_weight/max_abs": 0.080078125, "train/tensor_param_model_layers_1_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_1_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_1_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_1_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_1_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_1_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/norm": 5.21875, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/mean": -0.000484466552734375, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/std": 0.040771484375, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/max_abs": 0.2314453125, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/norm": 4.71875, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/mean": 0.0003910064697265625, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/std": 0.036865234375, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/max_abs": 0.20703125, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/norm": 2.921875, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/mean": 1.2099742889404297e-05, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/std": 0.0228271484375, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/max_abs": 0.08642578125, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/norm": 3.015625, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/mean": -1.9311904907226562e-05, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/std": 0.0235595703125, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/max_abs": 0.1142578125, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_mlp_up_proj_weight/norm": 4.5, "train/tensor_param_model_layers_2_mlp_up_proj_weight/mean": 2.9325485229492188e-05, "train/tensor_param_model_layers_2_mlp_up_proj_weight/std": 0.0203857421875, "train/tensor_param_model_layers_2_mlp_up_proj_weight/max_abs": 0.0859375, "train/tensor_param_model_layers_2_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_mlp_down_proj_weight/norm": 4.53125, "train/tensor_param_model_layers_2_mlp_down_proj_weight/mean": -9.822845458984375e-05, "train/tensor_param_model_layers_2_mlp_down_proj_weight/std": 0.0203857421875, "train/tensor_param_model_layers_2_mlp_down_proj_weight/max_abs": 0.091796875, "train/tensor_param_model_layers_2_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_2_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_2_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_2_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_2_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_2_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/norm": 5.4375, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/mean": 0.0002689361572265625, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/std": 0.04248046875, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/max_abs": 0.2265625, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/norm": 4.65625, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/mean": 0.00057220458984375, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/std": 0.036376953125, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/max_abs": 0.1533203125, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/norm": 3.0625, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/mean": 4.839897155761719e-05, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/std": 0.02392578125, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/max_abs": 0.1044921875, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/norm": 3.171875, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/mean": -0.000213623046875, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/std": 0.0247802734375, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/max_abs": 0.09814453125, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_mlp_up_proj_weight/norm": 4.5, "train/tensor_param_model_layers_3_mlp_up_proj_weight/mean": -0.000148773193359375, "train/tensor_param_model_layers_3_mlp_up_proj_weight/std": 0.020263671875, "train/tensor_param_model_layers_3_mlp_up_proj_weight/max_abs": 0.083984375, "train/tensor_param_model_layers_3_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_mlp_down_proj_weight/norm": 4.5, "train/tensor_param_model_layers_3_mlp_down_proj_weight/mean": -0.0002155303955078125, "train/tensor_param_model_layers_3_mlp_down_proj_weight/std": 0.020263671875, "train/tensor_param_model_layers_3_mlp_down_proj_weight/max_abs": 0.0849609375, "train/tensor_param_model_layers_3_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_3_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_3_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_3_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_3_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_3_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/norm": 4.5625, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/mean": 0.0004425048828125, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/std": 0.03564453125, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/max_abs": 0.1494140625, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/norm": 4.46875, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/mean": 0.0002346038818359375, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/std": 0.034912109375, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/max_abs": 0.1533203125, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/norm": 2.984375, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/mean": -8.440017700195312e-05, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/std": 0.0233154296875, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/max_abs": 0.09033203125, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/norm": 3.046875, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/mean": -0.00016880035400390625, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/std": 0.0238037109375, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/max_abs": 0.10546875, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_mlp_up_proj_weight/norm": 4.46875, "train/tensor_param_model_layers_4_mlp_up_proj_weight/mean": -1.1563301086425781e-05, "train/tensor_param_model_layers_4_mlp_up_proj_weight/std": 0.020263671875, "train/tensor_param_model_layers_4_mlp_up_proj_weight/max_abs": 0.08740234375, "train/tensor_param_model_layers_4_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_mlp_down_proj_weight/norm": 4.4375, "train/tensor_param_model_layers_4_mlp_down_proj_weight/mean": 6.8247318267822266e-06, "train/tensor_param_model_layers_4_mlp_down_proj_weight/std": 0.02001953125, "train/tensor_param_model_layers_4_mlp_down_proj_weight/max_abs": 0.08984375, "train/tensor_param_model_layers_4_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_4_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_4_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_4_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_4_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_4_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/norm": 4.84375, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/mean": -9.489059448242188e-05, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/std": 0.037841796875, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/max_abs": 0.1455078125, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/norm": 4.53125, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/mean": -0.0002918243408203125, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/std": 0.035400390625, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/max_abs": 0.1640625, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/norm": 2.921875, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/mean": -0.00018024444580078125, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/std": 0.0228271484375, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/max_abs": 0.09765625, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/norm": 3.03125, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/mean": 0.00019550323486328125, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/std": 0.023681640625, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/max_abs": 0.10888671875, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_mlp_up_proj_weight/norm": 4.5, "train/tensor_param_model_layers_5_mlp_up_proj_weight/mean": -0.0001430511474609375, "train/tensor_param_model_layers_5_mlp_up_proj_weight/std": 0.020263671875, "train/tensor_param_model_layers_5_mlp_up_proj_weight/max_abs": 0.091796875, "train/tensor_param_model_layers_5_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_mlp_down_proj_weight/norm": 4.40625, "train/tensor_param_model_layers_5_mlp_down_proj_weight/mean": 0.0001621246337890625, "train/tensor_param_model_layers_5_mlp_down_proj_weight/std": 0.0198974609375, "train/tensor_param_model_layers_5_mlp_down_proj_weight/max_abs": 0.0888671875, "train/tensor_param_model_layers_5_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_5_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_5_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_5_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_5_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_5_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/norm": 5.28125, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/mean": 6.67572021484375e-05, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/std": 0.041259765625, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/max_abs": 0.1728515625, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/norm": 5.03125, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/mean": 0.00015926361083984375, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/std": 0.039306640625, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/max_abs": 0.16796875, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/norm": 3.21875, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/mean": -0.000270843505859375, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/std": 0.025146484375, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/max_abs": 0.125, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/norm": 3.515625, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/mean": 0.0003662109375, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/std": 0.0274658203125, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/max_abs": 0.1201171875, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_mlp_up_proj_weight/norm": 4.5, "train/tensor_param_model_layers_6_mlp_up_proj_weight/mean": 8.106231689453125e-05, "train/tensor_param_model_layers_6_mlp_up_proj_weight/std": 0.020263671875, "train/tensor_param_model_layers_6_mlp_up_proj_weight/max_abs": 0.083984375, "train/tensor_param_model_layers_6_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_mlp_down_proj_weight/norm": 4.5, "train/tensor_param_model_layers_6_mlp_down_proj_weight/mean": 4.982948303222656e-05, "train/tensor_param_model_layers_6_mlp_down_proj_weight/std": 0.020263671875, "train/tensor_param_model_layers_6_mlp_down_proj_weight/max_abs": 0.091796875, "train/tensor_param_model_layers_6_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_6_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_6_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_6_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_6_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_6_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/norm": 4.84375, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/mean": -7.963180541992188e-05, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/std": 0.037841796875, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/max_abs": 0.1328125, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/norm": 4.53125, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/mean": 0.00026702880859375, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/std": 0.035400390625, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/max_abs": 0.1484375, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/norm": 3.109375, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/mean": -0.0002193450927734375, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/std": 0.0242919921875, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/max_abs": 0.125, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/norm": 3.328125, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/mean": -0.00015354156494140625, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/std": 0.0260009765625, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/max_abs": 0.11328125, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_mlp_up_proj_weight/norm": 4.59375, "train/tensor_param_model_layers_7_mlp_up_proj_weight/mean": -6.246566772460938e-05, "train/tensor_param_model_layers_7_mlp_up_proj_weight/std": 0.0206298828125, "train/tensor_param_model_layers_7_mlp_up_proj_weight/max_abs": 0.0849609375, "train/tensor_param_model_layers_7_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_mlp_down_proj_weight/norm": 4.625, "train/tensor_param_model_layers_7_mlp_down_proj_weight/mean": 1.9550323486328125e-05, "train/tensor_param_model_layers_7_mlp_down_proj_weight/std": 0.0208740234375, "train/tensor_param_model_layers_7_mlp_down_proj_weight/max_abs": 0.09423828125, "train/tensor_param_model_layers_7_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_7_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_7_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_7_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_7_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_7_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/norm": 5.65625, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/mean": 7.486343383789062e-05, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/std": 0.044189453125, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/max_abs": 0.1806640625, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_q_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/norm": 5.34375, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/mean": -0.0002288818359375, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/std": 0.041748046875, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/max_abs": 0.1748046875, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_k_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/norm": 3.265625, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/mean": -0.0002651214599609375, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/std": 0.0255126953125, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/max_abs": 0.125, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_v_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/norm": 3.953125, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/mean": -0.0001621246337890625, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/std": 0.0308837890625, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/max_abs": 0.125, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_self_attn_o_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_mlp_up_proj_weight/norm": 4.875, "train/tensor_param_model_layers_8_mlp_up_proj_weight/mean": -0.000225067138671875, "train/tensor_param_model_layers_8_mlp_up_proj_weight/std": 0.02197265625, "train/tensor_param_model_layers_8_mlp_up_proj_weight/max_abs": 0.103515625, "train/tensor_param_model_layers_8_mlp_up_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_mlp_up_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_mlp_down_proj_weight/norm": 5.09375, "train/tensor_param_model_layers_8_mlp_down_proj_weight/mean": -0.00016117095947265625, "train/tensor_param_model_layers_8_mlp_down_proj_weight/std": 0.0230712890625, "train/tensor_param_model_layers_8_mlp_down_proj_weight/max_abs": 0.08642578125, "train/tensor_param_model_layers_8_mlp_down_proj_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_mlp_down_proj_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_input_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_8_input_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_8_input_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_8_input_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_8_input_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_input_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/norm": 11.3125, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/mean": 1.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/std": 0.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/max_abs": 1.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_layers_8_post_attention_layernorm_weight/frac_near_user_limit": 0.0, "train/tensor_param_model_norm_weight/norm": 11.3125, "train/tensor_param_model_norm_weight/mean": 1.0, "train/tensor_param_model_norm_weight/std": 0.0, "train/tensor_param_model_norm_weight/max_abs": 1.0, "train/tensor_param_model_norm_weight/frac_near_dtype_limit": 0.0, "train/tensor_param_model_norm_weight/frac_near_user_limit": 0.0} +{"step": 750, "epoch": 1.0107853050219076, "timestamp": 1786256369.8721795, "train_runtime": 1545.7365, "train_samples_per_second": 621.063, "train_steps_per_second": 0.485, "total_flos": 4354347480907776.0, "train_loss": 61.381723103841146, "train/total_time_seconds": 676.0385475568473, "train/time_per_step_avg": 0.9476513889431953, "train/epoch_time_elapsed": 24.92423267289996, "train/estimated_remaining_minutes": 0.0} +{"step": 750, "epoch": 1.0107853050219076, "timestamp": 1786256380.8504226, "eval_loss": 3.108103036880493, "eval_runtime": 9.5225, "eval_samples_per_second": 1000.475, "eval_steps_per_second": 12.602, "train/total_time_seconds": 676.0385475568473, "train/time_per_step_avg": 0.9476513889431953, "train/epoch_time_elapsed": 35.902476370334625, "train/estimated_remaining_minutes": 0.0}