w-ahmad commited on
Commit
6e75d6d
·
verified ·
1 Parent(s): 474dcce

Auto upload 2026-08-09T07:04:11.258775 (part 2)

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. out/glu-waleed-94L_run/checkpoint-600/rng_state.pth +3 -0
  2. out/glu-waleed-94L_run/checkpoint-600/scheduler.pt +3 -0
  3. out/glu-waleed-94L_run/checkpoint-600/tokenizer.json +0 -0
  4. out/glu-waleed-94L_run/checkpoint-600/tokenizer_config.json +13 -0
  5. out/glu-waleed-94L_run/checkpoint-600/trainer_state.json +340 -0
  6. out/glu-waleed-94L_run/checkpoint-600/training_args.bin +3 -0
  7. out/glu-waleed-94L_run/checkpoint-700/config.json +35 -0
  8. out/glu-waleed-94L_run/checkpoint-700/model.safetensors +3 -0
  9. out/glu-waleed-94L_run/checkpoint-700/optimizer.pt +3 -0
  10. out/glu-waleed-94L_run/checkpoint-700/rng_state.pth +3 -0
  11. out/glu-waleed-94L_run/checkpoint-700/scheduler.pt +3 -0
  12. out/glu-waleed-94L_run/checkpoint-700/tokenizer.json +0 -0
  13. out/glu-waleed-94L_run/checkpoint-700/tokenizer_config.json +13 -0
  14. out/glu-waleed-94L_run/checkpoint-700/trainer_state.json +391 -0
  15. out/glu-waleed-94L_run/checkpoint-700/training_args.bin +3 -0
  16. out/glu-waleed-94L_run/checkpoint-800/config.json +35 -0
  17. out/glu-waleed-94L_run/checkpoint-800/model.safetensors +3 -0
  18. out/glu-waleed-94L_run/checkpoint-800/optimizer.pt +3 -0
  19. out/glu-waleed-94L_run/checkpoint-800/rng_state.pth +3 -0
  20. out/glu-waleed-94L_run/checkpoint-800/scheduler.pt +3 -0
  21. out/glu-waleed-94L_run/checkpoint-800/tokenizer.json +0 -0
  22. out/glu-waleed-94L_run/checkpoint-800/tokenizer_config.json +13 -0
  23. out/glu-waleed-94L_run/checkpoint-800/trainer_state.json +442 -0
  24. out/glu-waleed-94L_run/checkpoint-800/training_args.bin +3 -0
  25. out/glu-waleed-94L_run/checkpoint-900/config.json +35 -0
  26. out/glu-waleed-94L_run/checkpoint-900/model.safetensors +3 -0
  27. out/glu-waleed-94L_run/checkpoint-900/optimizer.pt +3 -0
  28. out/glu-waleed-94L_run/checkpoint-900/rng_state.pth +3 -0
  29. out/glu-waleed-94L_run/checkpoint-900/scheduler.pt +3 -0
  30. out/glu-waleed-94L_run/checkpoint-900/tokenizer.json +0 -0
  31. out/glu-waleed-94L_run/checkpoint-900/tokenizer_config.json +13 -0
  32. out/glu-waleed-94L_run/checkpoint-900/trainer_state.json +493 -0
  33. out/glu-waleed-94L_run/checkpoint-900/training_args.bin +3 -0
  34. out/glu-waleed-94L_run/config.json +35 -0
  35. out/glu-waleed-94L_run/model.safetensors +3 -0
  36. out/glu-waleed-94L_run/tokenizer.json +0 -0
  37. out/glu-waleed-94L_run/tokenizer_config.json +13 -0
  38. out/glu-waleed-94L_run/training_args.bin +3 -0
  39. out/glu-waleed-94L_run/training_log.jsonl +0 -0
  40. out/mlp-s10-94L_run/README.md +87 -0
  41. out/mlp-s10-94L_run/checkpoint-100/config.json +35 -0
  42. out/mlp-s10-94L_run/checkpoint-100/model.safetensors +3 -0
  43. out/mlp-s10-94L_run/checkpoint-100/optimizer.pt +3 -0
  44. out/mlp-s10-94L_run/checkpoint-100/rng_state.pth +3 -0
  45. out/mlp-s10-94L_run/checkpoint-100/scheduler.pt +3 -0
  46. out/mlp-s10-94L_run/checkpoint-100/tokenizer.json +0 -0
  47. out/mlp-s10-94L_run/checkpoint-100/tokenizer_config.json +13 -0
  48. out/mlp-s10-94L_run/checkpoint-100/trainer_state.json +85 -0
  49. out/mlp-s10-94L_run/checkpoint-100/training_args.bin +3 -0
  50. out/mlp-s10-94L_run/checkpoint-1000/config.json +35 -0
out/glu-waleed-94L_run/checkpoint-600/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b0b8a6e3878f9402461193b241d8f1ee8546c6ad03f43e5b9dab8f4fc8c4d065
3
+ size 14244
out/glu-waleed-94L_run/checkpoint-600/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c5502244c7ba8b61ab0a3b01cdc7e5e2629060a0565d6b782445d6ba31022cee
3
+ size 1064
out/glu-waleed-94L_run/checkpoint-600/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/glu-waleed-94L_run/checkpoint-600/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/glu-waleed-94L_run/checkpoint-600/trainer_state.json ADDED
@@ -0,0 +1,340 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.3235373416015098,
6
+ "eval_steps": 50,
7
+ "global_step": 600,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.625,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.4543212890625,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.2314453125,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.255674743652342,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.911471843719482,
29
+ "eval_runtime": 20.9396,
30
+ "eval_samples_per_second": 454.975,
31
+ "eval_steps_per_second": 3.582,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 8.75,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.663941955566408,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 4.15625,
44
+ "learning_rate": 0.001,
45
+ "loss": 23.1123046875,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 1.578125,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.97301483154297,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.725912094116211,
58
+ "eval_runtime": 20.3952,
59
+ "eval_samples_per_second": 467.12,
60
+ "eval_steps_per_second": 3.677,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.06470746832030197,
65
+ "grad_norm": 0.2099609375,
66
+ "learning_rate": 0.001,
67
+ "loss": 22.912661743164062,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07549204637368563,
72
+ "grad_norm": 0.859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 22.89833984375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08088433540037746,
79
+ "eval_loss": 5.71552038192749,
80
+ "eval_runtime": 20.5186,
81
+ "eval_samples_per_second": 464.31,
82
+ "eval_steps_per_second": 3.655,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.08627662442706929,
87
+ "grad_norm": 5.3125,
88
+ "learning_rate": 0.001,
89
+ "loss": 22.871157836914062,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09706120248045295,
94
+ "grad_norm": 3.515625,
95
+ "learning_rate": 0.001,
96
+ "loss": 22.64031982421875,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.10784578053383662,
101
+ "grad_norm": 2.796875,
102
+ "learning_rate": 0.001,
103
+ "loss": 21.882586669921874,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.10784578053383662,
108
+ "eval_loss": 5.379149913787842,
109
+ "eval_runtime": 19.954,
110
+ "eval_samples_per_second": 477.447,
111
+ "eval_steps_per_second": 3.759,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11863035858722028,
116
+ "grad_norm": 3.0,
117
+ "learning_rate": 0.001,
118
+ "loss": 21.073570251464844,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.12941493664060394,
123
+ "grad_norm": 26.625,
124
+ "learning_rate": 0.001,
125
+ "loss": 20.38078918457031,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.13480722566729578,
130
+ "eval_loss": 4.969682693481445,
131
+ "eval_runtime": 20.8528,
132
+ "eval_samples_per_second": 456.87,
133
+ "eval_steps_per_second": 3.597,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.1401995146939876,
138
+ "grad_norm": 5.5625,
139
+ "learning_rate": 0.001,
140
+ "loss": 19.993435668945313,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.15098409274737126,
145
+ "grad_norm": 3.84375,
146
+ "learning_rate": 0.001,
147
+ "loss": 19.312832641601563,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.1617686708007549,
152
+ "grad_norm": 8.1875,
153
+ "learning_rate": 0.001,
154
+ "loss": 18.880908203125,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.1617686708007549,
159
+ "eval_loss": 4.66710090637207,
160
+ "eval_runtime": 20.0053,
161
+ "eval_samples_per_second": 476.224,
162
+ "eval_steps_per_second": 3.749,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.17255324885413859,
167
+ "grad_norm": 8.6875,
168
+ "learning_rate": 0.001,
169
+ "loss": 18.437432861328126,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18333782690752223,
174
+ "grad_norm": 8.0,
175
+ "learning_rate": 0.001,
176
+ "loss": 18.02788543701172,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18873011593421407,
181
+ "eval_loss": 4.424458980560303,
182
+ "eval_runtime": 20.6161,
183
+ "eval_samples_per_second": 462.114,
184
+ "eval_steps_per_second": 3.638,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1941224049609059,
189
+ "grad_norm": 9.9375,
190
+ "learning_rate": 0.001,
191
+ "loss": 17.731655883789063,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20490698301428956,
196
+ "grad_norm": 15.625,
197
+ "learning_rate": 0.001,
198
+ "loss": 17.360447692871094,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.21569156106767323,
203
+ "grad_norm": 4.71875,
204
+ "learning_rate": 0.001,
205
+ "loss": 17.05499267578125,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.21569156106767323,
210
+ "eval_loss": 4.228377342224121,
211
+ "eval_runtime": 20.6518,
212
+ "eval_samples_per_second": 461.316,
213
+ "eval_steps_per_second": 3.632,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22647613912105688,
218
+ "grad_norm": 3.03125,
219
+ "learning_rate": 0.001,
220
+ "loss": 16.765740966796876,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.23726071717444056,
225
+ "grad_norm": 16.625,
226
+ "learning_rate": 0.001,
227
+ "loss": 16.70984344482422,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.2426530062011324,
232
+ "eval_loss": 4.115875244140625,
233
+ "eval_runtime": 17.5037,
234
+ "eval_samples_per_second": 544.283,
235
+ "eval_steps_per_second": 4.285,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.2480452952278242,
240
+ "grad_norm": 9.625,
241
+ "learning_rate": 0.001,
242
+ "loss": 16.492950439453125,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2588298732812079,
247
+ "grad_norm": 4.4375,
248
+ "learning_rate": 0.001,
249
+ "loss": 16.204039001464842,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.26961445133459155,
254
+ "grad_norm": 3.21875,
255
+ "learning_rate": 0.001,
256
+ "loss": 15.97710723876953,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.26961445133459155,
261
+ "eval_loss": 3.9576539993286133,
262
+ "eval_runtime": 16.9826,
263
+ "eval_samples_per_second": 560.986,
264
+ "eval_steps_per_second": 4.416,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803990293879752,
269
+ "grad_norm": 10.5,
270
+ "learning_rate": 0.001,
271
+ "loss": 15.733917236328125,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29118360744135885,
276
+ "grad_norm": 9.8125,
277
+ "learning_rate": 0.001,
278
+ "loss": 15.579618835449219,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.2965758964680507,
283
+ "eval_loss": 3.861560821533203,
284
+ "eval_runtime": 16.9704,
285
+ "eval_samples_per_second": 561.389,
286
+ "eval_steps_per_second": 4.419,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3019681854947425,
291
+ "grad_norm": 3.984375,
292
+ "learning_rate": 0.001,
293
+ "loss": 15.382864379882813,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.3127527635481262,
298
+ "grad_norm": 2.75,
299
+ "learning_rate": 0.001,
300
+ "loss": 15.098277282714843,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.3235373416015098,
305
+ "grad_norm": 5.75,
306
+ "learning_rate": 0.001,
307
+ "loss": 14.87418212890625,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.3235373416015098,
312
+ "eval_loss": 3.683532238006592,
313
+ "eval_runtime": 17.1359,
314
+ "eval_samples_per_second": 555.968,
315
+ "eval_steps_per_second": 4.377,
316
+ "step": 600
317
+ }
318
+ ],
319
+ "logging_steps": 20,
320
+ "max_steps": 1500,
321
+ "num_input_tokens_seen": 0,
322
+ "num_train_epochs": 1,
323
+ "save_steps": 100,
324
+ "stateful_callbacks": {
325
+ "TrainerControl": {
326
+ "args": {
327
+ "should_epoch_stop": false,
328
+ "should_evaluate": false,
329
+ "should_log": false,
330
+ "should_save": true,
331
+ "should_training_stop": false
332
+ },
333
+ "attributes": {}
334
+ }
335
+ },
336
+ "total_flos": 1.45569997651968e+16,
337
+ "train_batch_size": 128,
338
+ "trial_name": null,
339
+ "trial_params": null
340
+ }
out/glu-waleed-94L_run/checkpoint-600/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3e12a35f98937379bc279e337a2141ffbc223c6273ca4783d094a415f227e198
3
+ size 4920
out/glu-waleed-94L_run/checkpoint-700/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "waleed",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/glu-waleed-94L_run/checkpoint-700/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1785022fb6baa8b8074d19434738583cb426f88dfd1e61c2a5d7faafc6494452
3
+ size 31992520
out/glu-waleed-94L_run/checkpoint-700/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cbc94a350a24d9fdb3e00a8750372ee155b281ba3285de5269b50be144718b16
3
+ size 64520514
out/glu-waleed-94L_run/checkpoint-700/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c07c9483d2aaa0e0aa4859fa05bacc55a60e0f30ff9c95a3b76854e880483a96
3
+ size 14244
out/glu-waleed-94L_run/checkpoint-700/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3173cd6908322b02fdacbfeb79bbb6a1a1a40d218262cceb79ee8c11c4fa07d7
3
+ size 1064
out/glu-waleed-94L_run/checkpoint-700/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/glu-waleed-94L_run/checkpoint-700/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/glu-waleed-94L_run/checkpoint-700/trainer_state.json ADDED
@@ -0,0 +1,391 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.37746023186842814,
6
+ "eval_steps": 50,
7
+ "global_step": 700,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.625,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.4543212890625,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.2314453125,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.255674743652342,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.911471843719482,
29
+ "eval_runtime": 20.9396,
30
+ "eval_samples_per_second": 454.975,
31
+ "eval_steps_per_second": 3.582,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 8.75,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.663941955566408,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 4.15625,
44
+ "learning_rate": 0.001,
45
+ "loss": 23.1123046875,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 1.578125,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.97301483154297,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.725912094116211,
58
+ "eval_runtime": 20.3952,
59
+ "eval_samples_per_second": 467.12,
60
+ "eval_steps_per_second": 3.677,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.06470746832030197,
65
+ "grad_norm": 0.2099609375,
66
+ "learning_rate": 0.001,
67
+ "loss": 22.912661743164062,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07549204637368563,
72
+ "grad_norm": 0.859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 22.89833984375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08088433540037746,
79
+ "eval_loss": 5.71552038192749,
80
+ "eval_runtime": 20.5186,
81
+ "eval_samples_per_second": 464.31,
82
+ "eval_steps_per_second": 3.655,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.08627662442706929,
87
+ "grad_norm": 5.3125,
88
+ "learning_rate": 0.001,
89
+ "loss": 22.871157836914062,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09706120248045295,
94
+ "grad_norm": 3.515625,
95
+ "learning_rate": 0.001,
96
+ "loss": 22.64031982421875,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.10784578053383662,
101
+ "grad_norm": 2.796875,
102
+ "learning_rate": 0.001,
103
+ "loss": 21.882586669921874,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.10784578053383662,
108
+ "eval_loss": 5.379149913787842,
109
+ "eval_runtime": 19.954,
110
+ "eval_samples_per_second": 477.447,
111
+ "eval_steps_per_second": 3.759,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11863035858722028,
116
+ "grad_norm": 3.0,
117
+ "learning_rate": 0.001,
118
+ "loss": 21.073570251464844,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.12941493664060394,
123
+ "grad_norm": 26.625,
124
+ "learning_rate": 0.001,
125
+ "loss": 20.38078918457031,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.13480722566729578,
130
+ "eval_loss": 4.969682693481445,
131
+ "eval_runtime": 20.8528,
132
+ "eval_samples_per_second": 456.87,
133
+ "eval_steps_per_second": 3.597,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.1401995146939876,
138
+ "grad_norm": 5.5625,
139
+ "learning_rate": 0.001,
140
+ "loss": 19.993435668945313,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.15098409274737126,
145
+ "grad_norm": 3.84375,
146
+ "learning_rate": 0.001,
147
+ "loss": 19.312832641601563,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.1617686708007549,
152
+ "grad_norm": 8.1875,
153
+ "learning_rate": 0.001,
154
+ "loss": 18.880908203125,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.1617686708007549,
159
+ "eval_loss": 4.66710090637207,
160
+ "eval_runtime": 20.0053,
161
+ "eval_samples_per_second": 476.224,
162
+ "eval_steps_per_second": 3.749,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.17255324885413859,
167
+ "grad_norm": 8.6875,
168
+ "learning_rate": 0.001,
169
+ "loss": 18.437432861328126,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18333782690752223,
174
+ "grad_norm": 8.0,
175
+ "learning_rate": 0.001,
176
+ "loss": 18.02788543701172,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18873011593421407,
181
+ "eval_loss": 4.424458980560303,
182
+ "eval_runtime": 20.6161,
183
+ "eval_samples_per_second": 462.114,
184
+ "eval_steps_per_second": 3.638,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1941224049609059,
189
+ "grad_norm": 9.9375,
190
+ "learning_rate": 0.001,
191
+ "loss": 17.731655883789063,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20490698301428956,
196
+ "grad_norm": 15.625,
197
+ "learning_rate": 0.001,
198
+ "loss": 17.360447692871094,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.21569156106767323,
203
+ "grad_norm": 4.71875,
204
+ "learning_rate": 0.001,
205
+ "loss": 17.05499267578125,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.21569156106767323,
210
+ "eval_loss": 4.228377342224121,
211
+ "eval_runtime": 20.6518,
212
+ "eval_samples_per_second": 461.316,
213
+ "eval_steps_per_second": 3.632,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22647613912105688,
218
+ "grad_norm": 3.03125,
219
+ "learning_rate": 0.001,
220
+ "loss": 16.765740966796876,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.23726071717444056,
225
+ "grad_norm": 16.625,
226
+ "learning_rate": 0.001,
227
+ "loss": 16.70984344482422,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.2426530062011324,
232
+ "eval_loss": 4.115875244140625,
233
+ "eval_runtime": 17.5037,
234
+ "eval_samples_per_second": 544.283,
235
+ "eval_steps_per_second": 4.285,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.2480452952278242,
240
+ "grad_norm": 9.625,
241
+ "learning_rate": 0.001,
242
+ "loss": 16.492950439453125,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2588298732812079,
247
+ "grad_norm": 4.4375,
248
+ "learning_rate": 0.001,
249
+ "loss": 16.204039001464842,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.26961445133459155,
254
+ "grad_norm": 3.21875,
255
+ "learning_rate": 0.001,
256
+ "loss": 15.97710723876953,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.26961445133459155,
261
+ "eval_loss": 3.9576539993286133,
262
+ "eval_runtime": 16.9826,
263
+ "eval_samples_per_second": 560.986,
264
+ "eval_steps_per_second": 4.416,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803990293879752,
269
+ "grad_norm": 10.5,
270
+ "learning_rate": 0.001,
271
+ "loss": 15.733917236328125,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29118360744135885,
276
+ "grad_norm": 9.8125,
277
+ "learning_rate": 0.001,
278
+ "loss": 15.579618835449219,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.2965758964680507,
283
+ "eval_loss": 3.861560821533203,
284
+ "eval_runtime": 16.9704,
285
+ "eval_samples_per_second": 561.389,
286
+ "eval_steps_per_second": 4.419,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3019681854947425,
291
+ "grad_norm": 3.984375,
292
+ "learning_rate": 0.001,
293
+ "loss": 15.382864379882813,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.3127527635481262,
298
+ "grad_norm": 2.75,
299
+ "learning_rate": 0.001,
300
+ "loss": 15.098277282714843,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.3235373416015098,
305
+ "grad_norm": 5.75,
306
+ "learning_rate": 0.001,
307
+ "loss": 14.87418212890625,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.3235373416015098,
312
+ "eval_loss": 3.683532238006592,
313
+ "eval_runtime": 17.1359,
314
+ "eval_samples_per_second": 555.968,
315
+ "eval_steps_per_second": 4.377,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.3343219196548935,
320
+ "grad_norm": 5.28125,
321
+ "learning_rate": 0.001,
322
+ "loss": 14.851046752929687,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.34510649770827717,
327
+ "grad_norm": 5.125,
328
+ "learning_rate": 0.001,
329
+ "loss": 14.559681701660157,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.350498786734969,
334
+ "eval_loss": 3.5849404335021973,
335
+ "eval_runtime": 16.9858,
336
+ "eval_samples_per_second": 560.88,
337
+ "eval_steps_per_second": 4.415,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.35589107576166085,
342
+ "grad_norm": 7.375,
343
+ "learning_rate": 0.001,
344
+ "loss": 14.377513122558593,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.36667565381504447,
349
+ "grad_norm": 4.0625,
350
+ "learning_rate": 0.001,
351
+ "loss": 14.217088317871093,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37746023186842814,
356
+ "grad_norm": 5.0625,
357
+ "learning_rate": 0.001,
358
+ "loss": 14.131674194335938,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37746023186842814,
363
+ "eval_loss": 3.5239312648773193,
364
+ "eval_runtime": 16.9182,
365
+ "eval_samples_per_second": 563.122,
366
+ "eval_steps_per_second": 4.433,
367
+ "step": 700
368
+ }
369
+ ],
370
+ "logging_steps": 20,
371
+ "max_steps": 1500,
372
+ "num_input_tokens_seen": 0,
373
+ "num_train_epochs": 1,
374
+ "save_steps": 100,
375
+ "stateful_callbacks": {
376
+ "TrainerControl": {
377
+ "args": {
378
+ "should_epoch_stop": false,
379
+ "should_evaluate": false,
380
+ "should_log": false,
381
+ "should_save": true,
382
+ "should_training_stop": false
383
+ },
384
+ "attributes": {}
385
+ }
386
+ },
387
+ "total_flos": 1.69831663927296e+16,
388
+ "train_batch_size": 128,
389
+ "trial_name": null,
390
+ "trial_params": null
391
+ }
out/glu-waleed-94L_run/checkpoint-700/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3e12a35f98937379bc279e337a2141ffbc223c6273ca4783d094a415f227e198
3
+ size 4920
out/glu-waleed-94L_run/checkpoint-800/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "waleed",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/glu-waleed-94L_run/checkpoint-800/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:46fe89c5895ce86178a81914fc825cac7ff8620147e8972fb61dcd35408614da
3
+ size 31992520
out/glu-waleed-94L_run/checkpoint-800/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d93022f222f8067d4d9d327b367b7fc9d2cdb9d6df2bc97c3395fce5df171b79
3
+ size 64520514
out/glu-waleed-94L_run/checkpoint-800/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f83fe17529e572dff2734bb21512b28dd7cf5d20ef0e84688f5068ffbf24e765
3
+ size 14244
out/glu-waleed-94L_run/checkpoint-800/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7334026bbd250befa466dcbe6bec8bfe84c03024263e4dea55e40698f2caa92e
3
+ size 1064
out/glu-waleed-94L_run/checkpoint-800/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/glu-waleed-94L_run/checkpoint-800/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/glu-waleed-94L_run/checkpoint-800/trainer_state.json ADDED
@@ -0,0 +1,442 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.43138312213534646,
6
+ "eval_steps": 50,
7
+ "global_step": 800,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.625,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.4543212890625,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.2314453125,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.255674743652342,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.911471843719482,
29
+ "eval_runtime": 20.9396,
30
+ "eval_samples_per_second": 454.975,
31
+ "eval_steps_per_second": 3.582,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 8.75,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.663941955566408,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 4.15625,
44
+ "learning_rate": 0.001,
45
+ "loss": 23.1123046875,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 1.578125,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.97301483154297,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.725912094116211,
58
+ "eval_runtime": 20.3952,
59
+ "eval_samples_per_second": 467.12,
60
+ "eval_steps_per_second": 3.677,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.06470746832030197,
65
+ "grad_norm": 0.2099609375,
66
+ "learning_rate": 0.001,
67
+ "loss": 22.912661743164062,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07549204637368563,
72
+ "grad_norm": 0.859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 22.89833984375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08088433540037746,
79
+ "eval_loss": 5.71552038192749,
80
+ "eval_runtime": 20.5186,
81
+ "eval_samples_per_second": 464.31,
82
+ "eval_steps_per_second": 3.655,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.08627662442706929,
87
+ "grad_norm": 5.3125,
88
+ "learning_rate": 0.001,
89
+ "loss": 22.871157836914062,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09706120248045295,
94
+ "grad_norm": 3.515625,
95
+ "learning_rate": 0.001,
96
+ "loss": 22.64031982421875,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.10784578053383662,
101
+ "grad_norm": 2.796875,
102
+ "learning_rate": 0.001,
103
+ "loss": 21.882586669921874,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.10784578053383662,
108
+ "eval_loss": 5.379149913787842,
109
+ "eval_runtime": 19.954,
110
+ "eval_samples_per_second": 477.447,
111
+ "eval_steps_per_second": 3.759,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11863035858722028,
116
+ "grad_norm": 3.0,
117
+ "learning_rate": 0.001,
118
+ "loss": 21.073570251464844,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.12941493664060394,
123
+ "grad_norm": 26.625,
124
+ "learning_rate": 0.001,
125
+ "loss": 20.38078918457031,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.13480722566729578,
130
+ "eval_loss": 4.969682693481445,
131
+ "eval_runtime": 20.8528,
132
+ "eval_samples_per_second": 456.87,
133
+ "eval_steps_per_second": 3.597,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.1401995146939876,
138
+ "grad_norm": 5.5625,
139
+ "learning_rate": 0.001,
140
+ "loss": 19.993435668945313,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.15098409274737126,
145
+ "grad_norm": 3.84375,
146
+ "learning_rate": 0.001,
147
+ "loss": 19.312832641601563,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.1617686708007549,
152
+ "grad_norm": 8.1875,
153
+ "learning_rate": 0.001,
154
+ "loss": 18.880908203125,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.1617686708007549,
159
+ "eval_loss": 4.66710090637207,
160
+ "eval_runtime": 20.0053,
161
+ "eval_samples_per_second": 476.224,
162
+ "eval_steps_per_second": 3.749,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.17255324885413859,
167
+ "grad_norm": 8.6875,
168
+ "learning_rate": 0.001,
169
+ "loss": 18.437432861328126,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18333782690752223,
174
+ "grad_norm": 8.0,
175
+ "learning_rate": 0.001,
176
+ "loss": 18.02788543701172,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18873011593421407,
181
+ "eval_loss": 4.424458980560303,
182
+ "eval_runtime": 20.6161,
183
+ "eval_samples_per_second": 462.114,
184
+ "eval_steps_per_second": 3.638,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1941224049609059,
189
+ "grad_norm": 9.9375,
190
+ "learning_rate": 0.001,
191
+ "loss": 17.731655883789063,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20490698301428956,
196
+ "grad_norm": 15.625,
197
+ "learning_rate": 0.001,
198
+ "loss": 17.360447692871094,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.21569156106767323,
203
+ "grad_norm": 4.71875,
204
+ "learning_rate": 0.001,
205
+ "loss": 17.05499267578125,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.21569156106767323,
210
+ "eval_loss": 4.228377342224121,
211
+ "eval_runtime": 20.6518,
212
+ "eval_samples_per_second": 461.316,
213
+ "eval_steps_per_second": 3.632,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22647613912105688,
218
+ "grad_norm": 3.03125,
219
+ "learning_rate": 0.001,
220
+ "loss": 16.765740966796876,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.23726071717444056,
225
+ "grad_norm": 16.625,
226
+ "learning_rate": 0.001,
227
+ "loss": 16.70984344482422,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.2426530062011324,
232
+ "eval_loss": 4.115875244140625,
233
+ "eval_runtime": 17.5037,
234
+ "eval_samples_per_second": 544.283,
235
+ "eval_steps_per_second": 4.285,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.2480452952278242,
240
+ "grad_norm": 9.625,
241
+ "learning_rate": 0.001,
242
+ "loss": 16.492950439453125,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2588298732812079,
247
+ "grad_norm": 4.4375,
248
+ "learning_rate": 0.001,
249
+ "loss": 16.204039001464842,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.26961445133459155,
254
+ "grad_norm": 3.21875,
255
+ "learning_rate": 0.001,
256
+ "loss": 15.97710723876953,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.26961445133459155,
261
+ "eval_loss": 3.9576539993286133,
262
+ "eval_runtime": 16.9826,
263
+ "eval_samples_per_second": 560.986,
264
+ "eval_steps_per_second": 4.416,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803990293879752,
269
+ "grad_norm": 10.5,
270
+ "learning_rate": 0.001,
271
+ "loss": 15.733917236328125,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29118360744135885,
276
+ "grad_norm": 9.8125,
277
+ "learning_rate": 0.001,
278
+ "loss": 15.579618835449219,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.2965758964680507,
283
+ "eval_loss": 3.861560821533203,
284
+ "eval_runtime": 16.9704,
285
+ "eval_samples_per_second": 561.389,
286
+ "eval_steps_per_second": 4.419,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3019681854947425,
291
+ "grad_norm": 3.984375,
292
+ "learning_rate": 0.001,
293
+ "loss": 15.382864379882813,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.3127527635481262,
298
+ "grad_norm": 2.75,
299
+ "learning_rate": 0.001,
300
+ "loss": 15.098277282714843,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.3235373416015098,
305
+ "grad_norm": 5.75,
306
+ "learning_rate": 0.001,
307
+ "loss": 14.87418212890625,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.3235373416015098,
312
+ "eval_loss": 3.683532238006592,
313
+ "eval_runtime": 17.1359,
314
+ "eval_samples_per_second": 555.968,
315
+ "eval_steps_per_second": 4.377,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.3343219196548935,
320
+ "grad_norm": 5.28125,
321
+ "learning_rate": 0.001,
322
+ "loss": 14.851046752929687,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.34510649770827717,
327
+ "grad_norm": 5.125,
328
+ "learning_rate": 0.001,
329
+ "loss": 14.559681701660157,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.350498786734969,
334
+ "eval_loss": 3.5849404335021973,
335
+ "eval_runtime": 16.9858,
336
+ "eval_samples_per_second": 560.88,
337
+ "eval_steps_per_second": 4.415,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.35589107576166085,
342
+ "grad_norm": 7.375,
343
+ "learning_rate": 0.001,
344
+ "loss": 14.377513122558593,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.36667565381504447,
349
+ "grad_norm": 4.0625,
350
+ "learning_rate": 0.001,
351
+ "loss": 14.217088317871093,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37746023186842814,
356
+ "grad_norm": 5.0625,
357
+ "learning_rate": 0.001,
358
+ "loss": 14.131674194335938,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37746023186842814,
363
+ "eval_loss": 3.5239312648773193,
364
+ "eval_runtime": 16.9182,
365
+ "eval_samples_per_second": 563.122,
366
+ "eval_steps_per_second": 4.433,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.3882448099218118,
371
+ "grad_norm": 6.59375,
372
+ "learning_rate": 0.001,
373
+ "loss": 13.94341583251953,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.3990293879751955,
378
+ "grad_norm": 4.0625,
379
+ "learning_rate": 0.001,
380
+ "loss": 13.774238586425781,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.4044216770018873,
385
+ "eval_loss": 3.419768810272217,
386
+ "eval_runtime": 17.1125,
387
+ "eval_samples_per_second": 556.727,
388
+ "eval_steps_per_second": 4.383,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.4098139660285791,
393
+ "grad_norm": 4.09375,
394
+ "learning_rate": 0.001,
395
+ "loss": 13.6376220703125,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.4205985440819628,
400
+ "grad_norm": 9.0625,
401
+ "learning_rate": 0.001,
402
+ "loss": 13.435893249511718,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.43138312213534646,
407
+ "grad_norm": 2.28125,
408
+ "learning_rate": 0.001,
409
+ "loss": 13.210621643066407,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.43138312213534646,
414
+ "eval_loss": 3.365565776824951,
415
+ "eval_runtime": 17.0151,
416
+ "eval_samples_per_second": 559.916,
417
+ "eval_steps_per_second": 4.408,
418
+ "step": 800
419
+ }
420
+ ],
421
+ "logging_steps": 20,
422
+ "max_steps": 1500,
423
+ "num_input_tokens_seen": 0,
424
+ "num_train_epochs": 1,
425
+ "save_steps": 100,
426
+ "stateful_callbacks": {
427
+ "TrainerControl": {
428
+ "args": {
429
+ "should_epoch_stop": false,
430
+ "should_evaluate": false,
431
+ "should_log": false,
432
+ "should_save": true,
433
+ "should_training_stop": false
434
+ },
435
+ "attributes": {}
436
+ }
437
+ },
438
+ "total_flos": 1.94093330202624e+16,
439
+ "train_batch_size": 128,
440
+ "trial_name": null,
441
+ "trial_params": null
442
+ }
out/glu-waleed-94L_run/checkpoint-800/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3e12a35f98937379bc279e337a2141ffbc223c6273ca4783d094a415f227e198
3
+ size 4920
out/glu-waleed-94L_run/checkpoint-900/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "waleed",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/glu-waleed-94L_run/checkpoint-900/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b00a6c9ac4860fcc186e1a6d25783cfbbdecda51d90da7c095ab0d2c847fdfbf
3
+ size 31992520
out/glu-waleed-94L_run/checkpoint-900/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6143e05ffce71c7b89b8e4ba08fcf2f97a619dee12eaf1409ba1b6ba90da8f93
3
+ size 64520514
out/glu-waleed-94L_run/checkpoint-900/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:86a2aa7bca84d2b8e7dd4e04a286714ba9169af11c46c739950a52df4c45259f
3
+ size 14244
out/glu-waleed-94L_run/checkpoint-900/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6d48b00fea613f19335b87fb622648d28d7f8900963d07ba43c75df2b4dc3d4e
3
+ size 1064
out/glu-waleed-94L_run/checkpoint-900/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/glu-waleed-94L_run/checkpoint-900/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/glu-waleed-94L_run/checkpoint-900/trainer_state.json ADDED
@@ -0,0 +1,493 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.4853060124022648,
6
+ "eval_steps": 50,
7
+ "global_step": 900,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.625,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.4543212890625,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.2314453125,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.255674743652342,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.911471843719482,
29
+ "eval_runtime": 20.9396,
30
+ "eval_samples_per_second": 454.975,
31
+ "eval_steps_per_second": 3.582,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 8.75,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.663941955566408,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 4.15625,
44
+ "learning_rate": 0.001,
45
+ "loss": 23.1123046875,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 1.578125,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.97301483154297,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.725912094116211,
58
+ "eval_runtime": 20.3952,
59
+ "eval_samples_per_second": 467.12,
60
+ "eval_steps_per_second": 3.677,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.06470746832030197,
65
+ "grad_norm": 0.2099609375,
66
+ "learning_rate": 0.001,
67
+ "loss": 22.912661743164062,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07549204637368563,
72
+ "grad_norm": 0.859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 22.89833984375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08088433540037746,
79
+ "eval_loss": 5.71552038192749,
80
+ "eval_runtime": 20.5186,
81
+ "eval_samples_per_second": 464.31,
82
+ "eval_steps_per_second": 3.655,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.08627662442706929,
87
+ "grad_norm": 5.3125,
88
+ "learning_rate": 0.001,
89
+ "loss": 22.871157836914062,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09706120248045295,
94
+ "grad_norm": 3.515625,
95
+ "learning_rate": 0.001,
96
+ "loss": 22.64031982421875,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.10784578053383662,
101
+ "grad_norm": 2.796875,
102
+ "learning_rate": 0.001,
103
+ "loss": 21.882586669921874,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.10784578053383662,
108
+ "eval_loss": 5.379149913787842,
109
+ "eval_runtime": 19.954,
110
+ "eval_samples_per_second": 477.447,
111
+ "eval_steps_per_second": 3.759,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11863035858722028,
116
+ "grad_norm": 3.0,
117
+ "learning_rate": 0.001,
118
+ "loss": 21.073570251464844,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.12941493664060394,
123
+ "grad_norm": 26.625,
124
+ "learning_rate": 0.001,
125
+ "loss": 20.38078918457031,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.13480722566729578,
130
+ "eval_loss": 4.969682693481445,
131
+ "eval_runtime": 20.8528,
132
+ "eval_samples_per_second": 456.87,
133
+ "eval_steps_per_second": 3.597,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.1401995146939876,
138
+ "grad_norm": 5.5625,
139
+ "learning_rate": 0.001,
140
+ "loss": 19.993435668945313,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.15098409274737126,
145
+ "grad_norm": 3.84375,
146
+ "learning_rate": 0.001,
147
+ "loss": 19.312832641601563,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.1617686708007549,
152
+ "grad_norm": 8.1875,
153
+ "learning_rate": 0.001,
154
+ "loss": 18.880908203125,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.1617686708007549,
159
+ "eval_loss": 4.66710090637207,
160
+ "eval_runtime": 20.0053,
161
+ "eval_samples_per_second": 476.224,
162
+ "eval_steps_per_second": 3.749,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.17255324885413859,
167
+ "grad_norm": 8.6875,
168
+ "learning_rate": 0.001,
169
+ "loss": 18.437432861328126,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18333782690752223,
174
+ "grad_norm": 8.0,
175
+ "learning_rate": 0.001,
176
+ "loss": 18.02788543701172,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18873011593421407,
181
+ "eval_loss": 4.424458980560303,
182
+ "eval_runtime": 20.6161,
183
+ "eval_samples_per_second": 462.114,
184
+ "eval_steps_per_second": 3.638,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1941224049609059,
189
+ "grad_norm": 9.9375,
190
+ "learning_rate": 0.001,
191
+ "loss": 17.731655883789063,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20490698301428956,
196
+ "grad_norm": 15.625,
197
+ "learning_rate": 0.001,
198
+ "loss": 17.360447692871094,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.21569156106767323,
203
+ "grad_norm": 4.71875,
204
+ "learning_rate": 0.001,
205
+ "loss": 17.05499267578125,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.21569156106767323,
210
+ "eval_loss": 4.228377342224121,
211
+ "eval_runtime": 20.6518,
212
+ "eval_samples_per_second": 461.316,
213
+ "eval_steps_per_second": 3.632,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22647613912105688,
218
+ "grad_norm": 3.03125,
219
+ "learning_rate": 0.001,
220
+ "loss": 16.765740966796876,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.23726071717444056,
225
+ "grad_norm": 16.625,
226
+ "learning_rate": 0.001,
227
+ "loss": 16.70984344482422,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.2426530062011324,
232
+ "eval_loss": 4.115875244140625,
233
+ "eval_runtime": 17.5037,
234
+ "eval_samples_per_second": 544.283,
235
+ "eval_steps_per_second": 4.285,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.2480452952278242,
240
+ "grad_norm": 9.625,
241
+ "learning_rate": 0.001,
242
+ "loss": 16.492950439453125,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2588298732812079,
247
+ "grad_norm": 4.4375,
248
+ "learning_rate": 0.001,
249
+ "loss": 16.204039001464842,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.26961445133459155,
254
+ "grad_norm": 3.21875,
255
+ "learning_rate": 0.001,
256
+ "loss": 15.97710723876953,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.26961445133459155,
261
+ "eval_loss": 3.9576539993286133,
262
+ "eval_runtime": 16.9826,
263
+ "eval_samples_per_second": 560.986,
264
+ "eval_steps_per_second": 4.416,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803990293879752,
269
+ "grad_norm": 10.5,
270
+ "learning_rate": 0.001,
271
+ "loss": 15.733917236328125,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29118360744135885,
276
+ "grad_norm": 9.8125,
277
+ "learning_rate": 0.001,
278
+ "loss": 15.579618835449219,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.2965758964680507,
283
+ "eval_loss": 3.861560821533203,
284
+ "eval_runtime": 16.9704,
285
+ "eval_samples_per_second": 561.389,
286
+ "eval_steps_per_second": 4.419,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3019681854947425,
291
+ "grad_norm": 3.984375,
292
+ "learning_rate": 0.001,
293
+ "loss": 15.382864379882813,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.3127527635481262,
298
+ "grad_norm": 2.75,
299
+ "learning_rate": 0.001,
300
+ "loss": 15.098277282714843,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.3235373416015098,
305
+ "grad_norm": 5.75,
306
+ "learning_rate": 0.001,
307
+ "loss": 14.87418212890625,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.3235373416015098,
312
+ "eval_loss": 3.683532238006592,
313
+ "eval_runtime": 17.1359,
314
+ "eval_samples_per_second": 555.968,
315
+ "eval_steps_per_second": 4.377,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.3343219196548935,
320
+ "grad_norm": 5.28125,
321
+ "learning_rate": 0.001,
322
+ "loss": 14.851046752929687,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.34510649770827717,
327
+ "grad_norm": 5.125,
328
+ "learning_rate": 0.001,
329
+ "loss": 14.559681701660157,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.350498786734969,
334
+ "eval_loss": 3.5849404335021973,
335
+ "eval_runtime": 16.9858,
336
+ "eval_samples_per_second": 560.88,
337
+ "eval_steps_per_second": 4.415,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.35589107576166085,
342
+ "grad_norm": 7.375,
343
+ "learning_rate": 0.001,
344
+ "loss": 14.377513122558593,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.36667565381504447,
349
+ "grad_norm": 4.0625,
350
+ "learning_rate": 0.001,
351
+ "loss": 14.217088317871093,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37746023186842814,
356
+ "grad_norm": 5.0625,
357
+ "learning_rate": 0.001,
358
+ "loss": 14.131674194335938,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37746023186842814,
363
+ "eval_loss": 3.5239312648773193,
364
+ "eval_runtime": 16.9182,
365
+ "eval_samples_per_second": 563.122,
366
+ "eval_steps_per_second": 4.433,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.3882448099218118,
371
+ "grad_norm": 6.59375,
372
+ "learning_rate": 0.001,
373
+ "loss": 13.94341583251953,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.3990293879751955,
378
+ "grad_norm": 4.0625,
379
+ "learning_rate": 0.001,
380
+ "loss": 13.774238586425781,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.4044216770018873,
385
+ "eval_loss": 3.419768810272217,
386
+ "eval_runtime": 17.1125,
387
+ "eval_samples_per_second": 556.727,
388
+ "eval_steps_per_second": 4.383,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.4098139660285791,
393
+ "grad_norm": 4.09375,
394
+ "learning_rate": 0.001,
395
+ "loss": 13.6376220703125,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.4205985440819628,
400
+ "grad_norm": 9.0625,
401
+ "learning_rate": 0.001,
402
+ "loss": 13.435893249511718,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.43138312213534646,
407
+ "grad_norm": 2.28125,
408
+ "learning_rate": 0.001,
409
+ "loss": 13.210621643066407,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.43138312213534646,
414
+ "eval_loss": 3.365565776824951,
415
+ "eval_runtime": 17.0151,
416
+ "eval_samples_per_second": 559.916,
417
+ "eval_steps_per_second": 4.408,
418
+ "step": 800
419
+ },
420
+ {
421
+ "epoch": 0.44216770018873014,
422
+ "grad_norm": 5.125,
423
+ "learning_rate": 0.001,
424
+ "loss": 13.199737548828125,
425
+ "step": 820
426
+ },
427
+ {
428
+ "epoch": 0.45295227824211376,
429
+ "grad_norm": 2.671875,
430
+ "learning_rate": 0.001,
431
+ "loss": 12.949116516113282,
432
+ "step": 840
433
+ },
434
+ {
435
+ "epoch": 0.4583445672688056,
436
+ "eval_loss": 3.1935510635375977,
437
+ "eval_runtime": 17.0147,
438
+ "eval_samples_per_second": 559.928,
439
+ "eval_steps_per_second": 4.408,
440
+ "step": 850
441
+ },
442
+ {
443
+ "epoch": 0.46373685629549743,
444
+ "grad_norm": 2.6875,
445
+ "learning_rate": 0.001,
446
+ "loss": 12.769676208496094,
447
+ "step": 860
448
+ },
449
+ {
450
+ "epoch": 0.4745214343488811,
451
+ "grad_norm": 2.8125,
452
+ "learning_rate": 0.001,
453
+ "loss": 12.551689147949219,
454
+ "step": 880
455
+ },
456
+ {
457
+ "epoch": 0.4853060124022648,
458
+ "grad_norm": 17.125,
459
+ "learning_rate": 0.001,
460
+ "loss": 12.372489166259765,
461
+ "step": 900
462
+ },
463
+ {
464
+ "epoch": 0.4853060124022648,
465
+ "eval_loss": 3.1010639667510986,
466
+ "eval_runtime": 17.1354,
467
+ "eval_samples_per_second": 555.982,
468
+ "eval_steps_per_second": 4.377,
469
+ "step": 900
470
+ }
471
+ ],
472
+ "logging_steps": 20,
473
+ "max_steps": 1500,
474
+ "num_input_tokens_seen": 0,
475
+ "num_train_epochs": 1,
476
+ "save_steps": 100,
477
+ "stateful_callbacks": {
478
+ "TrainerControl": {
479
+ "args": {
480
+ "should_epoch_stop": false,
481
+ "should_evaluate": false,
482
+ "should_log": false,
483
+ "should_save": true,
484
+ "should_training_stop": false
485
+ },
486
+ "attributes": {}
487
+ }
488
+ },
489
+ "total_flos": 2.18354996477952e+16,
490
+ "train_batch_size": 128,
491
+ "trial_name": null,
492
+ "trial_params": null
493
+ }
out/glu-waleed-94L_run/checkpoint-900/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3e12a35f98937379bc279e337a2141ffbc223c6273ca4783d094a415f227e198
3
+ size 4920
out/glu-waleed-94L_run/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "waleed",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/glu-waleed-94L_run/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:390a40e963225f57b23ca14d6aeac4bd92e7d8e5d4791f0724adfa827128196a
3
+ size 31992520
out/glu-waleed-94L_run/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/glu-waleed-94L_run/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/glu-waleed-94L_run/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3e12a35f98937379bc279e337a2141ffbc223c6273ca4783d094a415f227e198
3
+ size 4920
out/glu-waleed-94L_run/training_log.jsonl ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-s10-94L_run/README.md ADDED
@@ -0,0 +1,87 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: transformers
3
+ tags:
4
+ - generated_from_trainer
5
+ model-index:
6
+ - name: A-mlp-s10-94L
7
+ results: []
8
+ ---
9
+
10
+ <!-- This model card has been generated automatically according to the information the Trainer had access to. You
11
+ should probably proofread and complete it, then remove this comment. -->
12
+
13
+ # A-mlp-s10-94L
14
+
15
+ This model is a fine-tuned version of [](https://huggingface.co/) on an unknown dataset.
16
+ It achieves the following results on the evaluation set:
17
+ - Loss: 1.8618
18
+
19
+ ## Model description
20
+
21
+ More information needed
22
+
23
+ ## Intended uses & limitations
24
+
25
+ More information needed
26
+
27
+ ## Training and evaluation data
28
+
29
+ More information needed
30
+
31
+ ## Training procedure
32
+
33
+ ### Training hyperparameters
34
+
35
+ The following hyperparameters were used during training:
36
+ - learning_rate: 0.001
37
+ - train_batch_size: 128
38
+ - eval_batch_size: 128
39
+ - seed: 42
40
+ - gradient_accumulation_steps: 4
41
+ - total_train_batch_size: 512
42
+ - optimizer: Use OptimizerNames.ADAMW_TORCH_FUSED with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
43
+ - lr_scheduler_type: constant
44
+ - training_steps: 1500
45
+
46
+ ### Training results
47
+
48
+ | Training Loss | Epoch | Step | Validation Loss |
49
+ |:-------------:|:------:|:----:|:---------------:|
50
+ | 24.2798 | 0.0270 | 50 | 5.9086 |
51
+ | 22.1371 | 0.0539 | 100 | 5.4433 |
52
+ | 20.9160 | 0.0809 | 150 | 5.0314 |
53
+ | 18.3162 | 0.1078 | 200 | 4.4591 |
54
+ | 16.8577 | 0.1348 | 250 | 4.0378 |
55
+ | 15.2626 | 0.1618 | 300 | 3.7790 |
56
+ | 14.4196 | 0.1887 | 350 | 3.5089 |
57
+ | 13.3537 | 0.2157 | 400 | 3.3230 |
58
+ | 12.7840 | 0.2427 | 450 | 3.1206 |
59
+ | 11.9211 | 0.2696 | 500 | 2.9508 |
60
+ | 11.4566 | 0.2966 | 550 | 2.8138 |
61
+ | 10.8289 | 0.3235 | 600 | 2.6942 |
62
+ | 10.4861 | 0.3505 | 650 | 2.5830 |
63
+ | 10.0049 | 0.3775 | 700 | 2.4851 |
64
+ | 9.7264 | 0.4044 | 750 | 2.3961 |
65
+ | 9.3039 | 0.4314 | 800 | 2.3193 |
66
+ | 9.1100 | 0.4583 | 850 | 2.2558 |
67
+ | 8.7980 | 0.4853 | 900 | 2.1991 |
68
+ | 8.6568 | 0.5123 | 950 | 2.1517 |
69
+ | 8.4551 | 0.5392 | 1000 | 2.1050 |
70
+ | 8.2907 | 0.5662 | 1050 | 2.0706 |
71
+ | 8.1491 | 0.5932 | 1100 | 2.0383 |
72
+ | 8.0428 | 0.6201 | 1150 | 2.0064 |
73
+ | 7.8927 | 0.6471 | 1200 | 1.9802 |
74
+ | 7.8279 | 0.6740 | 1250 | 1.9556 |
75
+ | 7.7145 | 0.7010 | 1300 | 1.9351 |
76
+ | 7.6557 | 0.7280 | 1350 | 1.9123 |
77
+ | 7.5586 | 0.7549 | 1400 | 1.8938 |
78
+ | 7.5087 | 0.7819 | 1450 | 1.8763 |
79
+ | 7.4194 | 0.8088 | 1500 | 1.8618 |
80
+
81
+
82
+ ### Framework versions
83
+
84
+ - Transformers 5.15.0.dev0
85
+ - Pytorch 2.6.0+cu124
86
+ - Datasets 5.0.1
87
+ - Tokenizers 0.22.2
out/mlp-s10-94L_run/checkpoint-100/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "s10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-s10-94L_run/checkpoint-100/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2be26509aa8682be1562cdefdc4fb702fa74f487c6ebeb27a02060b133a0c94a
3
+ size 31981960
out/mlp-s10-94L_run/checkpoint-100/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:de4ee11bbfdf5bd8a135bcd6b03e23684bb89f9318b0733ff65ec4481b31abe2
3
+ size 64439848
out/mlp-s10-94L_run/checkpoint-100/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3cf9097d4513154245c48236b6ec5137b7ee2a21c9f58f2cba798ea275c6026f
3
+ size 14244
out/mlp-s10-94L_run/checkpoint-100/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:906745ab5f61e73e8c1ba850ef3b839e2766eba889b49c843836266988895165
3
+ size 1064
out/mlp-s10-94L_run/checkpoint-100/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-s10-94L_run/checkpoint-100/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-s10-94L_run/checkpoint-100/trainer_state.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.05392289026691831,
6
+ "eval_steps": 50,
7
+ "global_step": 100,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.75,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.570291137695314,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.263671875,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.279835510253907,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.908648490905762,
29
+ "eval_runtime": 16.3836,
30
+ "eval_samples_per_second": 581.495,
31
+ "eval_steps_per_second": 4.578,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 2.03125,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.61173858642578,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 3.9375,
44
+ "learning_rate": 0.001,
45
+ "loss": 22.80414733886719,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 4.5,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.137115478515625,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.443320274353027,
58
+ "eval_runtime": 16.3492,
59
+ "eval_samples_per_second": 582.72,
60
+ "eval_steps_per_second": 4.587,
61
+ "step": 100
62
+ }
63
+ ],
64
+ "logging_steps": 20,
65
+ "max_steps": 1500,
66
+ "num_input_tokens_seen": 0,
67
+ "num_train_epochs": 1,
68
+ "save_steps": 100,
69
+ "stateful_callbacks": {
70
+ "TrainerControl": {
71
+ "args": {
72
+ "should_epoch_stop": false,
73
+ "should_evaluate": false,
74
+ "should_log": false,
75
+ "should_save": true,
76
+ "should_training_stop": false
77
+ },
78
+ "attributes": {}
79
+ }
80
+ },
81
+ "total_flos": 2426166627532800.0,
82
+ "train_batch_size": 128,
83
+ "trial_name": null,
84
+ "trial_params": null
85
+ }
out/mlp-s10-94L_run/checkpoint-100/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:873bf272a464f8d4f32a1497a17e4dd88aaf0d116e87d1e95dbff747318696f0
3
+ size 4920
out/mlp-s10-94L_run/checkpoint-1000/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "s10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }