| |
| |
|
|
| model: |
| d_model: 768 |
| n_layers: 12 |
| vocab_size: 32000 |
| n_heads: 12 |
| n_kv_heads: 3 |
| ff_mult: 3 |
| max_seq_len: 1024 |
|
|
| training: |
| |
| weight_decay: 0.1 |
| grad_clip: 1.0 |
|
|
| |
| peak_lr: 5.0e-4 |
| min_lr: 5.0e-5 |
| warmup_steps: 100 |
|
|
| |
| dropout: 0.15 |
| label_smoothing: 0.05 |
|
|
| |
| batch_size: 8 |
| grad_accum_steps: 1 |
| max_length: 1024 |
|
|
| |
| max_steps: 1962 |
| save_steps: 500 |
| log_steps: 50 |
|
|
| |
| gradient_checkpointing: true |
|
|
| data: |
| path: data/processed_exp4_plus |
| num_samples: null |
|
|
| tokenizer: |
| vocab_size: 32000 |
| model_type: unigram |
| character_coverage: 0.9995 |
|
|
| distributed: |
| enabled: true |
| world_size: 8 |
| backend: nccl |
|
|