Siddh12334 commited on
Commit
842caac
·
1 Parent(s): 6f3d9d6

fix: reduce grpo training runtime

Browse files

Use a smaller hackathon training run with fewer episodes, generations, and completion tokens so the A100 Space can finish in a practical window.

Made-with: Cursor

Files changed (1) hide show
  1. training/train_grpo.py +6 -6
training/train_grpo.py CHANGED
@@ -29,18 +29,18 @@ LOAD_IN_4BIT = True
29
  LORA_R = 16
30
  LORA_TARGET_MODULES = ["q_proj", "k_proj", "v_proj", "o_proj"]
31
 
32
- NUM_TRAIN_EPOCHS = 3
33
  BATCH_SIZE = 4
34
  GRAD_ACCUM = 4
35
  LR = 5e-5
36
- MAX_COMPLETION_LENGTH = 512
37
- NUM_GENERATIONS = 8
38
  LOGGING_STEPS = 10
39
- SAVE_STEPS = 50
40
  SEED = 42
41
 
42
- N_TRAIN_EPISODES = 500
43
- N_EVAL_EPISODES = 50
44
 
45
  WANDB_PROJECT = "context-corruption-env"
46
  WANDB_RUN_NAME = "qwen-1.5b-grpo-run1"
 
29
  LORA_R = 16
30
  LORA_TARGET_MODULES = ["q_proj", "k_proj", "v_proj", "o_proj"]
31
 
32
+ NUM_TRAIN_EPOCHS = 1
33
  BATCH_SIZE = 4
34
  GRAD_ACCUM = 4
35
  LR = 5e-5
36
+ MAX_COMPLETION_LENGTH = 128
37
+ NUM_GENERATIONS = 4
38
  LOGGING_STEPS = 10
39
+ SAVE_STEPS = 25
40
  SEED = 42
41
 
42
+ N_TRAIN_EPISODES = 100
43
+ N_EVAL_EPISODES = 20
44
 
45
  WANDB_PROJECT = "context-corruption-env"
46
  WANDB_RUN_NAME = "qwen-1.5b-grpo-run1"