Spaces:
Sleeping
Sleeping
Commit ·
842caac
1
Parent(s): 6f3d9d6
fix: reduce grpo training runtime
Browse filesUse a smaller hackathon training run with fewer episodes, generations, and completion tokens so the A100 Space can finish in a practical window.
Made-with: Cursor
- training/train_grpo.py +6 -6
training/train_grpo.py
CHANGED
|
@@ -29,18 +29,18 @@ LOAD_IN_4BIT = True
|
|
| 29 |
LORA_R = 16
|
| 30 |
LORA_TARGET_MODULES = ["q_proj", "k_proj", "v_proj", "o_proj"]
|
| 31 |
|
| 32 |
-
NUM_TRAIN_EPOCHS =
|
| 33 |
BATCH_SIZE = 4
|
| 34 |
GRAD_ACCUM = 4
|
| 35 |
LR = 5e-5
|
| 36 |
-
MAX_COMPLETION_LENGTH =
|
| 37 |
-
NUM_GENERATIONS =
|
| 38 |
LOGGING_STEPS = 10
|
| 39 |
-
SAVE_STEPS =
|
| 40 |
SEED = 42
|
| 41 |
|
| 42 |
-
N_TRAIN_EPISODES =
|
| 43 |
-
N_EVAL_EPISODES =
|
| 44 |
|
| 45 |
WANDB_PROJECT = "context-corruption-env"
|
| 46 |
WANDB_RUN_NAME = "qwen-1.5b-grpo-run1"
|
|
|
|
| 29 |
LORA_R = 16
|
| 30 |
LORA_TARGET_MODULES = ["q_proj", "k_proj", "v_proj", "o_proj"]
|
| 31 |
|
| 32 |
+
NUM_TRAIN_EPOCHS = 1
|
| 33 |
BATCH_SIZE = 4
|
| 34 |
GRAD_ACCUM = 4
|
| 35 |
LR = 5e-5
|
| 36 |
+
MAX_COMPLETION_LENGTH = 128
|
| 37 |
+
NUM_GENERATIONS = 4
|
| 38 |
LOGGING_STEPS = 10
|
| 39 |
+
SAVE_STEPS = 25
|
| 40 |
SEED = 42
|
| 41 |
|
| 42 |
+
N_TRAIN_EPISODES = 100
|
| 43 |
+
N_EVAL_EPISODES = 20
|
| 44 |
|
| 45 |
WANDB_PROJECT = "context-corruption-env"
|
| 46 |
WANDB_RUN_NAME = "qwen-1.5b-grpo-run1"
|