diff --git a/configs/context_numbers_128.yaml b/configs/context_numbers_128.yaml index 37e29eb..e7374a6 100644 --- a/configs/context_numbers_128.yaml +++ b/configs/context_numbers_128.yaml @@ -20,7 +20,7 @@ per_device_train_batch_size: 64 per_device_eval_batch_size: 64 max_val_samples_per_ds: 50 # optim: schedule_free_adamw -learning_rate: 0.0001 +learning_rate: 0.00001 # lr_scheduler_type: "constant_with_warmup" neftune_noise_alpha: 1 weight_decay: 0.1 diff --git a/configs/context_numbers_256.yaml b/configs/context_numbers_256.yaml index 3e639b1..4c34100 100644 --- a/configs/context_numbers_256.yaml +++ b/configs/context_numbers_256.yaml @@ -20,7 +20,7 @@ per_device_train_batch_size: 32 per_device_eval_batch_size: 32 max_val_samples_per_ds: 20 # optim: schedule_free_adamw -learning_rate: 0.0001 +learning_rate: 0.00001 # lr_scheduler_type: "constant_with_warmup" neftune_noise_alpha: 1 weight_decay: 0.1 diff --git a/configs/pwc.yaml b/configs/pwc.yaml index b4b00e1..535d527 100644 --- a/configs/pwc.yaml +++ b/configs/pwc.yaml @@ -20,7 +20,7 @@ per_device_train_batch_size: 32 per_device_eval_batch_size: 32 max_val_samples_per_ds: 20 # optim: schedule_free_adamw -learning_rate: 0.0001 +learning_rate: 0.00001 # lr_scheduler_type: "constant_with_warmup" neftune_noise_alpha: 1 weight_decay: 0.1 diff --git a/configs/pwc_and_ctx_numbers_256.yaml b/configs/pwc_and_ctx_numbers_256.yaml index 4046e06..2fe76c8 100644 --- a/configs/pwc_and_ctx_numbers_256.yaml +++ b/configs/pwc_and_ctx_numbers_256.yaml @@ -20,7 +20,7 @@ per_device_train_batch_size: 32 per_device_eval_batch_size: 32 max_val_samples_per_ds: 20 # optim: schedule_free_adamw -learning_rate: 0.0001 +learning_rate: 0.00001 # lr_scheduler_type: "constant_with_warmup" neftune_noise_alpha: 1 weight_decay: 0.1