diff --git a/configs/default.yaml b/configs/default.yaml index 55ccad5..e7dc8d6 100644 --- a/configs/default.yaml +++ b/configs/default.yaml @@ -16,6 +16,8 @@ remove_unused_columns: false # w/o this the trainer stores logits of all sample in memory... batch_eval_metrics: true +per_device_train_batch_size: 128 +per_device_eval_batch_size: 128 optim: schedule_free_adamw learning_rate: 0.0001 lr_scheduler_type: "constant_with_warmup" diff --git a/hyperlora/model_loading.py b/hyperlora/model_loading.py index 145c72c..d03bef6 100644 --- a/hyperlora/model_loading.py +++ b/hyperlora/model_loading.py @@ -33,6 +33,7 @@ def get_model_and_tokenizer( ) tokenizer = get_tokenizer(model_name_or_path, tokenizer_kwargs, peft_config, train) model.config.pad_token_id = tokenizer.pad_token_id + model.generation_config.pad_token_id = tokenizer.pad_token_id return model, tokenizer