output_dir: "" # just a placeholder bf16: true model_name_or_path: meta-llama/Llama-3.2-1B-Instruct label_names: ["labels"] add_repeat_prompt: false add_negative_prompt: false # eval_on_start: True # eval_strategy: "steps" # eval_steps: 500 # save_strategy: "no" # # save_steps: 500 # logging_strategy: "steps" # logging_steps: 100 # use_liger_kernel: true # remove_unused_columns: false # needed to avoid OOM by compute the metrics batch by batch # w/o this the trainer stores logits of all sample in memory... # batch_eval_metrics: true per_device_train_batch_size: 32 per_device_eval_batch_size: 1 max_val_samples_per_ds: 20 # optim: schedule_free_adamw learning_rate: 0.00001 # lr_scheduler_type: "constant_with_warmup" neftune_noise_alpha: 1 weight_decay: 0.01 # LoRA lora_r: 16 lora_dropout: 0.05 target_modules: - down_proj - up_proj - gate_proj # data train_ds_names: - data/raw_datasets/context_numbers_4 - data/raw_datasets/context_numbers_8 - data/raw_datasets/context_numbers_16 - data/raw_datasets/context_numbers_24 - data/raw_datasets/context_numbers_32 - data/raw_datasets/context_numbers_40 - data/raw_datasets/context_numbers_48 - data/raw_datasets/context_numbers_56 - data/raw_datasets/context_numbers_64 val_ds_names: - data/raw_datasets/context_numbers_16 - data/raw_datasets/context_numbers_32 - data/raw_datasets/context_numbers_64 - data/raw_datasets/context_numbers_128 - data/raw_datasets/context_numbers_256 test_ds_names: - data/raw_datasets/context_numbers_16 - data/raw_datasets/context_numbers_32 - data/raw_datasets/context_numbers_64 - data/raw_datasets/context_numbers_128 - data/raw_datasets/context_numbers_256