output_dir: "" # just a placeholder bf16: true model_name_or_path: meta-llama/Llama-3.2-1B-Instruct label_names: ["labels"] # eval_on_start: True # eval_strategy: "steps" # eval_steps: 500 # save_strategy: "no" # # save_steps: 500 # logging_strategy: "steps" # logging_steps: 100 # use_liger_kernel: true # remove_unused_columns: false # needed to avoid OOM by compute the metrics batch by batch # w/o this the trainer stores logits of all sample in memory... # batch_eval_metrics: true per_device_train_batch_size: 64 per_device_eval_batch_size: 128 max_new_tokens: 64 gen_per_device_eval_batch_size: 128 max_val_samples_per_ds: 500 # optim: schedule_free_adamw learning_rate: 0.0001 # lr_scheduler_type: "constant_with_warmup" neftune_noise_alpha: 1 weight_decay: 0.1 warmup_ratio: 0.05 # LoRA lora_r: 16 lora_dropout: 0.05 target_modules: - down_proj - up_proj - gate_proj # data train_ds_names: - data/raw_datasets/context_numbers_2 - data/raw_datasets/context_numbers_3 - data/raw_datasets/context_numbers_4 - data/raw_datasets/context_numbers_5 - data/raw_datasets/context_numbers_6 - data/raw_datasets/context_numbers_7 - data/raw_datasets/context_numbers_8 - data/raw_datasets/context_numbers_9 - data/raw_datasets/context_numbers_10 val_ds_names: - data/raw_datasets/context_numbers_2 - data/raw_datasets/context_numbers_3 - data/raw_datasets/context_numbers_4 - data/raw_datasets/context_numbers_5 - data/raw_datasets/context_numbers_6 - data/raw_datasets/context_numbers_7 - data/raw_datasets/context_numbers_8 - data/raw_datasets/context_numbers_9 - data/raw_datasets/context_numbers_10 test_ds_names: - data/raw_datasets/context_numbers_11 - data/raw_datasets/context_numbers_12 - data/raw_datasets/context_numbers_13 - data/raw_datasets/context_numbers_14 - data/raw_datasets/context_numbers_15