diff --git a/README.md b/README.md index ad8ef7a..6020c36 100644 --- a/README.md +++ b/README.md @@ -31,22 +31,24 @@ print(model.decode(outputs)) ## 🏋️ Training ### 🔢 HyperLoRA w/ context_numbers_10 ```bash -WANDB_MODE=disabled uv run python intx_sft.py configs/context_numbers_10.yaml --model_name_or_path=meta-llama/Llama-3.2-1B-Instruct --num_train_epochs=100 --per_device_train_batch_size=64 --per_device_eval_batch_size=64 --exp_setup=hyper_lora --aggregator_type=perceiver --target_modules=down_proj --per_rank_gen=True --per_layer_processing=True --decoder_depth=2 --seed=1 --gen_lora_l1_reg_coef=0 --use_token_mixing=False --lora_r=8 --bf16=True --tf32=True --dataloader_num_workers=8 --dataloader_prefetch_factor=8 +WANDB_MODE=disabled uv run intx_sft.py configs/pwc_hotpot_qa.yaml --model_name_or_path=google/gemma-2-2b-it --num_train_epochs=1 --per_device_train_batch_size=64 --gradient_accumulation_steps=1 --per_device_eval_batch_size=64 --exp_setup=hyper_lora --aggregator_type=perceiver --target_modules=down_proj --num_self_attends_per_block=8 --num_latent_factor=1 --num_pre_head_layers=1 --lora_r=16 --eval_steps=1000 --save_steps=1000 --learning_rate=4e-5 --lora_dropout=0.0 --neftune_noise_alpha=5 --use_light_weight_lora=True --light_weight_latent_size=512 --load_best_model_at_end=False --metric_for_best_model=eval_pwc_loss --add_negative_prompt=False --add_repeat_prompt=False --use_sequence_packing=True --max_packed_inp_len=16000 --max_packed_ctx_len=32000 --per_rank_gen=True --per_layer_processing=True --gen_lora_l1_reg_coef=0.1 ``` ### PwC + Hotpot training (for testing/debugging) ```bash WANDB_MODE=disabled uv run intx_sft.py configs/pwc_hotpot_qa.yaml \ ---model_name_or_path=google/gemma-2-2b-it --num_train_epochs=1 --per_device_train_batch_size=32 \ ---gradient_accumulation_steps=1 --per_device_eval_batch_size=32 --exp_setup=hyper_lora \ +--model_name_or_path=google/gemma-2-2b-it --num_train_epochs=1 --per_device_train_batch_size=64 \ +--gradient_accumulation_steps=1 --per_device_eval_batch_size=64 --exp_setup=hyper_lora \ --aggregator_type=perceiver \ --target_modules=down_proj \ ---num_self_attends_per_block=8 --num_latent_factor=2 \ ---lora_r=8 \ +--num_self_attends_per_block=8 --num_latent_factor=1 \ +--num_pre_head_layers=1 \ +--lora_r=16 \ --eval_steps=1000 --save_steps=1000 --learning_rate=4e-5 --lora_dropout=0.0 \ ---neftune_noise_alpha=5 --use_light_weight_lora=False \ ---load_best_model_at_end=True --metric_for_best_model=eval_pwc_loss --add_negative_prompt=False \ +--neftune_noise_alpha=5 --use_light_weight_lora=True --light_weight_latent_size=512 \ +--load_best_model_at_end=False --metric_for_best_model=eval_pwc_loss \ +--add_negative_prompt=False \ --add_repeat_prompt=False \ ---use_sequence_packing=True --max_packed_inp_len=20000 --max_packed_ctx_len=40000 \ +--use_sequence_packing=True --max_packed_inp_len=10000 --max_packed_ctx_len=20000 \ --per_rank_gen=True \ --per_layer_processing=True \ --gen_lora_l1_reg_coef=0.1 \