diff --git a/.gitignore b/.gitignore index f1fe41d..03042d4 100644 --- a/.gitignore +++ b/.gitignore @@ -24,4 +24,6 @@ watcher_state.yaml ds_config.json eval_results/ .github/ -*.code-workspace \ No newline at end of file +*.code-workspace +.wandb/ +.ruff_cache/ diff --git a/README.md b/README.md index 8b40768..939a315 100644 --- a/README.md +++ b/README.md @@ -33,6 +33,22 @@ print(model.decode(outputs)) ```bash WANDB_MODE=disabled uv run python intx_sft.py configs/context_numbers_10.yaml --model_name_or_path=meta-llama/Llama-3.2-1B-Instruct --num_train_epochs=100 --per_device_train_batch_size=64 --per_device_eval_batch_size=64 --exp_setup=hyper_lora --aggregator_type=perceiver --target_modules=down_proj --per_rank_gen=True --per_layer_processing=True --decoder_depth=2 --seed=1 --gen_lora_l1_reg_coef=0 --use_token_mixing=False --lora_r=8 --bf16=True --tf32=True --dataloader_num_workers=8 --dataloader_prefetch_factor=8 ``` +### PwC + Hotpot training (for testing/debugging) +```bash +uv run intx_sft.py configs/pwc_hotpot_qa.yaml \ +--model_name_or_path=google/gemma-2-2b-it --num_train_epochs=1 --per_device_train_batch_size=32 \ +--gradient_accumulation_steps=1 --per_device_eval_batch_size=32 --exp_setup=hyper_lora --aggregator_type=perceiver \ +--target_modules=down_proj \ +--num_self_attends_per_block=4 --num_latent_factor=2 \ +--lora_r=8 \ +--eval_steps=1000 --save_steps=1000 --learning_rate=4e-5 --lora_dropout=0.0 \ +--neftune_noise_alpha=5 --use_light_weight_lora=False \ +--load_best_model_at_end=True --metric_for_best_model=pwc_loss --add_negative_prompt=False \ +--add_repeat_prompt=False \ +--use_sequence_packing=True --per_rank_gen=True \ +--per_layer_processing=True \ +--gen_lora_l1_reg_coef=0.1 +```