From dcda29bae6c51268800a084ae3680458321b551f Mon Sep 17 00:00:00 2001 From: 51616 Date: Mon, 2 Jun 2025 09:02:20 +0000 Subject: [PATCH] watcher + partial refactor eval + debug train w/ pwc and hotpot --- .gitignore | 4 +- README.md | 16 + configs/pwc_hotpot_qa.yaml | 24 +- intx_sft.py | 73 +++-- pyproject.toml | 5 +- run_eval.py | 84 +++++ src/ctx_to_lora/data/collator.py | 108 ++++++ src/ctx_to_lora/data/definitions.py | 20 ++ src/ctx_to_lora/data/processing.py | 32 +- src/ctx_to_lora/eval.py | 0 eval.py => src/ctx_to_lora/eval_utils.py | 397 ++++------------------- src/ctx_to_lora/metrics.py | 17 +- watcher.py | 73 ++--- 13 files changed, 409 insertions(+), 444 deletions(-) create mode 100644 run_eval.py delete mode 100644 src/ctx_to_lora/eval.py rename eval.py => src/ctx_to_lora/eval_utils.py (66%) diff --git a/.gitignore b/.gitignore index f1fe41d..03042d4 100644 --- a/.gitignore +++ b/.gitignore @@ -24,4 +24,6 @@ watcher_state.yaml ds_config.json eval_results/ .github/ -*.code-workspace \ No newline at end of file +*.code-workspace +.wandb/ +.ruff_cache/ diff --git a/README.md b/README.md index 8b40768..939a315 100644 --- a/README.md +++ b/README.md @@ -33,6 +33,22 @@ print(model.decode(outputs)) ```bash WANDB_MODE=disabled uv run python intx_sft.py configs/context_numbers_10.yaml --model_name_or_path=meta-llama/Llama-3.2-1B-Instruct --num_train_epochs=100 --per_device_train_batch_size=64 --per_device_eval_batch_size=64 --exp_setup=hyper_lora --aggregator_type=perceiver --target_modules=down_proj --per_rank_gen=True --per_layer_processing=True --decoder_depth=2 --seed=1 --gen_lora_l1_reg_coef=0 --use_token_mixing=False --lora_r=8 --bf16=True --tf32=True --dataloader_num_workers=8 --dataloader_prefetch_factor=8 ``` +### PwC + Hotpot training (for testing/debugging) +```bash +uv run intx_sft.py configs/pwc_hotpot_qa.yaml \ +--model_name_or_path=google/gemma-2-2b-it --num_train_epochs=1 --per_device_train_batch_size=32 \ +--gradient_accumulation_steps=1 --per_device_eval_batch_size=32 --exp_setup=hyper_lora --aggregator_type=perceiver \ +--target_modules=down_proj \ +--num_self_attends_per_block=4 --num_latent_factor=2 \ +--lora_r=8 \ +--eval_steps=1000 --save_steps=1000 --learning_rate=4e-5 --lora_dropout=0.0 \ +--neftune_noise_alpha=5 --use_light_weight_lora=False \ +--load_best_model_at_end=True --metric_for_best_model=pwc_loss --add_negative_prompt=False \ +--add_repeat_prompt=False \ +--use_sequence_packing=True --per_rank_gen=True \ +--per_layer_processing=True \ +--gen_lora_l1_reg_coef=0.1 +```