From faac7dc35fe0f3def6d20dc4edba1b828149c8cf Mon Sep 17 00:00:00 2001 From: 51616 Date: Fri, 27 Jun 2025 14:59:27 +0900 Subject: [PATCH] readme dataloading + comments cleanup --- README.md | 32 +++++++++++++++++++--- scripts/short_ctx/gemma_qa_short_ctx.sh | 34 ++++++++++++++++++++++++ src/ctx_to_lora/data/collator.py | 7 +---- src/ctx_to_lora/data/processing.py | 35 +++++++++++-------------- src/ctx_to_lora/eval_utils.py | 2 -- src/ctx_to_lora/trainer.py | 4 +++ 6 files changed, 83 insertions(+), 31 deletions(-) create mode 100644 scripts/short_ctx/gemma_qa_short_ctx.sh diff --git a/README.md b/README.md index 28e28a9..504752c 100644 --- a/README.md +++ b/README.md @@ -42,7 +42,7 @@ WANDB_MODE=disabled run uv run intx_sft.py configs/fw_qa_v2_level_0_tiny.yaml -- ```bash WANDB_MODE=disabled uv run intx_sft.py configs/squad.yaml --model_name_or_path=google/gemma-3-1b-it --num_train_epochs=5 --per_device_train_batch_size=64 --gradient_accumulation_steps=8 --per_device_eval_batch_size=64 --exp_setup=hyper_lora --aggregator_type=perceiver --target_modules=down_proj --num_self_attends_per_block=8 --num_latent_factor=1 --num_pre_head_layers=1 --lora_r=8 --eval_steps=1000 --save_steps=1000 --learning_rate=4e-5 --lora_dropout=0.0 --neftune_noise_alpha=5 --use_light_weight_lora=False --add_negative_prompt=False --add_repeat_prompt=False --use_sequence_packing=True --max_packed_inp_len=16000 --max_packed_ctx_len=32000 --per_rank_gen=True --per_layer_processing=True --gen_lora_l1_reg_coef=0.1 --logging_steps=10 ``` - +