From e1a3926e25aa10745f46e9e144ca50188633d36d Mon Sep 17 00:00:00 2001 From: ShinnosukeUesakaSakana Date: Thu, 28 Aug 2025 21:03:53 +0900 Subject: [PATCH] Improved training data generation (#14) * add catridge prompts * fix bugs * add instruction * add generic prompt + improved prompts and template * default max len --------- Co-authored-by: 51616 --- README.md | 2 +- data/generate_fw_edu_qa_v3.py | 287 ++++++++++++++++++++++++++++++++++ data/q_generation_prompts.py | 114 ++++++++++++++ 3 files changed, 402 insertions(+), 1 deletion(-) create mode 100644 data/generate_fw_edu_qa_v3.py create mode 100644 data/q_generation_prompts.py diff --git a/README.md b/README.md index 61ab0cc..452c7f9 100644 --- a/README.md +++ b/README.md @@ -175,6 +175,7 @@ run uv run data/generate_fw_edu_qa_v2.py --shard_pattern "000_00000" --n_qa_pair run uv run data/generate_fw_edu_qa_v2_repeat.py --shard_pattern "min_0_to_2000/000*level_0*" --n_qa_pairs=5 --vllm_model=google/gemma-3-12b-it; run uv run data/generate_fw_edu_qa_v2_repeat.py --shard_pattern "min_0_to_2000/000*level_1*" --n_qa_pairs=5 --vllm_model=google/gemma-3-12b-it; run uv run data/generate_fw_edu_qa_v2_repeat.py --shard_pattern "min_0_to_2000/000*level_2*" --n_qa_pairs=5 --vllm_model=google/gemma-3-12b-it +run uv run data/generate_fw_edu_qa_v3.py --n_qa_pairs 3 --shard_pattern '*' --debug --question_weight 1 --use_case_weight 1 --creative_weight 1 --generic_weight 1 ``` 2. Self-generated response QA data (depends on step 0 and 1) @@ -190,7 +191,6 @@ uv run data/self_generate_qa.py --vllm_model google/gemma-2-2b-it --glob_pattern uv run data/self_generate_qa.py --vllm_model google/gemma-2-2b-it --config configs/qa_short_ctx_self_gen_no_fw_qa.yaml ``` -