mirror of
https://github.com/SakanaAI/doc-to-lora.git
synced 2026-07-23 17:01:04 +02:00
add pwc
This commit is contained in:
parent
46c9ddb891
commit
6a2e61ccc8
4 changed files with 356 additions and 1 deletions
42
configs/pwc.yaml
Normal file
42
configs/pwc.yaml
Normal file
|
|
@ -0,0 +1,42 @@
|
|||
output_dir: "" # just a placeholder
|
||||
bf16: true
|
||||
model_name_or_path: meta-llama/Llama-3.2-1B-Instruct
|
||||
label_names: ["labels"]
|
||||
# eval_on_start: True
|
||||
# eval_strategy: "steps"
|
||||
# eval_steps: 500
|
||||
# save_strategy: "no"
|
||||
# # save_steps: 500
|
||||
# logging_strategy: "steps"
|
||||
# logging_steps: 100
|
||||
# use_liger_kernel: true
|
||||
# remove_unused_columns: false
|
||||
|
||||
# needed to avoid OOM by compute the metrics batch by batch
|
||||
# w/o this the trainer stores logits of all sample in memory...
|
||||
# batch_eval_metrics: true
|
||||
|
||||
per_device_train_batch_size: 32
|
||||
per_device_eval_batch_size: 32
|
||||
max_val_samples_per_ds: 20
|
||||
# optim: schedule_free_adamw
|
||||
learning_rate: 0.0001
|
||||
# lr_scheduler_type: "constant_with_warmup"
|
||||
neftune_noise_alpha: 1
|
||||
weight_decay: 0.1
|
||||
warmup_ratio: 0.05
|
||||
|
||||
# LoRA
|
||||
lora_r: 16
|
||||
lora_dropout: 0.05
|
||||
target_modules:
|
||||
- down_proj
|
||||
- up_proj
|
||||
- gate_proj
|
||||
|
||||
# data
|
||||
train_ds_names:
|
||||
- sggetao/PwC
|
||||
|
||||
test_ds_names:
|
||||
- sggetao/PwC
|
||||
306
configs/pwc_and_ctx_numbers_256.yaml
Normal file
306
configs/pwc_and_ctx_numbers_256.yaml
Normal file
|
|
@ -0,0 +1,306 @@
|
|||
output_dir: "" # just a placeholder
|
||||
bf16: true
|
||||
model_name_or_path: meta-llama/Llama-3.2-1B-Instruct
|
||||
label_names: ["labels"]
|
||||
# eval_on_start: True
|
||||
# eval_strategy: "steps"
|
||||
# eval_steps: 500
|
||||
# save_strategy: "no"
|
||||
# # save_steps: 500
|
||||
# logging_strategy: "steps"
|
||||
# logging_steps: 100
|
||||
# use_liger_kernel: true
|
||||
# remove_unused_columns: false
|
||||
|
||||
# needed to avoid OOM by compute the metrics batch by batch
|
||||
# w/o this the trainer stores logits of all sample in memory...
|
||||
# batch_eval_metrics: true
|
||||
|
||||
per_device_train_batch_size: 32
|
||||
per_device_eval_batch_size: 32
|
||||
max_val_samples_per_ds: 20
|
||||
# optim: schedule_free_adamw
|
||||
learning_rate: 0.0001
|
||||
# lr_scheduler_type: "constant_with_warmup"
|
||||
neftune_noise_alpha: 1
|
||||
weight_decay: 0.1
|
||||
warmup_ratio: 0.05
|
||||
|
||||
# LoRA
|
||||
lora_r: 16
|
||||
lora_dropout: 0.05
|
||||
target_modules:
|
||||
- down_proj
|
||||
- up_proj
|
||||
- gate_proj
|
||||
|
||||
# data
|
||||
train_ds_names:
|
||||
- sggetao/PwC
|
||||
- data/raw_datasets/context_numbers_128
|
||||
- data/raw_datasets/context_numbers_129
|
||||
- data/raw_datasets/context_numbers_130
|
||||
- data/raw_datasets/context_numbers_131
|
||||
- data/raw_datasets/context_numbers_132
|
||||
- data/raw_datasets/context_numbers_133
|
||||
- data/raw_datasets/context_numbers_134
|
||||
- data/raw_datasets/context_numbers_135
|
||||
- data/raw_datasets/context_numbers_136
|
||||
- data/raw_datasets/context_numbers_137
|
||||
- data/raw_datasets/context_numbers_138
|
||||
- data/raw_datasets/context_numbers_139
|
||||
- data/raw_datasets/context_numbers_140
|
||||
- data/raw_datasets/context_numbers_141
|
||||
- data/raw_datasets/context_numbers_142
|
||||
- data/raw_datasets/context_numbers_143
|
||||
- data/raw_datasets/context_numbers_144
|
||||
- data/raw_datasets/context_numbers_145
|
||||
- data/raw_datasets/context_numbers_146
|
||||
- data/raw_datasets/context_numbers_147
|
||||
- data/raw_datasets/context_numbers_148
|
||||
- data/raw_datasets/context_numbers_149
|
||||
- data/raw_datasets/context_numbers_150
|
||||
- data/raw_datasets/context_numbers_151
|
||||
- data/raw_datasets/context_numbers_152
|
||||
- data/raw_datasets/context_numbers_153
|
||||
- data/raw_datasets/context_numbers_154
|
||||
- data/raw_datasets/context_numbers_155
|
||||
- data/raw_datasets/context_numbers_156
|
||||
- data/raw_datasets/context_numbers_157
|
||||
- data/raw_datasets/context_numbers_158
|
||||
- data/raw_datasets/context_numbers_159
|
||||
- data/raw_datasets/context_numbers_160
|
||||
- data/raw_datasets/context_numbers_161
|
||||
- data/raw_datasets/context_numbers_162
|
||||
- data/raw_datasets/context_numbers_163
|
||||
- data/raw_datasets/context_numbers_164
|
||||
- data/raw_datasets/context_numbers_165
|
||||
- data/raw_datasets/context_numbers_166
|
||||
- data/raw_datasets/context_numbers_167
|
||||
- data/raw_datasets/context_numbers_168
|
||||
- data/raw_datasets/context_numbers_169
|
||||
- data/raw_datasets/context_numbers_170
|
||||
- data/raw_datasets/context_numbers_171
|
||||
- data/raw_datasets/context_numbers_172
|
||||
- data/raw_datasets/context_numbers_173
|
||||
- data/raw_datasets/context_numbers_174
|
||||
- data/raw_datasets/context_numbers_175
|
||||
- data/raw_datasets/context_numbers_176
|
||||
- data/raw_datasets/context_numbers_177
|
||||
- data/raw_datasets/context_numbers_178
|
||||
- data/raw_datasets/context_numbers_179
|
||||
- data/raw_datasets/context_numbers_180
|
||||
- data/raw_datasets/context_numbers_181
|
||||
- data/raw_datasets/context_numbers_182
|
||||
- data/raw_datasets/context_numbers_183
|
||||
- data/raw_datasets/context_numbers_184
|
||||
- data/raw_datasets/context_numbers_185
|
||||
- data/raw_datasets/context_numbers_186
|
||||
- data/raw_datasets/context_numbers_187
|
||||
- data/raw_datasets/context_numbers_188
|
||||
- data/raw_datasets/context_numbers_189
|
||||
- data/raw_datasets/context_numbers_190
|
||||
- data/raw_datasets/context_numbers_191
|
||||
- data/raw_datasets/context_numbers_192
|
||||
- data/raw_datasets/context_numbers_193
|
||||
- data/raw_datasets/context_numbers_194
|
||||
- data/raw_datasets/context_numbers_195
|
||||
- data/raw_datasets/context_numbers_196
|
||||
- data/raw_datasets/context_numbers_197
|
||||
- data/raw_datasets/context_numbers_198
|
||||
- data/raw_datasets/context_numbers_199
|
||||
- data/raw_datasets/context_numbers_200
|
||||
- data/raw_datasets/context_numbers_201
|
||||
- data/raw_datasets/context_numbers_202
|
||||
- data/raw_datasets/context_numbers_203
|
||||
- data/raw_datasets/context_numbers_204
|
||||
- data/raw_datasets/context_numbers_205
|
||||
- data/raw_datasets/context_numbers_206
|
||||
- data/raw_datasets/context_numbers_207
|
||||
- data/raw_datasets/context_numbers_208
|
||||
- data/raw_datasets/context_numbers_209
|
||||
- data/raw_datasets/context_numbers_210
|
||||
- data/raw_datasets/context_numbers_211
|
||||
- data/raw_datasets/context_numbers_212
|
||||
- data/raw_datasets/context_numbers_213
|
||||
- data/raw_datasets/context_numbers_214
|
||||
- data/raw_datasets/context_numbers_215
|
||||
- data/raw_datasets/context_numbers_216
|
||||
- data/raw_datasets/context_numbers_217
|
||||
- data/raw_datasets/context_numbers_218
|
||||
- data/raw_datasets/context_numbers_219
|
||||
- data/raw_datasets/context_numbers_220
|
||||
- data/raw_datasets/context_numbers_221
|
||||
- data/raw_datasets/context_numbers_222
|
||||
- data/raw_datasets/context_numbers_223
|
||||
- data/raw_datasets/context_numbers_224
|
||||
- data/raw_datasets/context_numbers_225
|
||||
- data/raw_datasets/context_numbers_226
|
||||
- data/raw_datasets/context_numbers_227
|
||||
- data/raw_datasets/context_numbers_228
|
||||
- data/raw_datasets/context_numbers_229
|
||||
- data/raw_datasets/context_numbers_230
|
||||
- data/raw_datasets/context_numbers_231
|
||||
- data/raw_datasets/context_numbers_232
|
||||
- data/raw_datasets/context_numbers_233
|
||||
- data/raw_datasets/context_numbers_234
|
||||
- data/raw_datasets/context_numbers_235
|
||||
- data/raw_datasets/context_numbers_236
|
||||
- data/raw_datasets/context_numbers_237
|
||||
- data/raw_datasets/context_numbers_238
|
||||
- data/raw_datasets/context_numbers_239
|
||||
- data/raw_datasets/context_numbers_240
|
||||
- data/raw_datasets/context_numbers_241
|
||||
- data/raw_datasets/context_numbers_242
|
||||
- data/raw_datasets/context_numbers_243
|
||||
- data/raw_datasets/context_numbers_244
|
||||
- data/raw_datasets/context_numbers_245
|
||||
- data/raw_datasets/context_numbers_246
|
||||
- data/raw_datasets/context_numbers_247
|
||||
- data/raw_datasets/context_numbers_248
|
||||
- data/raw_datasets/context_numbers_249
|
||||
- data/raw_datasets/context_numbers_250
|
||||
- data/raw_datasets/context_numbers_251
|
||||
- data/raw_datasets/context_numbers_252
|
||||
- data/raw_datasets/context_numbers_253
|
||||
- data/raw_datasets/context_numbers_254
|
||||
- data/raw_datasets/context_numbers_255
|
||||
- data/raw_datasets/context_numbers_256
|
||||
|
||||
|
||||
val_ds_names:
|
||||
- data/raw_datasets/context_numbers_128
|
||||
- data/raw_datasets/context_numbers_129
|
||||
- data/raw_datasets/context_numbers_130
|
||||
- data/raw_datasets/context_numbers_131
|
||||
- data/raw_datasets/context_numbers_132
|
||||
- data/raw_datasets/context_numbers_133
|
||||
- data/raw_datasets/context_numbers_134
|
||||
- data/raw_datasets/context_numbers_135
|
||||
- data/raw_datasets/context_numbers_136
|
||||
- data/raw_datasets/context_numbers_137
|
||||
- data/raw_datasets/context_numbers_138
|
||||
- data/raw_datasets/context_numbers_139
|
||||
- data/raw_datasets/context_numbers_140
|
||||
- data/raw_datasets/context_numbers_141
|
||||
- data/raw_datasets/context_numbers_142
|
||||
- data/raw_datasets/context_numbers_143
|
||||
- data/raw_datasets/context_numbers_144
|
||||
- data/raw_datasets/context_numbers_145
|
||||
- data/raw_datasets/context_numbers_146
|
||||
- data/raw_datasets/context_numbers_147
|
||||
- data/raw_datasets/context_numbers_148
|
||||
- data/raw_datasets/context_numbers_149
|
||||
- data/raw_datasets/context_numbers_150
|
||||
- data/raw_datasets/context_numbers_151
|
||||
- data/raw_datasets/context_numbers_152
|
||||
- data/raw_datasets/context_numbers_153
|
||||
- data/raw_datasets/context_numbers_154
|
||||
- data/raw_datasets/context_numbers_155
|
||||
- data/raw_datasets/context_numbers_156
|
||||
- data/raw_datasets/context_numbers_157
|
||||
- data/raw_datasets/context_numbers_158
|
||||
- data/raw_datasets/context_numbers_159
|
||||
- data/raw_datasets/context_numbers_160
|
||||
- data/raw_datasets/context_numbers_161
|
||||
- data/raw_datasets/context_numbers_162
|
||||
- data/raw_datasets/context_numbers_163
|
||||
- data/raw_datasets/context_numbers_164
|
||||
- data/raw_datasets/context_numbers_165
|
||||
- data/raw_datasets/context_numbers_166
|
||||
- data/raw_datasets/context_numbers_167
|
||||
- data/raw_datasets/context_numbers_168
|
||||
- data/raw_datasets/context_numbers_169
|
||||
- data/raw_datasets/context_numbers_170
|
||||
- data/raw_datasets/context_numbers_171
|
||||
- data/raw_datasets/context_numbers_172
|
||||
- data/raw_datasets/context_numbers_173
|
||||
- data/raw_datasets/context_numbers_174
|
||||
- data/raw_datasets/context_numbers_175
|
||||
- data/raw_datasets/context_numbers_176
|
||||
- data/raw_datasets/context_numbers_177
|
||||
- data/raw_datasets/context_numbers_178
|
||||
- data/raw_datasets/context_numbers_179
|
||||
- data/raw_datasets/context_numbers_180
|
||||
- data/raw_datasets/context_numbers_181
|
||||
- data/raw_datasets/context_numbers_182
|
||||
- data/raw_datasets/context_numbers_183
|
||||
- data/raw_datasets/context_numbers_184
|
||||
- data/raw_datasets/context_numbers_185
|
||||
- data/raw_datasets/context_numbers_186
|
||||
- data/raw_datasets/context_numbers_187
|
||||
- data/raw_datasets/context_numbers_188
|
||||
- data/raw_datasets/context_numbers_189
|
||||
- data/raw_datasets/context_numbers_190
|
||||
- data/raw_datasets/context_numbers_191
|
||||
- data/raw_datasets/context_numbers_192
|
||||
- data/raw_datasets/context_numbers_193
|
||||
- data/raw_datasets/context_numbers_194
|
||||
- data/raw_datasets/context_numbers_195
|
||||
- data/raw_datasets/context_numbers_196
|
||||
- data/raw_datasets/context_numbers_197
|
||||
- data/raw_datasets/context_numbers_198
|
||||
- data/raw_datasets/context_numbers_199
|
||||
- data/raw_datasets/context_numbers_200
|
||||
- data/raw_datasets/context_numbers_201
|
||||
- data/raw_datasets/context_numbers_202
|
||||
- data/raw_datasets/context_numbers_203
|
||||
- data/raw_datasets/context_numbers_204
|
||||
- data/raw_datasets/context_numbers_205
|
||||
- data/raw_datasets/context_numbers_206
|
||||
- data/raw_datasets/context_numbers_207
|
||||
- data/raw_datasets/context_numbers_208
|
||||
- data/raw_datasets/context_numbers_209
|
||||
- data/raw_datasets/context_numbers_210
|
||||
- data/raw_datasets/context_numbers_211
|
||||
- data/raw_datasets/context_numbers_212
|
||||
- data/raw_datasets/context_numbers_213
|
||||
- data/raw_datasets/context_numbers_214
|
||||
- data/raw_datasets/context_numbers_215
|
||||
- data/raw_datasets/context_numbers_216
|
||||
- data/raw_datasets/context_numbers_217
|
||||
- data/raw_datasets/context_numbers_218
|
||||
- data/raw_datasets/context_numbers_219
|
||||
- data/raw_datasets/context_numbers_220
|
||||
- data/raw_datasets/context_numbers_221
|
||||
- data/raw_datasets/context_numbers_222
|
||||
- data/raw_datasets/context_numbers_223
|
||||
- data/raw_datasets/context_numbers_224
|
||||
- data/raw_datasets/context_numbers_225
|
||||
- data/raw_datasets/context_numbers_226
|
||||
- data/raw_datasets/context_numbers_227
|
||||
- data/raw_datasets/context_numbers_228
|
||||
- data/raw_datasets/context_numbers_229
|
||||
- data/raw_datasets/context_numbers_230
|
||||
- data/raw_datasets/context_numbers_231
|
||||
- data/raw_datasets/context_numbers_232
|
||||
- data/raw_datasets/context_numbers_233
|
||||
- data/raw_datasets/context_numbers_234
|
||||
- data/raw_datasets/context_numbers_235
|
||||
- data/raw_datasets/context_numbers_236
|
||||
- data/raw_datasets/context_numbers_237
|
||||
- data/raw_datasets/context_numbers_238
|
||||
- data/raw_datasets/context_numbers_239
|
||||
- data/raw_datasets/context_numbers_240
|
||||
- data/raw_datasets/context_numbers_241
|
||||
- data/raw_datasets/context_numbers_242
|
||||
- data/raw_datasets/context_numbers_243
|
||||
- data/raw_datasets/context_numbers_244
|
||||
- data/raw_datasets/context_numbers_245
|
||||
- data/raw_datasets/context_numbers_246
|
||||
- data/raw_datasets/context_numbers_247
|
||||
- data/raw_datasets/context_numbers_248
|
||||
- data/raw_datasets/context_numbers_249
|
||||
- data/raw_datasets/context_numbers_250
|
||||
- data/raw_datasets/context_numbers_251
|
||||
- data/raw_datasets/context_numbers_252
|
||||
- data/raw_datasets/context_numbers_253
|
||||
- data/raw_datasets/context_numbers_254
|
||||
- data/raw_datasets/context_numbers_255
|
||||
- data/raw_datasets/context_numbers_256
|
||||
|
||||
test_ds_names:
|
||||
- data/raw_datasets/context_numbers_512
|
||||
- data/raw_datasets/context_numbers_1024
|
||||
- data/raw_datasets/context_numbers_2048
|
||||
- sggetao/PwC
|
||||
|
|
@ -188,6 +188,13 @@ def get_preprocessing_fn(ds_name: str) -> Callable[[dict[str, Any]], dict[str, A
|
|||
"""
|
||||
f = lambda x: x
|
||||
|
||||
if ds_name == "sggetao/PwC":
|
||||
|
||||
def f(example):
|
||||
example["context"] = example["input"]
|
||||
example["response"] = example["answer"]
|
||||
return example
|
||||
|
||||
# if ds_name == "context_numbers":
|
||||
|
||||
# def f(example):
|
||||
|
|
|
|||
|
|
@ -276,7 +276,7 @@ def main(output_dir):
|
|||
["train", "validation", "test"],
|
||||
[data_args.train_ds_names, data_args.val_ds_names, data_args.test_ds_names],
|
||||
):
|
||||
if ds_names is None:
|
||||
if not ds_names:
|
||||
continue
|
||||
if split == "train":
|
||||
tokenized_ds[split] = concatenate_datasets(
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue