Upload folder using huggingface_hub

Browse files

Files changed (15) hide show

config.json +41 -0
generation_config.json +6 -0
merges.txt +0 -0
model.safetensors +3 -0
optimizer.pt +3 -0
rng_state_0.pth +3 -0
rng_state_1.pth +3 -0
rng_state_2.pth +3 -0
scheduler.pt +3 -0
special_tokens_map.json +30 -0
tokenizer.json +0 -0
tokenizer_config.json +24 -0
trainer_state.json +89 -0
training_args.bin +3 -0
vocab.json +0 -0

config.json ADDED Viewed

	@@ -0,0 +1,41 @@

+{
+  "_name_or_path": "RaushanTurganbay/GPT2_instruct_tuned",
+  "activation_function": "gelu_new",
+  "architectures": [
+    "GPT2LMHeadModel"
+  ],
+  "attn_pdrop": 0.1,
+  "bos_token_id": 50256,
+  "embd_pdrop": 0.1,
+  "eos_token_id": 50256,
+  "initializer_range": 0.02,
+  "layer_norm_epsilon": 1e-05,
+  "model_type": "gpt2",
+  "n_ctx": 1024,
+  "n_embd": 1024,
+  "n_head": 16,
+  "n_inner": null,
+  "n_layer": 24,
+  "n_positions": 1024,
+  "n_special": 0,
+  "predict_special_tokens": true,
+  "reorder_and_upcast_attn": false,
+  "resid_pdrop": 0.1,
+  "scale_attn_by_inverse_layer_idx": false,
+  "scale_attn_weights": true,
+  "summary_activation": null,
+  "summary_first_dropout": 0.1,
+  "summary_proj_to_labels": true,
+  "summary_type": "cls_index",
+  "summary_use_proj": true,
+  "task_specific_params": {
+    "text-generation": {
+      "do_sample": true,
+      "max_length": 50
+    }
+  },
+  "torch_dtype": "float32",
+  "transformers_version": "4.35.0",
+  "use_cache": true,
+  "vocab_size": 50257
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,6 @@

+{
+  "_from_model_config": true,
+  "bos_token_id": 50256,
+  "eos_token_id": 50256,
+  "transformers_version": "4.35.0"
+}

merges.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:03235fd0269488d8cd4423104f33e686aecfedfe3dc149af35efa6e5ce3b5ac4
+size 1419322880

optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a0bcbaddedc7d0475f605f7565eec44f000ebcc1c1b1315bd62a8bd69d20dbee
+size 1814002618

rng_state_0.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:85ad2cbc3c7a0fefa416ca212a3ca0c765342dd508d3b01b19c9bdea93628432
+size 14768

rng_state_1.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b9903702cd62a564aeefa5a7e25e7880f9da928b6f8206920658a1bffb56fd4d
+size 14768

rng_state_2.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d8e2a0709246422023102bef738c8b868479d2bb14ff3437e9da4185d107bb40
+size 14768

scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3e6e9380fd9d2b73c11381e0b5d08d710643424b0797ec19d68db1b4c85b288d
+size 1064

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,30 @@

+{
+  "bos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,24 @@

+{
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "50256": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "bos_token": "<|endoftext|>",
+  "clean_up_tokenization_spaces": true,
+  "eos_token": "<|endoftext|>",
+  "max_length": 750,
+  "model_max_length": 1024,
+  "pad_token": "<|endoftext|>",
+  "stride": 0,
+  "tokenizer_class": "GPT2Tokenizer",
+  "truncation_side": "right",
+  "truncation_strategy": "longest_first",
+  "unk_token": "<|endoftext|>"
+}

trainer_state.json ADDED Viewed

	@@ -0,0 +1,89 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 0.6019110676397562,
+  "eval_steps": 500,
+  "global_step": 1000,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.12,
+      "learning_rate": 8.000000000000001e-06,
+      "logits/chosen": -58.747344970703125,
+      "logits/rejected": -59.84019470214844,
+      "logps/chosen": -150.3143768310547,
+      "logps/rejected": -179.38966369628906,
+      "loss": 0.5314,
+      "rewards/accuracies": 0.7318750023841858,
+      "rewards/chosen": -0.8851571679115295,
+      "rewards/margins": 0.6559739708900452,
+      "rewards/rejected": -1.5411310195922852,
+      "step": 200
+    },
+    {
+      "epoch": 0.24,
+      "learning_rate": 9.68421052631579e-06,
+      "logits/chosen": -64.05355072021484,
+      "logits/rejected": -65.13407897949219,
+      "logps/chosen": -155.71795654296875,
+      "logps/rejected": -190.02166748046875,
+      "loss": 0.4485,
+      "rewards/accuracies": 0.7715625166893005,
+      "rewards/chosen": -1.3824467658996582,
+      "rewards/margins": 1.1924123764038086,
+      "rewards/rejected": -2.5748589038848877,
+      "step": 400
+    },
+    {
+      "epoch": 0.36,
+      "learning_rate": 9.263157894736842e-06,
+      "logits/chosen": -64.59612274169922,
+      "logits/rejected": -65.59567260742188,
+      "logps/chosen": -158.51266479492188,
+      "logps/rejected": -191.44497680664062,
+      "loss": 0.4208,
+      "rewards/accuracies": 0.7871875166893005,
+      "rewards/chosen": -1.4413859844207764,
+      "rewards/margins": 1.3812304735183716,
+      "rewards/rejected": -2.8226163387298584,
+      "step": 600
+    },
+    {
+      "epoch": 0.48,
+      "learning_rate": 8.842105263157895e-06,
+      "logits/chosen": -65.70255279541016,
+      "logits/rejected": -66.5833969116211,
+      "logps/chosen": -156.6477508544922,
+      "logps/rejected": -195.2394561767578,
+      "loss": 0.4062,
+      "rewards/accuracies": 0.7973437309265137,
+      "rewards/chosen": -1.4948838949203491,
+      "rewards/margins": 1.513500690460205,
+      "rewards/rejected": -3.0083847045898438,
+      "step": 800
+    },
+    {
+      "epoch": 0.6,
+      "learning_rate": 8.421052631578948e-06,
+      "logits/chosen": -65.27395629882812,
+      "logits/rejected": -66.06521606445312,
+      "logps/chosen": -156.45945739746094,
+      "logps/rejected": -196.63790893554688,
+      "loss": 0.3898,
+      "rewards/accuracies": 0.7978125214576721,
+      "rewards/chosen": -1.6718982458114624,
+      "rewards/margins": 1.6537814140319824,
+      "rewards/rejected": -3.3256795406341553,
+      "step": 1000
+    }
+  ],
+  "logging_steps": 200,
+  "max_steps": 5000,
+  "num_train_epochs": 4,
+  "save_steps": 500,
+  "total_flos": 0.0,
+  "trial_name": null,
+  "trial_params": null
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f7e1e66a5fc1e5e94ca641507f4b9c8653beee72fb1693755e34b6c8669c1633
+size 4536

vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff