yentinglin commited on Apr 8, 2024

Commit

9eeda76

verified ·

1 Parent(s): 19d2620

End of training

Browse files

Files changed (25) hide show

.gitattributes +1 -0
README.md +155 -0
config.json +29 -0
generation_config.json +8 -0
model-00001-of-00015.safetensors +3 -0
model-00002-of-00015.safetensors +3 -0
model-00003-of-00015.safetensors +3 -0
model-00004-of-00015.safetensors +3 -0
model-00005-of-00015.safetensors +3 -0
model-00006-of-00015.safetensors +3 -0
model-00007-of-00015.safetensors +3 -0
model-00008-of-00015.safetensors +3 -0
model-00009-of-00015.safetensors +3 -0
model-00010-of-00015.safetensors +3 -0
model-00011-of-00015.safetensors +3 -0
model-00012-of-00015.safetensors +3 -0
model-00013-of-00015.safetensors +3 -0
model-00014-of-00015.safetensors +3 -0
model-00015-of-00015.safetensors +3 -0
model.safetensors +3 -0
model.safetensors.index.json +329 -0
special_tokens_map.json +23 -0
tokenizer.json +3 -0
tokenizer_config.json +339 -0
training_args.bin +3 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text

README.md ADDED Viewed

	@@ -0,0 +1,155 @@

+---
+license: cc-by-nc-4.0
+base_model: CohereForAI/c4ai-command-r-v01
+tags:
+- axolotl
+- generated_from_trainer
+model-index:
+- name: command-r-ja-sharegpt
+  results: []
+---
+<!-- This model card has been generated automatically according to the information the Trainer had access to. You
+should probably proofread and complete it, then remove this comment. -->
+[<img src="https://raw.githubusercontent.com/OpenAccess-AI-Collective/axolotl/main/image/axolotl-badge-web.png" alt="Built with Axolotl" width="200" height="32"/>](https://github.com/OpenAccess-AI-Collective/axolotl)
+<details><summary>See axolotl config</summary>
+axolotl version: `0.4.0`
+```yaml
+base_model: CohereForAI/c4ai-command-r-v01
+load_in_8bit: false
+load_in_4bit: false
+strict: false
+hub_model_id: yentinglin/command-r-ja-sharegpt
+hub_strategy: end
+datasets:
+  - path: NTQAI/sharegpt-clean-ja
+    type: sharegpt
+    conversation: chatml
+chat_template: chatml
+dataset_prepared_path: last_run_prepared
+val_set_size: 0
+output_dir: ./output/ja/sft/command-r/sharegpt/
+sequence_len: 4096
+sample_packing: false
+eval_sample_packing: false
+pad_to_sequence_len: true
+adapter:
+lora_model_dir:
+lora_r:
+lora_alpha:
+lora_dropout:
+lora_target_linear:
+lora_fan_in_fan_out:
+wandb_project: JA-LLM
+wandb_entity:
+wandb_watch:
+wandb_name: sft-fft-command-r-sharegpt-clean-ja
+wandb_run_id:
+wandb_log_model:
+gradient_accumulation_steps: 8
+micro_batch_size: 1
+num_epochs: 4
+optimizer: adamw_bnb_8bit
+lr_scheduler: cosine
+cosine_min_lr_ratio: 0.1 # decay lr to some percentage of the peak lr, e.g. cosine_min_lr_ratio=0.1 for 10% of peak lr
+learning_rate: 1e-5
+adam_beta1: 0.9
+adam_beta2: 0.95
+adam_eps: 0.00001
+max_grad_norm: 1.0
+train_on_inputs: false
+group_by_length: false
+bf16: auto
+fp16:
+tf32: false
+gradient_checkpointing: true
+early_stopping_patience:
+resume_from_checkpoint:
+local_rank:
+logging_steps: 5
+xformers_attention:
+flash_attention: true
+flash_attn_cross_entropy: false
+flash_attn_rms_norm: true
+flash_attn_fuse_qkv: false
+flash_attn_fuse_mlp: true
+warmup_ratio: 0.02  # cannot use with warmup_steps
+evals_per_epoch: 1
+eval_table_size:
+save_per_epoch: 1
+save_total_limit: 1
+debug:
+deepspeed: deepspeed_configs/zero3_bf16.json # multi-gpu only
+weight_decay: 0.001
+fsdp:
+fsdp_config:
+special_tokens:
+ddp_timeout: 180000
+special_tokens:
+  eos_token: "<|im_end|>"
+tokens:
+  - "<|im_start|>"
+```
+</details><br>
+# command-r-ja-sharegpt
+This model is a fine-tuned version of [CohereForAI/c4ai-command-r-v01](https://huggingface.co/CohereForAI/c4ai-command-r-v01) on the None dataset.
+## Model description
+More information needed
+## Intended uses & limitations
+More information needed
+## Training and evaluation data
+More information needed
+## Training procedure
+### Training hyperparameters
+The following hyperparameters were used during training:
+- learning_rate: 1e-05
+- train_batch_size: 1
+- eval_batch_size: 1
+- seed: 42
+- distributed_type: multi-GPU
+- num_devices: 8
+- gradient_accumulation_steps: 8
+- total_train_batch_size: 64
+- total_eval_batch_size: 8
+- optimizer: Adam with betas=(0.9,0.95) and epsilon=1e-08
+- lr_scheduler_type: cosine
+- num_epochs: 4
+### Training results
+### Framework versions
+- Transformers 4.40.0.dev0
+- Pytorch 2.1.2+cu118
+- Datasets 2.18.0
+- Tokenizers 0.15.0

config.json ADDED Viewed

	@@ -0,0 +1,29 @@

+{
+  "_name_or_path": "CohereForAI/c4ai-command-r-v01",
+  "architectures": [
+    "CohereForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 5,
+  "eos_token_id": 255029,
+  "hidden_act": "silu",
+  "hidden_size": 8192,
+  "initializer_range": 0.02,
+  "intermediate_size": 22528,
+  "layer_norm_eps": 1e-05,
+  "logit_scale": 0.0625,
+  "max_position_embeddings": 8192,
+  "model_max_length": 131072,
+  "model_type": "cohere",
+  "num_attention_heads": 64,
+  "num_hidden_layers": 40,
+  "num_key_value_heads": 64,
+  "pad_token_id": 0,
+  "pretraining_tp": 1,
+  "rope_theta": 8000000.0,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.40.0.dev0",
+  "use_cache": false,
+  "vocab_size": 256000
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,8 @@

+{
+  "_from_model_config": true,
+  "bos_token_id": 5,
+  "do_sample": true,
+  "eos_token_id": 255001,
+  "pad_token_id": 0,
+  "transformers_version": "4.40.0.dev0"
+}

model-00001-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:9ff86cb64a73b43d8427e0766489fbaa4e84edc66cc5cee73b60e9a2c773c41e
+size 4731175520

model-00002-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0a0a87c7a3f2f36a89fa1d1b3cb8bc0834569de9f68c466d6d20f730c3402ebb
+size 4932553440

model-00003-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f33e1c375eaba611570c6744640d1b399de321fcf58acc69e156debbb6ec9373
+size 4932553440

model-00004-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1e40615bf21b54ed993423a7123037a88cef644efeb31e1b5af234fc3c717819
+size 4932553440

model-00005-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:8b69d9257da71a7c5fc91ee1b47cdda3814ba4cb6ded8729b01c109801194fab
+size 4932553464

model-00006-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d18a9668fa51207bf3dea6eca29e0a2aec95dc53c7c4c00077bf094abdf1343c
+size 4932553464

model-00007-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2e20203f0eef3e578195bffaf85994639961367a3a150ca2096b9f7f2cf223dc
+size 4932553464

model-00008-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f0a2f8da9feafd84be9920db5995c17f76829aefcca3eac740f86fdac1985a26
+size 4932553464

model-00009-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a8d14859bb5ed1e1e77b4afba6ca69b2b7251af65541c210bacd6cde48abc031
+size 4932553464

model-00010-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0a7602a3e9056e7f4185f7884e68b6a4d6118ff819f9b443285b14fad12f2714
+size 4932553464

model-00011-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:80c97af25d957761a1e69a308dd73030803b0ad7106a7e3ac8b4a4bd3501199f
+size 4932553464

model-00012-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5493c23b58af269c29f4ae2557d9ef87023241a30d693b59258c88a0866897a0
+size 4932553464

model-00013-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:80946898584159e90ac4f4b08e057f666146a7c5b843117215b427fd916a247e
+size 4932553464

model-00014-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:8ce12011a6ff43cd7d1d3f6b1fba54616e39f70860ce11d5e6ba9ef2877c2a7c
+size 4932553464

model-00015-of-00015.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:30dac6c0ddb990ea4965f2b368f340a2171d521eadd14a62aefd7edb921c88b8
+size 1107329592

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b48ee5b50754b016746fab10ed7516399ac0cb6f0497d07ee80960bb89b5f14e
+size 676080

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,329 @@

+{
+  "metadata": {
+    "total_size": 69961662464
+  },
+  "weight_map": {
+    "model.embed_tokens.weight": "model-00001-of-00015.safetensors",
+    "model.layers.0.input_layernorm.weight": "model-00002-of-00015.safetensors",
+    "model.layers.0.mlp.down_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.0.mlp.gate_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.0.mlp.up_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00015.safetensors",
+    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00015.safetensors",
+    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00015.safetensors",
+    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00015.safetensors",
+    "model.layers.1.input_layernorm.weight": "model-00002-of-00015.safetensors",
+    "model.layers.1.mlp.down_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.1.mlp.gate_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.1.mlp.up_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.1.self_attn.k_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.1.self_attn.o_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.1.self_attn.q_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.1.self_attn.v_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.10.input_layernorm.weight": "model-00005-of-00015.safetensors",
+    "model.layers.10.mlp.down_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.10.mlp.gate_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.10.mlp.up_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.10.self_attn.k_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.10.self_attn.o_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.10.self_attn.q_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.10.self_attn.v_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.11.input_layernorm.weight": "model-00005-of-00015.safetensors",
+    "model.layers.11.mlp.down_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.11.mlp.gate_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.11.mlp.up_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.11.self_attn.k_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.11.self_attn.o_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.11.self_attn.q_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.11.self_attn.v_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.12.input_layernorm.weight": "model-00006-of-00015.safetensors",
+    "model.layers.12.mlp.down_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.12.mlp.gate_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.12.mlp.up_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.12.self_attn.k_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.12.self_attn.o_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.12.self_attn.q_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.12.self_attn.v_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.13.input_layernorm.weight": "model-00006-of-00015.safetensors",
+    "model.layers.13.mlp.down_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.13.mlp.gate_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.13.mlp.up_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.13.self_attn.k_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.13.self_attn.o_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.13.self_attn.q_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.13.self_attn.v_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.14.input_layernorm.weight": "model-00006-of-00015.safetensors",
+    "model.layers.14.mlp.down_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.14.mlp.gate_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.14.mlp.up_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.14.self_attn.k_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.14.self_attn.o_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.14.self_attn.q_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.14.self_attn.v_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.15.input_layernorm.weight": "model-00007-of-00015.safetensors",
+    "model.layers.15.mlp.down_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.15.mlp.gate_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.15.mlp.up_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.15.self_attn.k_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.15.self_attn.o_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.15.self_attn.q_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.15.self_attn.v_proj.weight": "model-00006-of-00015.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00007-of-00015.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.16.mlp.gate_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.16.mlp.up_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.16.self_attn.k_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.16.self_attn.o_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.16.self_attn.q_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.16.self_attn.v_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00007-of-00015.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00008-of-00015.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00007-of-00015.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00008-of-00015.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.2.input_layernorm.weight": "model-00002-of-00015.safetensors",
+    "model.layers.2.mlp.down_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.2.mlp.gate_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.2.mlp.up_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.2.self_attn.k_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.2.self_attn.o_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.2.self_attn.q_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.2.self_attn.v_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00008-of-00015.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.21.input_layernorm.weight": "model-00009-of-00015.safetensors",
+    "model.layers.21.mlp.down_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.21.mlp.gate_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.21.mlp.up_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.21.self_attn.o_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.21.self_attn.v_proj.weight": "model-00008-of-00015.safetensors",
+    "model.layers.22.input_layernorm.weight": "model-00009-of-00015.safetensors",
+    "model.layers.22.mlp.down_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.22.mlp.gate_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.22.mlp.up_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.22.self_attn.k_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.22.self_attn.o_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.22.self_attn.q_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.22.self_attn.v_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.23.input_layernorm.weight": "model-00009-of-00015.safetensors",
+    "model.layers.23.mlp.down_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.23.mlp.gate_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.23.mlp.up_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.23.self_attn.k_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.23.self_attn.o_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.23.self_attn.q_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.23.self_attn.v_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.24.input_layernorm.weight": "model-00010-of-00015.safetensors",
+    "model.layers.24.mlp.down_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.24.mlp.gate_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.24.mlp.up_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.24.self_attn.k_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.24.self_attn.o_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.24.self_attn.q_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.24.self_attn.v_proj.weight": "model-00009-of-00015.safetensors",
+    "model.layers.25.input_layernorm.weight": "model-00010-of-00015.safetensors",
+    "model.layers.25.mlp.down_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.25.mlp.gate_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.25.mlp.up_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.25.self_attn.k_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.25.self_attn.o_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.25.self_attn.q_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.25.self_attn.v_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.26.input_layernorm.weight": "model-00010-of-00015.safetensors",
+    "model.layers.26.mlp.down_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.26.mlp.gate_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.26.mlp.up_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.26.self_attn.k_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.26.self_attn.o_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.26.self_attn.q_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.26.self_attn.v_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.27.input_layernorm.weight": "model-00011-of-00015.safetensors",
+    "model.layers.27.mlp.down_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.27.mlp.gate_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.27.mlp.up_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.27.self_attn.k_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.27.self_attn.o_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.27.self_attn.q_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.27.self_attn.v_proj.weight": "model-00010-of-00015.safetensors",
+    "model.layers.28.input_layernorm.weight": "model-00011-of-00015.safetensors",
+    "model.layers.28.mlp.down_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.28.mlp.gate_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.28.mlp.up_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.28.self_attn.k_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.28.self_attn.o_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.28.self_attn.q_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.28.self_attn.v_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00011-of-00015.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.29.mlp.gate_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.29.mlp.up_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.29.self_attn.k_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.29.self_attn.o_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.29.self_attn.q_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.29.self_attn.v_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.3.input_layernorm.weight": "model-00003-of-00015.safetensors",
+    "model.layers.3.mlp.down_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.3.mlp.gate_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.3.mlp.up_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.3.self_attn.o_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.3.self_attn.q_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.3.self_attn.v_proj.weight": "model-00002-of-00015.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00012-of-00015.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00011-of-00015.safetensors",
+    "model.layers.31.input_layernorm.weight": "model-00012-of-00015.safetensors",
+    "model.layers.31.mlp.down_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.32.input_layernorm.weight": "model-00012-of-00015.safetensors",
+    "model.layers.32.mlp.down_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.32.mlp.gate_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.32.mlp.up_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.32.self_attn.k_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.32.self_attn.o_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.32.self_attn.q_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.32.self_attn.v_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.33.input_layernorm.weight": "model-00013-of-00015.safetensors",
+    "model.layers.33.mlp.down_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.33.mlp.gate_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.33.mlp.up_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.33.self_attn.k_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.33.self_attn.o_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.33.self_attn.q_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.33.self_attn.v_proj.weight": "model-00012-of-00015.safetensors",
+    "model.layers.34.input_layernorm.weight": "model-00013-of-00015.safetensors",
+    "model.layers.34.mlp.down_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.34.mlp.gate_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.34.mlp.up_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.34.self_attn.k_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.34.self_attn.o_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.34.self_attn.q_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.34.self_attn.v_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.35.input_layernorm.weight": "model-00013-of-00015.safetensors",
+    "model.layers.35.mlp.down_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.35.mlp.gate_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.35.mlp.up_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.35.self_attn.k_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.35.self_attn.o_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.35.self_attn.q_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.35.self_attn.v_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.36.input_layernorm.weight": "model-00014-of-00015.safetensors",
+    "model.layers.36.mlp.down_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.36.mlp.gate_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.36.mlp.up_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.36.self_attn.k_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.36.self_attn.o_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.36.self_attn.q_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.36.self_attn.v_proj.weight": "model-00013-of-00015.safetensors",
+    "model.layers.37.input_layernorm.weight": "model-00014-of-00015.safetensors",
+    "model.layers.37.mlp.down_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.37.mlp.gate_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.37.mlp.up_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.37.self_attn.k_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.37.self_attn.o_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.37.self_attn.q_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.37.self_attn.v_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.38.input_layernorm.weight": "model-00014-of-00015.safetensors",
+    "model.layers.38.mlp.down_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.38.mlp.gate_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.38.mlp.up_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.38.self_attn.k_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.38.self_attn.o_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.38.self_attn.q_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.38.self_attn.v_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.39.input_layernorm.weight": "model-00015-of-00015.safetensors",
+    "model.layers.39.mlp.down_proj.weight": "model-00015-of-00015.safetensors",
+    "model.layers.39.mlp.gate_proj.weight": "model-00015-of-00015.safetensors",
+    "model.layers.39.mlp.up_proj.weight": "model-00015-of-00015.safetensors",
+    "model.layers.39.self_attn.k_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.39.self_attn.o_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.39.self_attn.q_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.39.self_attn.v_proj.weight": "model-00014-of-00015.safetensors",
+    "model.layers.4.input_layernorm.weight": "model-00003-of-00015.safetensors",
+    "model.layers.4.mlp.down_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.4.mlp.gate_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.4.mlp.up_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.4.self_attn.k_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.4.self_attn.o_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.4.self_attn.q_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.4.self_attn.v_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.5.input_layernorm.weight": "model-00003-of-00015.safetensors",
+    "model.layers.5.mlp.down_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.5.mlp.gate_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.5.mlp.up_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.5.self_attn.k_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.5.self_attn.o_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.5.self_attn.q_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.5.self_attn.v_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.6.input_layernorm.weight": "model-00004-of-00015.safetensors",
+    "model.layers.6.mlp.down_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.6.mlp.gate_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.6.mlp.up_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.6.self_attn.k_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.6.self_attn.o_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.6.self_attn.q_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.6.self_attn.v_proj.weight": "model-00003-of-00015.safetensors",
+    "model.layers.7.input_layernorm.weight": "model-00004-of-00015.safetensors",
+    "model.layers.7.mlp.down_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.7.mlp.gate_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.7.mlp.up_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.7.self_attn.k_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.7.self_attn.o_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.7.self_attn.q_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.7.self_attn.v_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00004-of-00015.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.8.self_attn.k_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.8.self_attn.o_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.8.self_attn.q_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.8.self_attn.v_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.9.input_layernorm.weight": "model-00005-of-00015.safetensors",
+    "model.layers.9.mlp.down_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.9.mlp.gate_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.9.mlp.up_proj.weight": "model-00005-of-00015.safetensors",
+    "model.layers.9.self_attn.k_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.9.self_attn.o_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.9.self_attn.q_proj.weight": "model-00004-of-00015.safetensors",
+    "model.layers.9.self_attn.v_proj.weight": "model-00004-of-00015.safetensors",
+    "model.norm.weight": "model-00015-of-00015.safetensors"
+  }
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,23 @@

+{
+  "bos_token": {
+    "content": "<BOS_TOKEN>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|im_end|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<PAD>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5934bac57d8b96338b17d3c0366cce37ea233dcf8bcaa03359772d4d2c5eb41c
+size 12777782

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,339 @@

+{
+  "add_bos_token": true,
+  "add_eos_token": false,
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<PAD>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<UNK>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "<CLS>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "3": {
+      "content": "<SEP>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "4": {
+      "content": "<MASK_TOKEN>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "5": {
+      "content": "<BOS_TOKEN>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "6": {
+      "content": "<EOS_TOKEN>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "7": {
+      "content": "<EOP_TOKEN>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "255000": {
+      "content": "<|START_OF_TURN_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255001": {
+      "content": "<|END_OF_TURN_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "255002": {
+      "content": "<|YES_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255003": {
+      "content": "<|NO_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255004": {
+      "content": "<|GOOD_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255005": {
+      "content": "<|BAD_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255006": {
+      "content": "<|USER_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255007": {
+      "content": "<|CHATBOT_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255008": {
+      "content": "<|SYSTEM_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255009": {
+      "content": "<|USER_0_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255010": {
+      "content": "<|USER_1_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255011": {
+      "content": "<|USER_2_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255012": {
+      "content": "<|USER_3_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255013": {
+      "content": "<|USER_4_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255014": {
+      "content": "<|USER_5_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255015": {
+      "content": "<|USER_6_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255016": {
+      "content": "<|USER_7_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255017": {
+      "content": "<|USER_8_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255018": {
+      "content": "<|USER_9_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255019": {
+      "content": "<|EXTRA_0_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255020": {
+      "content": "<|EXTRA_1_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255021": {
+      "content": "<|EXTRA_2_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255022": {
+      "content": "<|EXTRA_3_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255023": {
+      "content": "<|EXTRA_4_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255024": {
+      "content": "<|EXTRA_5_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255025": {
+      "content": "<|EXTRA_6_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255026": {
+      "content": "<|EXTRA_7_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255027": {
+      "content": "<|EXTRA_8_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255028": {
+      "content": "<|EXTRA_9_TOKEN|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "255029": {
+      "content": "<|im_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "255030": {
+      "content": "<|im_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    }
+  },
+  "auto_map": {
+    "AutoTokenizer": [
+      null,
+      "CohereForAI/c4ai-command-r-v01--tokenization_cohere_fast.CohereTokenizerFast"
+    ]
+  },
+  "bos_token": "<BOS_TOKEN>",
+  "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% for message in messages %}{{'<|im_start|>' + message['role'] + '\n' + message['content'] + '<|im_end|>' + '\n'}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant\n' }}{% endif %}",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|im_end|>",
+  "legacy": true,
+  "merges_file": null,
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "<PAD>",
+  "sp_model_kwargs": {},
+  "spaces_between_special_tokens": false,
+  "tokenizer_class": "CohereTokenizer",
+  "unk_token": null,
+  "use_default_system_prompt": false,
+  "vocab_file": null
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:effca8b8295b24bd8b0554716584469767f8944e6d97f3254a3226b553b637f0
+size 7672