yesj1234 commited on Sep 7, 2023

Commit

f2b768e

1 Parent(s): c814467

Upload folder using huggingface_hub

Browse files

Files changed (29) hide show

.gitattributes +2 -0
README.md +72 -0
all_results.json +15 -0
checkpoint-1500/config.json +60 -0
checkpoint-1500/generation_config.json +10 -0
checkpoint-1500/optimizer.pt +3 -0
checkpoint-1500/pytorch_model.bin +3 -0
checkpoint-1500/rng_state_0.pth +3 -0
checkpoint-1500/rng_state_1.pth +3 -0
checkpoint-1500/rng_state_2.pth +3 -0
checkpoint-1500/rng_state_3.pth +3 -0
checkpoint-1500/scheduler.pt +3 -0
checkpoint-1500/sentencepiece.bpe.model +3 -0
checkpoint-1500/special_tokens_map.json +42 -0
checkpoint-1500/tokenizer.json +3 -0
checkpoint-1500/tokenizer_config.json +23 -0
checkpoint-1500/trainer_state.json +87 -0
checkpoint-1500/training_args.bin +3 -0
config.json +60 -0
eval_results.json +10 -0
generation_config.json +10 -0
pytorch_model.bin +3 -0
sentencepiece.bpe.model +3 -0
special_tokens_map.json +42 -0
tokenizer.json +3 -0
tokenizer_config.json +23 -0
train_results.json +8 -0
trainer_state.json +96 -0
training_args.bin +3 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,5 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+checkpoint-1500/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text

README.md ADDED Viewed

	@@ -0,0 +1,72 @@

+---
+language:
+- ko
+- zh
+base_model: ./zh_reduced_model
+tags:
+- generated_from_trainer
+metrics:
+- bleu
+model-index:
+- name: mbart_cycle0_ko-zh
+  results: []
+---
+<!-- This model card has been generated automatically according to the information the Trainer had access to. You
+should probably proofread and complete it, then remove this comment. -->
+# mbart_cycle0_ko-zh
+This model is a fine-tuned version of [./zh_reduced_model](https://huggingface.co/./zh_reduced_model) on an unknown dataset.
+It achieves the following results on the evaluation set:
+- Loss: 6.3117
+- Bleu: 19.1703
+- Gen Len: 14.3881
+## Model description
+More information needed
+## Intended uses & limitations
+More information needed
+## Training and evaluation data
+More information needed
+## Training procedure
+### Training hyperparameters
+The following hyperparameters were used during training:
+- learning_rate: 5e-05
+- train_batch_size: 4
+- eval_batch_size: 4
+- seed: 42
+- distributed_type: multi-GPU
+- num_devices: 4
+- total_train_batch_size: 16
+- total_eval_batch_size: 16
+- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
+- lr_scheduler_type: linear
+- lr_scheduler_warmup_steps: 300
+- num_epochs: 50
+### Training results
+| Training Loss | Epoch | Step | Validation Loss | Bleu    | Gen Len  |
+|:-------------:|:-----:|:----:|:---------------:|:-------:|:--------:|
+| No log        | 8.82  | 300  | 5.4963          | 0.2892  | 127.2388 |
+| 8.4505        | 17.65 | 600  | 5.6784          | 18.0955 | 12.7761  |
+| 8.4505        | 26.47 | 900  | 5.9406          | 19.7871 | 13.6119  |
+| 0.4947        | 35.29 | 1200 | 6.2203          | 16.6303 | 13.209   |
+| 0.0447        | 44.12 | 1500 | 6.2942          | 19.9934 | 14.0448  |
+### Framework versions
+- Transformers 4.33.1
+- Pytorch 2.0.1+cu117
+- Datasets 2.14.5
+- Tokenizers 0.13.3

all_results.json ADDED Viewed

	@@ -0,0 +1,15 @@

+{
+    "epoch": 50.0,
+    "eval_bleu": 19.1703,
+    "eval_gen_len": 14.3881,
+    "eval_loss": 6.311681270599365,
+    "eval_runtime": 4.4343,
+    "eval_samples": 67,
+    "eval_samples_per_second": 15.11,
+    "eval_steps_per_second": 1.128,
+    "train_loss": 2.645088053380742,
+    "train_runtime": 1356.8639,
+    "train_samples": 539,
+    "train_samples_per_second": 19.862,
+    "train_steps_per_second": 1.253
+}

checkpoint-1500/config.json ADDED Viewed

	@@ -0,0 +1,60 @@

+{
+  "_name_or_path": "./zh_reduced_model",
+  "_num_labels": 3,
+  "activation_dropout": 0.0,
+  "activation_function": "gelu",
+  "add_bias_logits": false,
+  "add_final_layer_norm": true,
+  "architectures": [
+    "MBartForConditionalGeneration"
+  ],
+  "attention_dropout": 0.0,
+  "bos_token_id": 0,
+  "classif_dropout": 0.0,
+  "classifier_dropout": 0.0,
+  "d_model": 1024,
+  "decoder_attention_heads": 16,
+  "decoder_ffn_dim": 4096,
+  "decoder_layerdrop": 0.0,
+  "decoder_layers": 12,
+  "decoder_start_token_id": 250025,
+  "dropout": 0.1,
+  "encoder_attention_heads": 16,
+  "encoder_ffn_dim": 4096,
+  "encoder_layerdrop": 0.0,
+  "encoder_layers": 12,
+  "eos_token_id": 2,
+  "forced_eos_token_id": 2,
+  "id2label": {
+    "0": "LABEL_0",
+    "1": "LABEL_1",
+    "2": "LABEL_2"
+  },
+  "init_std": 0.02,
+  "is_encoder_decoder": true,
+  "label2id": {
+    "LABEL_0": 0,
+    "LABEL_1": 1,
+    "LABEL_2": 2
+  },
+  "max_length": 1024,
+  "max_position_embeddings": 1024,
+  "model_type": "mbart",
+  "normalize_before": true,
+  "normalize_embedding": true,
+  "num_beams": 5,
+  "num_hidden_layers": 12,
+  "output_past": true,
+  "pad_token_id": 1,
+  "scale_embedding": true,
+  "static_position_embeddings": false,
+  "task_specific_params": {
+    "translation_en_to_ro": {
+      "decoder_start_token_id": 250020
+    }
+  },
+  "torch_dtype": "float32",
+  "transformers_version": "4.33.1",
+  "use_cache": true,
+  "vocab_size": 250027
+}

checkpoint-1500/generation_config.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+  "bos_token_id": 0,
+  "decoder_start_token_id": 250025,
+  "eos_token_id": 2,
+  "forced_eos_token_id": 2,
+  "max_length": 1024,
+  "num_beams": 5,
+  "pad_token_id": 1,
+  "transformers_version": "4.33.1"
+}

checkpoint-1500/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5a2606a178a1e8cf4d93e8a6ff395f51980f9ddb75db01bab2d884bfde27b745
+size 4887252270

checkpoint-1500/pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b8d1410ecdbdde69a04f164bd5dbbfbbc57a166b525ffe8b08af28617eb78c54
+size 2444583325

checkpoint-1500/rng_state_0.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:94a371cbe503152b8795d9ece51117310c0df79aaae00820a006b285eefa0f48
+size 17655

checkpoint-1500/rng_state_1.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4eb804289f2b2005356d4ff59b721d4b0b0891329c8ed4b95a500a9cc37be2a9
+size 17655

checkpoint-1500/rng_state_2.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:697178b3310f20cfb103cce6f2922e17db64035c5d1a9aa8312e6881b8f90e7d
+size 17655

checkpoint-1500/rng_state_3.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:de3e63686ead55cb8068fbd046bba621a27db0743de6e6ba7e6791030f037657
+size 17655

checkpoint-1500/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:620451efc688b94cec4a02522a7d3699e5faf06a2c24ed249d15899301b55b51
+size 627

checkpoint-1500/sentencepiece.bpe.model ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:cfc8146abe2a0488e9e2a0c56de7952f7c11ab059eca145a0a727afce0db2865
+size 5069051

checkpoint-1500/special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,42 @@

+{
+  "additional_special_tokens": [
+    "ar_AR",
+    "cs_CZ",
+    "de_DE",
+    "en_XX",
+    "es_XX",
+    "et_EE",
+    "fi_FI",
+    "fr_XX",
+    "gu_IN",
+    "hi_IN",
+    "it_IT",
+    "ja_XX",
+    "kk_KZ",
+    "ko_KR",
+    "lt_LT",
+    "lv_LV",
+    "my_MM",
+    "ne_NP",
+    "nl_XX",
+    "ro_RO",
+    "ru_RU",
+    "si_LK",
+    "tr_TR",
+    "vi_VN",
+    "zh_CN"
+  ],
+  "bos_token": "<s>",
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "mask_token": {
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "unk_token": "<unk>"
+}

checkpoint-1500/tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c645d47f1b17b579114ff283e7a1023a596dbd37a6c8b189c3c9870afdbb00c0
+size 17103594

checkpoint-1500/tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,23 @@

+{
+  "additional_special_tokens": null,
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": true,
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "mask_token": {
+    "__type": "AddedToken",
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "model_max_length": 1024,
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "sp_model_kwargs": {},
+  "src_lang": null,
+  "tgt_lang": null,
+  "tokenizer_class": "MBartTokenizer",
+  "unk_token": "<unk>"
+}

checkpoint-1500/trainer_state.json ADDED Viewed

	@@ -0,0 +1,87 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 44.11764705882353,
+  "eval_steps": 300,
+  "global_step": 1500,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 8.82,
+      "eval_bleu": 0.2892,
+      "eval_gen_len": 127.2388,
+      "eval_loss": 5.496266841888428,
+      "eval_runtime": 169.1996,
+      "eval_samples_per_second": 0.396,
+      "eval_steps_per_second": 0.03,
+      "step": 300
+    },
+    {
+      "epoch": 14.71,
+      "learning_rate": 4.328571428571429e-05,
+      "loss": 8.4505,
+      "step": 500
+    },
+    {
+      "epoch": 17.65,
+      "eval_bleu": 18.0955,
+      "eval_gen_len": 12.7761,
+      "eval_loss": 5.678420066833496,
+      "eval_runtime": 4.5299,
+      "eval_samples_per_second": 14.791,
+      "eval_steps_per_second": 1.104,
+      "step": 600
+    },
+    {
+      "epoch": 26.47,
+      "eval_bleu": 19.7871,
+      "eval_gen_len": 13.6119,
+      "eval_loss": 5.940618991851807,
+      "eval_runtime": 4.4489,
+      "eval_samples_per_second": 15.06,
+      "eval_steps_per_second": 1.124,
+      "step": 900
+    },
+    {
+      "epoch": 29.41,
+      "learning_rate": 2.542857142857143e-05,
+      "loss": 0.4947,
+      "step": 1000
+    },
+    {
+      "epoch": 35.29,
+      "eval_bleu": 16.6303,
+      "eval_gen_len": 13.209,
+      "eval_loss": 6.220270156860352,
+      "eval_runtime": 4.5215,
+      "eval_samples_per_second": 14.818,
+      "eval_steps_per_second": 1.106,
+      "step": 1200
+    },
+    {
+      "epoch": 44.12,
+      "learning_rate": 7.571428571428572e-06,
+      "loss": 0.0447,
+      "step": 1500
+    },
+    {
+      "epoch": 44.12,
+      "eval_bleu": 19.9934,
+      "eval_gen_len": 14.0448,
+      "eval_loss": 6.294175148010254,
+      "eval_runtime": 4.5277,
+      "eval_samples_per_second": 14.798,
+      "eval_steps_per_second": 1.104,
+      "step": 1500
+    }
+  ],
+  "logging_steps": 500,
+  "max_steps": 1700,
+  "num_train_epochs": 50,
+  "save_steps": 300,
+  "total_flos": 5.2011114430464e+16,
+  "trial_name": null,
+  "trial_params": null
+}

checkpoint-1500/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:134a8cde5bcb8280133a0a8b791791365a3c790f073bd96f0014c7ec134cfe2a
+size 4155

config.json ADDED Viewed

	@@ -0,0 +1,60 @@

+{
+  "_name_or_path": "./zh_reduced_model",
+  "_num_labels": 3,
+  "activation_dropout": 0.0,
+  "activation_function": "gelu",
+  "add_bias_logits": false,
+  "add_final_layer_norm": true,
+  "architectures": [
+    "MBartForConditionalGeneration"
+  ],
+  "attention_dropout": 0.0,
+  "bos_token_id": 0,
+  "classif_dropout": 0.0,
+  "classifier_dropout": 0.0,
+  "d_model": 1024,
+  "decoder_attention_heads": 16,
+  "decoder_ffn_dim": 4096,
+  "decoder_layerdrop": 0.0,
+  "decoder_layers": 12,
+  "decoder_start_token_id": 250025,
+  "dropout": 0.1,
+  "encoder_attention_heads": 16,
+  "encoder_ffn_dim": 4096,
+  "encoder_layerdrop": 0.0,
+  "encoder_layers": 12,
+  "eos_token_id": 2,
+  "forced_eos_token_id": 2,
+  "id2label": {
+    "0": "LABEL_0",
+    "1": "LABEL_1",
+    "2": "LABEL_2"
+  },
+  "init_std": 0.02,
+  "is_encoder_decoder": true,
+  "label2id": {
+    "LABEL_0": 0,
+    "LABEL_1": 1,
+    "LABEL_2": 2
+  },
+  "max_length": 1024,
+  "max_position_embeddings": 1024,
+  "model_type": "mbart",
+  "normalize_before": true,
+  "normalize_embedding": true,
+  "num_beams": 5,
+  "num_hidden_layers": 12,
+  "output_past": true,
+  "pad_token_id": 1,
+  "scale_embedding": true,
+  "static_position_embeddings": false,
+  "task_specific_params": {
+    "translation_en_to_ro": {
+      "decoder_start_token_id": 250020
+    }
+  },
+  "torch_dtype": "float32",
+  "transformers_version": "4.33.1",
+  "use_cache": true,
+  "vocab_size": 250027
+}

eval_results.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+    "epoch": 50.0,
+    "eval_bleu": 19.1703,
+    "eval_gen_len": 14.3881,
+    "eval_loss": 6.311681270599365,
+    "eval_runtime": 4.4343,
+    "eval_samples": 67,
+    "eval_samples_per_second": 15.11,
+    "eval_steps_per_second": 1.128
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+  "bos_token_id": 0,
+  "decoder_start_token_id": 250025,
+  "eos_token_id": 2,
+  "forced_eos_token_id": 2,
+  "max_length": 1024,
+  "num_beams": 5,
+  "pad_token_id": 1,
+  "transformers_version": "4.33.1"
+}

pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d6d65811adcbaa6a993258b2900d208e5ef064d4498362d6ef1a495e1b36fdff
+size 2444583325

sentencepiece.bpe.model ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:cfc8146abe2a0488e9e2a0c56de7952f7c11ab059eca145a0a727afce0db2865
+size 5069051

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,42 @@

+{
+  "additional_special_tokens": [
+    "ar_AR",
+    "cs_CZ",
+    "de_DE",
+    "en_XX",
+    "es_XX",
+    "et_EE",
+    "fi_FI",
+    "fr_XX",
+    "gu_IN",
+    "hi_IN",
+    "it_IT",
+    "ja_XX",
+    "kk_KZ",
+    "ko_KR",
+    "lt_LT",
+    "lv_LV",
+    "my_MM",
+    "ne_NP",
+    "nl_XX",
+    "ro_RO",
+    "ru_RU",
+    "si_LK",
+    "tr_TR",
+    "vi_VN",
+    "zh_CN"
+  ],
+  "bos_token": "<s>",
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "mask_token": {
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "unk_token": "<unk>"
+}

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c645d47f1b17b579114ff283e7a1023a596dbd37a6c8b189c3c9870afdbb00c0
+size 17103594

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,23 @@

+{
+  "additional_special_tokens": null,
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": true,
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "mask_token": {
+    "__type": "AddedToken",
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "model_max_length": 1024,
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "sp_model_kwargs": {},
+  "src_lang": null,
+  "tgt_lang": null,
+  "tokenizer_class": "MBartTokenizer",
+  "unk_token": "<unk>"
+}

train_results.json ADDED Viewed

	@@ -0,0 +1,8 @@

+{
+    "epoch": 50.0,
+    "train_loss": 2.645088053380742,
+    "train_runtime": 1356.8639,
+    "train_samples": 539,
+    "train_samples_per_second": 19.862,
+    "train_steps_per_second": 1.253
+}

trainer_state.json ADDED Viewed

	@@ -0,0 +1,96 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 50.0,
+  "eval_steps": 300,
+  "global_step": 1700,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 8.82,
+      "eval_bleu": 0.2892,
+      "eval_gen_len": 127.2388,
+      "eval_loss": 5.496266841888428,
+      "eval_runtime": 169.1996,
+      "eval_samples_per_second": 0.396,
+      "eval_steps_per_second": 0.03,
+      "step": 300
+    },
+    {
+      "epoch": 14.71,
+      "learning_rate": 4.328571428571429e-05,
+      "loss": 8.4505,
+      "step": 500
+    },
+    {
+      "epoch": 17.65,
+      "eval_bleu": 18.0955,
+      "eval_gen_len": 12.7761,
+      "eval_loss": 5.678420066833496,
+      "eval_runtime": 4.5299,
+      "eval_samples_per_second": 14.791,
+      "eval_steps_per_second": 1.104,
+      "step": 600
+    },
+    {
+      "epoch": 26.47,
+      "eval_bleu": 19.7871,
+      "eval_gen_len": 13.6119,
+      "eval_loss": 5.940618991851807,
+      "eval_runtime": 4.4489,
+      "eval_samples_per_second": 15.06,
+      "eval_steps_per_second": 1.124,
+      "step": 900
+    },
+    {
+      "epoch": 29.41,
+      "learning_rate": 2.542857142857143e-05,
+      "loss": 0.4947,
+      "step": 1000
+    },
+    {
+      "epoch": 35.29,
+      "eval_bleu": 16.6303,
+      "eval_gen_len": 13.209,
+      "eval_loss": 6.220270156860352,
+      "eval_runtime": 4.5215,
+      "eval_samples_per_second": 14.818,
+      "eval_steps_per_second": 1.106,
+      "step": 1200
+    },
+    {
+      "epoch": 44.12,
+      "learning_rate": 7.571428571428572e-06,
+      "loss": 0.0447,
+      "step": 1500
+    },
+    {
+      "epoch": 44.12,
+      "eval_bleu": 19.9934,
+      "eval_gen_len": 14.0448,
+      "eval_loss": 6.294175148010254,
+      "eval_runtime": 4.5277,
+      "eval_samples_per_second": 14.798,
+      "eval_steps_per_second": 1.104,
+      "step": 1500
+    },
+    {
+      "epoch": 50.0,
+      "step": 1700,
+      "total_flos": 5.89459296878592e+16,
+      "train_loss": 2.645088053380742,
+      "train_runtime": 1356.8639,
+      "train_samples_per_second": 19.862,
+      "train_steps_per_second": 1.253
+    }
+  ],
+  "logging_steps": 500,
+  "max_steps": 1700,
+  "num_train_epochs": 50,
+  "save_steps": 300,
+  "total_flos": 5.89459296878592e+16,
+  "trial_name": null,
+  "trial_params": null
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:134a8cde5bcb8280133a0a8b791791365a3c790f073bd96f0014c7ec134cfe2a
+size 4155