saqidr commited on Sep 4, 2024

Commit

d1f1c47

verified ·

1 Parent(s): 9bb79c5

Training in progress, step 500

Browse files

Files changed (32) hide show

model.safetensors +1 -1
run-2/checkpoint-1500/model.safetensors +1 -1
run-2/checkpoint-1500/optimizer.pt +1 -1
run-2/checkpoint-1500/scheduler.pt +1 -1
run-2/checkpoint-1500/training_args.bin +1 -1
run-2/checkpoint-2000/model.safetensors +1 -1
run-2/checkpoint-2000/optimizer.pt +1 -1
run-2/checkpoint-2000/scheduler.pt +1 -1
run-2/checkpoint-2000/training_args.bin +1 -1
run-2/checkpoint-2500/model.safetensors +1 -1
run-2/checkpoint-2500/optimizer.pt +1 -1
run-2/checkpoint-2500/rng_state.pth +1 -1
run-2/checkpoint-2500/scheduler.pt +1 -1
run-2/checkpoint-2500/training_args.bin +2 -2
run-3/checkpoint-1000/model.safetensors +1 -1
run-3/checkpoint-1000/optimizer.pt +1 -1
run-3/checkpoint-1000/scheduler.pt +1 -1
run-3/checkpoint-1000/trainer_state.json +26 -26
run-3/checkpoint-1000/training_args.bin +1 -1
run-3/checkpoint-1500/trainer_state.json +34 -34
run-3/checkpoint-2000/config.json +1 -1
run-3/checkpoint-2000/tokenizer.json +1 -6
run-3/checkpoint-2000/trainer_state.json +64 -48
run-3/checkpoint-2500/config.json +1 -1
run-3/checkpoint-2500/tokenizer.json +1 -6
run-3/checkpoint-2500/trainer_state.json +73 -56
run-3/checkpoint-500/model.safetensors +1 -1
run-3/checkpoint-500/optimizer.pt +1 -1
run-3/checkpoint-500/scheduler.pt +1 -1
run-3/checkpoint-500/trainer_state.json +13 -13
run-3/checkpoint-500/training_args.bin +1 -1
training_args.bin +1 -1

model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:ab42167ffff4c1e729d547711e458440cd560d09dd08d069574cd46a86c79e0d
 size 268290900

 version https://git-lfs.github.com/spec/v1
+oid sha256:25f9d6eb5310fb82fd6d0ce02178e219ef280bfac553ca1e5a08cd0dd16f2028
 size 268290900

run-2/checkpoint-1500/model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:fbbec414f173d23818e4f1a4d385e4e82b9e46794cb619ec4280120c1996c010
 size 268290900

 version https://git-lfs.github.com/spec/v1
+oid sha256:cda8d10fe1dbb92958cd584c54810ea7b4ca0cbcd757c868dddab676669a0270
 size 268290900

run-2/checkpoint-1500/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:eef8ed9d1c4352515c32c273b7b9868df404b50c997e196c96712a96d78c4d7c
 size 536643898

 version https://git-lfs.github.com/spec/v1
+oid sha256:2c932450d510dd3ab268e57603eab4d94e98de0c9535fc4238caafa908691f20
 size 536643898

run-2/checkpoint-1500/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:ad4d7d251acf36e559c362893a1fb310c9f46b20e8a330025a14b6829ce4ab07
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:eb7b4645e59a5c5cb66f63e8bcb5f006c535fd0ea63db9ae152dd586fd465b28
 size 1064

run-2/checkpoint-1500/training_args.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:02895758c800be06b344602e8d1e4451336b524bdce9f82588ca589e12cfef2e
 size 5176

 version https://git-lfs.github.com/spec/v1
+oid sha256:baea954a8311f77b8b2d4c67cfd083cf6d7e3bc8a41fb699bd5b137d572b44d3
 size 5176

run-2/checkpoint-2000/model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:2976c14e25a7a0665a6a80691800ba40b64d3af6e97cd20346e4514e1d87fb3b
 size 268290900

 version https://git-lfs.github.com/spec/v1
+oid sha256:94d5d1048ef2f321733b12e51f297d497c8b46b210d10f2cee5c81dbf1b4b9a9
 size 268290900

run-2/checkpoint-2000/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:19cf8d23e59d1a0daf3401e46b60bdc348544f776be10f26cdd37ae080bdd87d
 size 536643898

 version https://git-lfs.github.com/spec/v1
+oid sha256:90ae0852d9b5eefebaf5766e1e271e13b5498a0b08d0676e99a72850aeaef01f
 size 536643898

run-2/checkpoint-2000/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:f38866eaf1d2baeb52a55cb38ece6ee67f3213265b0830dd06c82a9148795bea
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:2bf6d4c2c13eda2c2dfacdbfc8684055c5603a92b6c0c386d7c757b108195d12
 size 1064

run-2/checkpoint-2000/training_args.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:02895758c800be06b344602e8d1e4451336b524bdce9f82588ca589e12cfef2e
 size 5176

 version https://git-lfs.github.com/spec/v1
+oid sha256:baea954a8311f77b8b2d4c67cfd083cf6d7e3bc8a41fb699bd5b137d572b44d3
 size 5176

run-2/checkpoint-2500/model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:35182c738d53a59a34932d9c059e629f622646c963c6f0c2ad315e97711fa2d7
 size 268290900

 version https://git-lfs.github.com/spec/v1
+oid sha256:5003f3c41fb67a0c518309f8ac556d952bbf9476e879d6516aecca0c25cd6cbf
 size 268290900

run-2/checkpoint-2500/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:07f95b5f5b1df52bfda8be3d8cca7cabf1b38044eb5e2b5b4b5f4d48eff6c437
 size 536643898

 version https://git-lfs.github.com/spec/v1
+oid sha256:838fd059fc0b12714fd51110f4b9d5be6a75b98b9c6da6e8e3c4c3442a3834aa
 size 536643898

run-2/checkpoint-2500/rng_state.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:983ad82afbb61099978c5b5a095761d0cc8a5b9889d078c9a1fcb9751b84b6be
 size 14244

 version https://git-lfs.github.com/spec/v1
+oid sha256:2fe590653dc8c7914203f68b195f5118633e21a9fa30a5fcd6f1518bae980ac9
 size 14244

run-2/checkpoint-2500/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:b7c943a77651a184c6653dd4706c14c9a27d52136e81942a2b361c74acb9f665
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:2b997ea9328158f28ff50e49c476931e703b821360bc8325e0c4d100e032c865
 size 1064

run-2/checkpoint-2500/training_args.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:34a2db7a3504e0c57eb385477ee1398acbe37a72c4a5eee4ba4703a02720d57f
-size 4728

 version https://git-lfs.github.com/spec/v1
+oid sha256:baea954a8311f77b8b2d4c67cfd083cf6d7e3bc8a41fb699bd5b137d572b44d3
+size 5176

run-3/checkpoint-1000/model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:49a37519a7193241e4c7880a2bb352a0a188591edb57992228c960f57306b331
 size 268290900

 version https://git-lfs.github.com/spec/v1
+oid sha256:3c6618d8bf4f85416c87ab2fddb2a143230d9298742e6c942f75b60979d22322
 size 268290900

run-3/checkpoint-1000/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:b6d0a1d579fe73c539aba11316145fa686b4c462dd2052b4e2433f29b811a7f1
 size 536643898

 version https://git-lfs.github.com/spec/v1
+oid sha256:5be13283d31227bbd5f3cdc798cc4f4fe888d3cfbe127e00277f36968b72760a
 size 536643898

run-3/checkpoint-1000/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:9f182501c34e4ea3ebc7617d27edab7e1367582b147e518cd90295ec7f2eaa0f
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:045cf4abe065257226fe11ac1a91dfd4c5b953cb2366365ef8bb18b4cf33e734
 size 1064

run-3/checkpoint-1000/trainer_state.json CHANGED Viewed

@@ -10,50 +10,50 @@
   "log_history": [
     {
       "epoch": 1.0,
-      "eval_accuracy": 0.5893548387096774,
-      "eval_loss": 0.2303294986486435,
-      "eval_runtime": 1.354,
-      "eval_samples_per_second": 2289.482,
-      "eval_steps_per_second": 48.005,
       "step": 318
     },
     {
       "epoch": 1.5723270440251573,
-      "grad_norm": 0.5280700325965881,
-      "learning_rate": 1.371069182389937e-05,
-      "loss": 0.3599,
       "step": 500
     },
     {
       "epoch": 2.0,
-      "eval_accuracy": 0.8180645161290323,
-      "eval_loss": 0.11683158576488495,
-      "eval_runtime": 1.346,
-      "eval_samples_per_second": 2303.101,
-      "eval_steps_per_second": 48.291,
       "step": 636
     },
     {
       "epoch": 3.0,
-      "eval_accuracy": 0.8654838709677419,
-      "eval_loss": 0.08170921355485916,
-      "eval_runtime": 1.3601,
-      "eval_samples_per_second": 2279.288,
-      "eval_steps_per_second": 47.792,
       "step": 954
     },
     {
       "epoch": 3.1446540880503147,
-      "grad_norm": 0.49507445096969604,
-      "learning_rate": 7.421383647798742e-06,
-      "loss": 0.1347,
       "step": 1000
     }
   ],
   "logging_steps": 500,
-  "max_steps": 1590,
   "num_input_tokens_seen": 0,
-  "num_train_epochs": 5,
   "save_steps": 500,
   "stateful_callbacks": {
     "TrainerControl": {
@@ -71,8 +71,8 @@
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
-    "alpha": 0.947951511264653,
-    "num_train_epochs": 5,
-    "temperature": 6
   }
 }

   "log_history": [
     {
       "epoch": 1.0,
+      "eval_accuracy": 0.6190322580645161,
+      "eval_loss": 0.25124841928482056,
+      "eval_runtime": 1.3533,
+      "eval_samples_per_second": 2290.756,
+      "eval_steps_per_second": 48.032,
       "step": 318
     },
     {
       "epoch": 1.5723270440251573,
+      "grad_norm": 0.6181610226631165,
+      "learning_rate": 1.606918238993711e-05,
+      "loss": 0.4004,
       "step": 500
     },
     {
       "epoch": 2.0,
+      "eval_accuracy": 0.8406451612903226,
+      "eval_loss": 0.1125619187951088,
+      "eval_runtime": 1.3516,
+      "eval_samples_per_second": 2293.644,
+      "eval_steps_per_second": 48.093,
       "step": 636
     },
     {
       "epoch": 3.0,
+      "eval_accuracy": 0.885483870967742,
+      "eval_loss": 0.06991825252771378,
+      "eval_runtime": 1.3619,
+      "eval_samples_per_second": 2276.288,
+      "eval_steps_per_second": 47.729,
       "step": 954
     },
     {
       "epoch": 3.1446540880503147,
+      "grad_norm": 0.5585916042327881,
+      "learning_rate": 1.2138364779874214e-05,
+      "loss": 0.1312,
       "step": 1000
     }
   ],
   "logging_steps": 500,
+  "max_steps": 2544,
   "num_input_tokens_seen": 0,
+  "num_train_epochs": 8,
   "save_steps": 500,
   "stateful_callbacks": {
     "TrainerControl": {
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
+    "alpha": 0.17566767797741356,
+    "num_train_epochs": 8,
+    "temperature": 4
   }
 }

run-3/checkpoint-1000/training_args.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:9e2a1cb9dd55c40858a3ac6c021e84bbe7db57465df0ba06d3a7ad08deec13ce
 size 5176

 version https://git-lfs.github.com/spec/v1
+oid sha256:699ed76d9af91edc99d12562d64ce4055f71cfe483dfd9ab44c7bfc8626ae66f
 size 5176

run-3/checkpoint-1500/trainer_state.json CHANGED Viewed

@@ -10,66 +10,66 @@
   "log_history": [
     {
       "epoch": 1.0,
-      "eval_accuracy": 0.5893548387096774,
-      "eval_loss": 0.2303294986486435,
-      "eval_runtime": 1.354,
-      "eval_samples_per_second": 2289.482,
-      "eval_steps_per_second": 48.005,
       "step": 318
     },
     {
       "epoch": 1.5723270440251573,
-      "grad_norm": 0.5280700325965881,
-      "learning_rate": 1.371069182389937e-05,
-      "loss": 0.3599,
       "step": 500
     },
     {
       "epoch": 2.0,
-      "eval_accuracy": 0.8180645161290323,
-      "eval_loss": 0.11683158576488495,
-      "eval_runtime": 1.346,
-      "eval_samples_per_second": 2303.101,
-      "eval_steps_per_second": 48.291,
       "step": 636
     },
     {
       "epoch": 3.0,
-      "eval_accuracy": 0.8654838709677419,
-      "eval_loss": 0.08170921355485916,
-      "eval_runtime": 1.3601,
-      "eval_samples_per_second": 2279.288,
-      "eval_steps_per_second": 47.792,
       "step": 954
     },
     {
       "epoch": 3.1446540880503147,
-      "grad_norm": 0.49507445096969604,
-      "learning_rate": 7.421383647798742e-06,
-      "loss": 0.1347,
       "step": 1000
     },
     {
       "epoch": 4.0,
-      "eval_accuracy": 0.88,
-      "eval_loss": 0.06745168566703796,
-      "eval_runtime": 1.359,
-      "eval_samples_per_second": 2281.017,
-      "eval_steps_per_second": 47.828,
       "step": 1272
     },
     {
       "epoch": 4.716981132075472,
-      "grad_norm": 0.40409624576568604,
-      "learning_rate": 1.1320754716981133e-06,
-      "loss": 0.0945,
       "step": 1500
     }
   ],
   "logging_steps": 500,
-  "max_steps": 1590,
   "num_input_tokens_seen": 0,
-  "num_train_epochs": 5,
   "save_steps": 500,
   "stateful_callbacks": {
     "TrainerControl": {
@@ -87,8 +87,8 @@
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
-    "alpha": 0.947951511264653,
-    "num_train_epochs": 5,
-    "temperature": 6
   }
 }

   "log_history": [
     {
       "epoch": 1.0,
+      "eval_accuracy": 0.6190322580645161,
+      "eval_loss": 0.25124841928482056,
+      "eval_runtime": 1.3533,
+      "eval_samples_per_second": 2290.756,
+      "eval_steps_per_second": 48.032,
       "step": 318
     },
     {
       "epoch": 1.5723270440251573,
+      "grad_norm": 0.6181610226631165,
+      "learning_rate": 1.606918238993711e-05,
+      "loss": 0.4004,
       "step": 500
     },
     {
       "epoch": 2.0,
+      "eval_accuracy": 0.8406451612903226,
+      "eval_loss": 0.1125619187951088,
+      "eval_runtime": 1.3516,
+      "eval_samples_per_second": 2293.644,
+      "eval_steps_per_second": 48.093,
       "step": 636
     },
     {
       "epoch": 3.0,
+      "eval_accuracy": 0.885483870967742,
+      "eval_loss": 0.06991825252771378,
+      "eval_runtime": 1.3619,
+      "eval_samples_per_second": 2276.288,
+      "eval_steps_per_second": 47.729,
       "step": 954
     },
     {
       "epoch": 3.1446540880503147,
+      "grad_norm": 0.5585916042327881,
+      "learning_rate": 1.2138364779874214e-05,
+      "loss": 0.1312,
       "step": 1000
     },
     {
       "epoch": 4.0,
+      "eval_accuracy": 0.9006451612903226,
+      "eval_loss": 0.05187460780143738,
+      "eval_runtime": 1.3534,
+      "eval_samples_per_second": 2290.5,
+      "eval_steps_per_second": 48.027,
       "step": 1272
     },
     {
       "epoch": 4.716981132075472,
+      "grad_norm": 0.37042877078056335,
+      "learning_rate": 8.207547169811321e-06,
+      "loss": 0.0787,
       "step": 1500
     }
   ],
   "logging_steps": 500,
+  "max_steps": 2544,
   "num_input_tokens_seen": 0,
+  "num_train_epochs": 8,
   "save_steps": 500,
   "stateful_callbacks": {
     "TrainerControl": {
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
+    "alpha": 0.17566767797741356,
+    "num_train_epochs": 8,
+    "temperature": 4
   }
 }

run-3/checkpoint-2000/config.json CHANGED Viewed

@@ -326,6 +326,6 @@
   "sinusoidal_pos_embds": false,
   "tie_weights_": true,
   "torch_dtype": "float32",
-  "transformers_version": "4.37.2",
   "vocab_size": 30522
 }

   "sinusoidal_pos_embds": false,
   "tie_weights_": true,
   "torch_dtype": "float32",
+  "transformers_version": "4.41.1",
   "vocab_size": 30522
 }

run-3/checkpoint-2000/tokenizer.json CHANGED Viewed

@@ -1,11 +1,6 @@
 {
   "version": "1.0",
-  "truncation": {
-    "direction": "Right",
-    "max_length": 512,
-    "strategy": "LongestFirst",
-    "stride": 0
-  },
   "padding": null,
   "added_tokens": [
     {

 {
   "version": "1.0",
+  "truncation": null,
   "padding": null,
   "added_tokens": [
     {

run-3/checkpoint-2000/trainer_state.json CHANGED Viewed

@@ -10,94 +10,110 @@
   "log_history": [
     {
       "epoch": 1.0,
-      "eval_accuracy": 0.5974193548387097,
-      "eval_loss": 0.20201846957206726,
-      "eval_runtime": 1.3839,
-      "eval_samples_per_second": 2240.12,
-      "eval_steps_per_second": 46.97,
       "step": 318
     },
     {
-      "epoch": 1.57,
-      "learning_rate": 1.550763701707098e-05,
-      "loss": 0.321,
       "step": 500
     },
     {
       "epoch": 2.0,
-      "eval_accuracy": 0.8154838709677419,
-      "eval_loss": 0.10081231594085693,
-      "eval_runtime": 1.376,
-      "eval_samples_per_second": 2252.914,
-      "eval_steps_per_second": 47.239,
       "step": 636
     },
     {
       "epoch": 3.0,
-      "eval_accuracy": 0.8729032258064516,
-      "eval_loss": 0.06774353235960007,
-      "eval_runtime": 1.4034,
-      "eval_samples_per_second": 2208.994,
-      "eval_steps_per_second": 46.318,
       "step": 954
     },
     {
-      "epoch": 3.14,
-      "learning_rate": 1.101527403414196e-05,
-      "loss": 0.115,
       "step": 1000
     },
     {
       "epoch": 4.0,
-      "eval_accuracy": 0.8932258064516129,
-      "eval_loss": 0.053254324942827225,
-      "eval_runtime": 1.3981,
-      "eval_samples_per_second": 2217.32,
-      "eval_steps_per_second": 46.492,
       "step": 1272
     },
     {
-      "epoch": 4.72,
-      "learning_rate": 6.522911051212939e-06,
-      "loss": 0.0763,
       "step": 1500
     },
     {
       "epoch": 5.0,
-      "eval_accuracy": 0.9019354838709678,
-      "eval_loss": 0.04572787880897522,
-      "eval_runtime": 1.3764,
-      "eval_samples_per_second": 2252.312,
-      "eval_steps_per_second": 47.226,
       "step": 1590
     },
     {
       "epoch": 6.0,
-      "eval_accuracy": 0.9051612903225806,
-      "eval_loss": 0.041987188160419464,
-      "eval_runtime": 1.3865,
-      "eval_samples_per_second": 2235.912,
-      "eval_steps_per_second": 46.882,
       "step": 1908
     },
     {
-      "epoch": 6.29,
-      "learning_rate": 2.0305480682839176e-06,
-      "loss": 0.0628,
       "step": 2000
     }
   ],
   "logging_steps": 500,
-  "max_steps": 2226,
   "num_input_tokens_seen": 0,
-  "num_train_epochs": 7,
   "save_steps": 500,
-  "total_flos": 519271419317532.0,
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
-    "alpha": 0.27106164774863717,
-    "num_train_epochs": 7,
-    "temperature": 12
   }
 }

   "log_history": [
     {
       "epoch": 1.0,
+      "eval_accuracy": 0.6190322580645161,
+      "eval_loss": 0.25124841928482056,
+      "eval_runtime": 1.3533,
+      "eval_samples_per_second": 2290.756,
+      "eval_steps_per_second": 48.032,
       "step": 318
     },
     {
+      "epoch": 1.5723270440251573,
+      "grad_norm": 0.6181610226631165,
+      "learning_rate": 1.606918238993711e-05,
+      "loss": 0.4004,
       "step": 500
     },
     {
       "epoch": 2.0,
+      "eval_accuracy": 0.8406451612903226,
+      "eval_loss": 0.1125619187951088,
+      "eval_runtime": 1.3516,
+      "eval_samples_per_second": 2293.644,
+      "eval_steps_per_second": 48.093,
       "step": 636
     },
     {
       "epoch": 3.0,
+      "eval_accuracy": 0.885483870967742,
+      "eval_loss": 0.06991825252771378,
+      "eval_runtime": 1.3619,
+      "eval_samples_per_second": 2276.288,
+      "eval_steps_per_second": 47.729,
       "step": 954
     },
     {
+      "epoch": 3.1446540880503147,
+      "grad_norm": 0.5585916042327881,
+      "learning_rate": 1.2138364779874214e-05,
+      "loss": 0.1312,
       "step": 1000
     },
     {
       "epoch": 4.0,
+      "eval_accuracy": 0.9006451612903226,
+      "eval_loss": 0.05187460780143738,
+      "eval_runtime": 1.3534,
+      "eval_samples_per_second": 2290.5,
+      "eval_steps_per_second": 48.027,
       "step": 1272
     },
     {
+      "epoch": 4.716981132075472,
+      "grad_norm": 0.37042877078056335,
+      "learning_rate": 8.207547169811321e-06,
+      "loss": 0.0787,
       "step": 1500
     },
     {
       "epoch": 5.0,
+      "eval_accuracy": 0.9141935483870968,
+      "eval_loss": 0.04222690686583519,
+      "eval_runtime": 1.3549,
+      "eval_samples_per_second": 2287.962,
+      "eval_steps_per_second": 47.973,
       "step": 1590
     },
     {
       "epoch": 6.0,
+      "eval_accuracy": 0.9203225806451613,
+      "eval_loss": 0.03726611286401749,
+      "eval_runtime": 1.3638,
+      "eval_samples_per_second": 2273.052,
+      "eval_steps_per_second": 47.661,
       "step": 1908
     },
     {
+      "epoch": 6.289308176100629,
+      "grad_norm": 0.2954886257648468,
+      "learning_rate": 4.276729559748428e-06,
+      "loss": 0.0616,
       "step": 2000
     }
   ],
   "logging_steps": 500,
+  "max_steps": 2544,
   "num_input_tokens_seen": 0,
+  "num_train_epochs": 8,
   "save_steps": 500,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": false
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 520991326672152.0,
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
+    "alpha": 0.17566767797741356,
+    "num_train_epochs": 8,
+    "temperature": 4
   }
 }

run-3/checkpoint-2500/config.json CHANGED Viewed

@@ -326,6 +326,6 @@
   "sinusoidal_pos_embds": false,
   "tie_weights_": true,
   "torch_dtype": "float32",
-  "transformers_version": "4.37.2",
   "vocab_size": 30522
 }

   "sinusoidal_pos_embds": false,
   "tie_weights_": true,
   "torch_dtype": "float32",
+  "transformers_version": "4.41.1",
   "vocab_size": 30522
 }

run-3/checkpoint-2500/tokenizer.json CHANGED Viewed

@@ -1,11 +1,6 @@
 {
   "version": "1.0",
-  "truncation": {
-    "direction": "Right",
-    "max_length": 512,
-    "strategy": "LongestFirst",
-    "stride": 0
-  },
   "padding": null,
   "added_tokens": [
     {

 {
   "version": "1.0",
+  "truncation": null,
   "padding": null,
   "added_tokens": [
     {

run-3/checkpoint-2500/trainer_state.json CHANGED Viewed

@@ -10,109 +10,126 @@
   "log_history": [
     {
       "epoch": 1.0,
-      "eval_accuracy": 0.6403225806451613,
-      "eval_loss": 0.23227573931217194,
-      "eval_runtime": 1.2548,
-      "eval_samples_per_second": 2470.604,
-      "eval_steps_per_second": 51.803,
       "step": 318
     },
     {
-      "epoch": 1.57,
-      "learning_rate": 1.650593990216632e-05,
-      "loss": 0.3708,
       "step": 500
     },
     {
       "epoch": 2.0,
-      "eval_accuracy": 0.832258064516129,
-      "eval_loss": 0.10681243985891342,
-      "eval_runtime": 1.2626,
-      "eval_samples_per_second": 2455.178,
-      "eval_steps_per_second": 51.48,
       "step": 636
     },
     {
       "epoch": 3.0,
-      "eval_accuracy": 0.8841935483870967,
-      "eval_loss": 0.06609988212585449,
-      "eval_runtime": 1.3493,
-      "eval_samples_per_second": 2297.478,
-      "eval_steps_per_second": 48.173,
       "step": 954
     },
     {
-      "epoch": 3.14,
-      "learning_rate": 1.3011879804332637e-05,
-      "loss": 0.1227,
       "step": 1000
     },
     {
       "epoch": 4.0,
-      "eval_accuracy": 0.9041935483870968,
-      "eval_loss": 0.04876786842942238,
-      "eval_runtime": 1.3474,
-      "eval_samples_per_second": 2300.769,
-      "eval_steps_per_second": 48.242,
       "step": 1272
     },
     {
-      "epoch": 4.72,
-      "learning_rate": 9.517819706498952e-06,
-      "loss": 0.0748,
       "step": 1500
     },
     {
       "epoch": 5.0,
-      "eval_accuracy": 0.9145161290322581,
-      "eval_loss": 0.04008982330560684,
-      "eval_runtime": 1.2747,
-      "eval_samples_per_second": 2431.964,
-      "eval_steps_per_second": 50.993,
       "step": 1590
     },
     {
       "epoch": 6.0,
-      "eval_accuracy": 0.9232258064516129,
-      "eval_loss": 0.035276755690574646,
-      "eval_runtime": 1.3204,
-      "eval_samples_per_second": 2347.825,
-      "eval_steps_per_second": 49.229,
       "step": 1908
     },
     {
-      "epoch": 6.29,
-      "learning_rate": 6.02375960866527e-06,
-      "loss": 0.0578,
       "step": 2000
     },
     {
       "epoch": 7.0,
-      "eval_accuracy": 0.9264516129032258,
-      "eval_loss": 0.03217238560318947,
-      "eval_runtime": 1.2775,
-      "eval_samples_per_second": 2426.53,
-      "eval_steps_per_second": 50.879,
       "step": 2226
     },
     {
-      "epoch": 7.86,
-      "learning_rate": 2.5296995108315863e-06,
-      "loss": 0.0505,
       "step": 2500
     }
   ],
   "logging_steps": 500,
-  "max_steps": 2862,
   "num_input_tokens_seen": 0,
-  "num_train_epochs": 9,
   "save_steps": 500,
-  "total_flos": 649131947564688.0,
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
-    "alpha": 0.6247539052050974,
-    "num_train_epochs": 9,
-    "temperature": 5
   }
 }

   "log_history": [
     {
       "epoch": 1.0,
+      "eval_accuracy": 0.6190322580645161,
+      "eval_loss": 0.25124841928482056,
+      "eval_runtime": 1.3533,
+      "eval_samples_per_second": 2290.756,
+      "eval_steps_per_second": 48.032,
       "step": 318
     },
     {
+      "epoch": 1.5723270440251573,
+      "grad_norm": 0.6181610226631165,
+      "learning_rate": 1.606918238993711e-05,
+      "loss": 0.4004,
       "step": 500
     },
     {
       "epoch": 2.0,
+      "eval_accuracy": 0.8406451612903226,
+      "eval_loss": 0.1125619187951088,
+      "eval_runtime": 1.3516,
+      "eval_samples_per_second": 2293.644,
+      "eval_steps_per_second": 48.093,
       "step": 636
     },
     {
       "epoch": 3.0,
+      "eval_accuracy": 0.885483870967742,
+      "eval_loss": 0.06991825252771378,
+      "eval_runtime": 1.3619,
+      "eval_samples_per_second": 2276.288,
+      "eval_steps_per_second": 47.729,
       "step": 954
     },
     {
+      "epoch": 3.1446540880503147,
+      "grad_norm": 0.5585916042327881,
+      "learning_rate": 1.2138364779874214e-05,
+      "loss": 0.1312,
       "step": 1000
     },
     {
       "epoch": 4.0,
+      "eval_accuracy": 0.9006451612903226,
+      "eval_loss": 0.05187460780143738,
+      "eval_runtime": 1.3534,
+      "eval_samples_per_second": 2290.5,
+      "eval_steps_per_second": 48.027,
       "step": 1272
     },
     {
+      "epoch": 4.716981132075472,
+      "grad_norm": 0.37042877078056335,
+      "learning_rate": 8.207547169811321e-06,
+      "loss": 0.0787,
       "step": 1500
     },
     {
       "epoch": 5.0,
+      "eval_accuracy": 0.9141935483870968,
+      "eval_loss": 0.04222690686583519,
+      "eval_runtime": 1.3549,
+      "eval_samples_per_second": 2287.962,
+      "eval_steps_per_second": 47.973,
       "step": 1590
     },
     {
       "epoch": 6.0,
+      "eval_accuracy": 0.9203225806451613,
+      "eval_loss": 0.03726611286401749,
+      "eval_runtime": 1.3638,
+      "eval_samples_per_second": 2273.052,
+      "eval_steps_per_second": 47.661,
       "step": 1908
     },
     {
+      "epoch": 6.289308176100629,
+      "grad_norm": 0.2954886257648468,
+      "learning_rate": 4.276729559748428e-06,
+      "loss": 0.0616,
       "step": 2000
     },
     {
       "epoch": 7.0,
+      "eval_accuracy": 0.9219354838709677,
+      "eval_loss": 0.035025350749492645,
+      "eval_runtime": 1.3626,
+      "eval_samples_per_second": 2275.027,
+      "eval_steps_per_second": 47.702,
       "step": 2226
     },
     {
+      "epoch": 7.861635220125786,
+      "grad_norm": 0.26834845542907715,
+      "learning_rate": 3.459119496855346e-07,
+      "loss": 0.0549,
       "step": 2500
     }
   ],
   "logging_steps": 500,
+  "max_steps": 2544,
   "num_input_tokens_seen": 0,
+  "num_train_epochs": 8,
   "save_steps": 500,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": false
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 651155886807636.0,
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
+    "alpha": 0.17566767797741356,
+    "num_train_epochs": 8,
+    "temperature": 4
   }
 }

run-3/checkpoint-500/model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:afd2ce840c42e4f81187b486c6afb8eb396a25dd802b57910141a11d216310a4
 size 268290900

 version https://git-lfs.github.com/spec/v1
+oid sha256:25f9d6eb5310fb82fd6d0ce02178e219ef280bfac553ca1e5a08cd0dd16f2028
 size 268290900

run-3/checkpoint-500/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:433eb5c99790bde8ccfa94533a3e385c22d8cc1001199b3afcfbf61d951e87e1
 size 536643898

 version https://git-lfs.github.com/spec/v1
+oid sha256:61b66909a996ee50dd5b57e0c400b5d2288582050b5f926b1c289f7a221255f6
 size 536643898

run-3/checkpoint-500/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:9e1264523e958cf7990dc5f42d876cc12129475c4603804cf66868aaf25c2c24
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:90dc4637e972cc69c745eebddd8a7560dca27d2318df3e23f8e145abbf236536
 size 1064

run-3/checkpoint-500/trainer_state.json CHANGED Viewed

@@ -10,25 +10,25 @@
   "log_history": [
     {
       "epoch": 1.0,
-      "eval_accuracy": 0.5893548387096774,
-      "eval_loss": 0.2303294986486435,
-      "eval_runtime": 1.354,
-      "eval_samples_per_second": 2289.482,
-      "eval_steps_per_second": 48.005,
       "step": 318
     },
     {
       "epoch": 1.5723270440251573,
-      "grad_norm": 0.5280700325965881,
-      "learning_rate": 1.371069182389937e-05,
-      "loss": 0.3599,
       "step": 500
     }
   ],
   "logging_steps": 500,
-  "max_steps": 1590,
   "num_input_tokens_seen": 0,
-  "num_train_epochs": 5,
   "save_steps": 500,
   "stateful_callbacks": {
     "TrainerControl": {
@@ -46,8 +46,8 @@
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
-    "alpha": 0.947951511264653,
-    "num_train_epochs": 5,
-    "temperature": 6
   }
 }

   "log_history": [
     {
       "epoch": 1.0,
+      "eval_accuracy": 0.6190322580645161,
+      "eval_loss": 0.25124841928482056,
+      "eval_runtime": 1.3533,
+      "eval_samples_per_second": 2290.756,
+      "eval_steps_per_second": 48.032,
       "step": 318
     },
     {
       "epoch": 1.5723270440251573,
+      "grad_norm": 0.6181610226631165,
+      "learning_rate": 1.606918238993711e-05,
+      "loss": 0.4004,
       "step": 500
     }
   ],
   "logging_steps": 500,
+  "max_steps": 2544,
   "num_input_tokens_seen": 0,
+  "num_train_epochs": 8,
   "save_steps": 500,
   "stateful_callbacks": {
     "TrainerControl": {
   "train_batch_size": 48,
   "trial_name": null,
   "trial_params": {
+    "alpha": 0.17566767797741356,
+    "num_train_epochs": 8,
+    "temperature": 4
   }
 }

run-3/checkpoint-500/training_args.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:9e2a1cb9dd55c40858a3ac6c021e84bbe7db57465df0ba06d3a7ad08deec13ce
 size 5176

 version https://git-lfs.github.com/spec/v1
+oid sha256:699ed76d9af91edc99d12562d64ce4055f71cfe483dfd9ab44c7bfc8626ae66f
 size 5176

training_args.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:baea954a8311f77b8b2d4c67cfd083cf6d7e3bc8a41fb699bd5b137d572b44d3
 size 5176

 version https://git-lfs.github.com/spec/v1
+oid sha256:699ed76d9af91edc99d12562d64ce4055f71cfe483dfd9ab44c7bfc8626ae66f
 size 5176