Upload 3 files

Browse files

Files changed (3) hide show

config.json +30 -0
model.safetensors +3 -0
model_architecture.txt +68 -0

config.json ADDED Viewed

	@@ -0,0 +1,30 @@

+{
+  "architectures": [
+    "VideoMAEForPreTraining"
+  ],
+  "attention_probs_dropout_prob": 0.0,
+  "attn_implementation": "flash_attention_2",
+  "decoder_hidden_size": 384,
+  "decoder_intermediate_size": 1536,
+  "decoder_num_attention_heads": 6,
+  "decoder_num_hidden_layers": 4,
+  "hidden_act": "gelu",
+  "hidden_dropout_prob": 0.0,
+  "hidden_size": 768,
+  "image_size": 384,
+  "initializer_range": 0.02,
+  "intermediate_size": 3072,
+  "layer_norm_eps": 1e-12,
+  "model_type": "videomae",
+  "norm_pix_loss": true,
+  "num_attention_heads": 12,
+  "num_channels": 1,
+  "num_frames": 320,
+  "num_hidden_layers": 12,
+  "patch_size": 16,
+  "qkv_bias": true,
+  "torch_dtype": "float32",
+  "transformers_version": "4.46.1",
+  "tubelet_size": 16,
+  "use_mean_pooling": true
+}

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:84744ee6437115d109c7d239f907f7503c17cc1a532c3e3b5c7bf08b72c69493
+size 388674152

model_architecture.txt ADDED Viewed

	@@ -0,0 +1,68 @@

+VideoMAEForPreTraining(
+  (videomae): VideoMAEModel(
+    (embeddings): VideoMAEEmbeddings(
+      (patch_embeddings): VideoMAEPatchEmbeddings(
+        (projection): Conv3d(1, 768, kernel_size=(16, 16, 16), stride=(16, 16, 16))
+      )
+    )
+    (encoder): VideoMAEEncoder(
+      (layer): ModuleList(
+        (0-11): 12 x VideoMAELayer(
+          (attention): VideoMAESdpaAttention(
+            (attention): VideoMAESdpaSelfAttention(
+              (query): Linear(in_features=768, out_features=768, bias=False)
+              (key): Linear(in_features=768, out_features=768, bias=False)
+              (value): Linear(in_features=768, out_features=768, bias=False)
+              (dropout): Dropout(p=0.0, inplace=False)
+            )
+            (output): VideoMAESelfOutput(
+              (dense): Linear(in_features=768, out_features=768, bias=True)
+              (dropout): Dropout(p=0.0, inplace=False)
+            )
+          )
+          (intermediate): VideoMAEIntermediate(
+            (dense): Linear(in_features=768, out_features=3072, bias=True)
+            (intermediate_act_fn): GELUActivation()
+          )
+          (output): VideoMAEOutput(
+            (dense): Linear(in_features=3072, out_features=768, bias=True)
+            (dropout): Dropout(p=0.0, inplace=False)
+          )
+          (layernorm_before): LayerNorm((768,), eps=1e-12, elementwise_affine=True)
+          (layernorm_after): LayerNorm((768,), eps=1e-12, elementwise_affine=True)
+        )
+      )
+    )
+  )
+  (encoder_to_decoder): Linear(in_features=768, out_features=384, bias=False)
+  (decoder): VideoMAEDecoder(
+    (decoder_layers): ModuleList(
+      (0-3): 4 x VideoMAELayer(
+        (attention): VideoMAESdpaAttention(
+          (attention): VideoMAESdpaSelfAttention(
+            (query): Linear(in_features=384, out_features=384, bias=False)
+            (key): Linear(in_features=384, out_features=384, bias=False)
+            (value): Linear(in_features=384, out_features=384, bias=False)
+            (dropout): Dropout(p=0.0, inplace=False)
+          )
+          (output): VideoMAESelfOutput(
+            (dense): Linear(in_features=384, out_features=384, bias=True)
+            (dropout): Dropout(p=0.0, inplace=False)
+          )
+        )
+        (intermediate): VideoMAEIntermediate(
+          (dense): Linear(in_features=384, out_features=1536, bias=True)
+          (intermediate_act_fn): GELUActivation()
+        )
+        (output): VideoMAEOutput(
+          (dense): Linear(in_features=1536, out_features=384, bias=True)
+          (dropout): Dropout(p=0.0, inplace=False)
+        )
+        (layernorm_before): LayerNorm((384,), eps=1e-12, elementwise_affine=True)
+        (layernorm_after): LayerNorm((384,), eps=1e-12, elementwise_affine=True)
+      )
+    )
+    (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
+    (head): Linear(in_features=384, out_features=4096, bias=True)
+  )
+)