Upload 8 files

Browse files

Files changed (8) hide show

configs/v1/32000.json +46 -0
configs/v1/40000.json +46 -0
configs/v1/44100.json +46 -0
configs/v1/48000.json +46 -0
configs/v2/32000.json +42 -0
configs/v2/40000.json +42 -0
configs/v2/44100.json +42 -0
configs/v2/48000.json +42 -0

configs/v1/32000.json ADDED Viewed

	@@ -0,0 +1,46 @@

+{
+    "train": {
+        "log_interval": 200,
+        "seed": 1234,
+        "epochs": 20000,
+        "learning_rate": 0.0001,
+        "betas": [0.8, 0.99],
+        "eps": 1e-09,
+        "batch_size": 4,
+        "lr_decay": 0.999875,
+        "segment_size": 12800,
+        "init_lr_ratio": 1,
+        "warmup_epochs": 0,
+        "c_mel": 45,
+        "c_kl": 1.0
+    },
+    "data": {
+        "max_wav_value": 32768.0,
+        "sample_rate": 32000,
+        "filter_length": 1024,
+        "hop_length": 320,
+        "win_length": 1024,
+        "n_mel_channels": 80,
+        "mel_fmin": 0.0,
+        "mel_fmax": null
+    },
+    "model": {
+        "inter_channels": 192,
+        "hidden_channels": 192,
+        "filter_channels": 768,
+        "text_enc_hidden_dim": 256,
+        "n_heads": 2,
+        "n_layers": 6,
+        "kernel_size": 3,
+        "p_dropout": 0,
+        "resblock": "1",
+        "resblock_kernel_sizes": [3, 7, 11],
+        "resblock_dilation_sizes": [[1, 3, 5], [1, 3, 5], [1, 3, 5]],
+        "upsample_rates": [10, 4, 2, 2, 2],
+        "upsample_initial_channel": 512,
+        "upsample_kernel_sizes": [16, 16, 4, 4, 4],
+        "use_spectral_norm": false,
+        "gin_channels": 256,
+        "spk_embed_dim": 109
+    }
+}

configs/v1/40000.json ADDED Viewed

	@@ -0,0 +1,46 @@

+{
+    "train": {
+        "log_interval": 200,
+        "seed": 1234,
+        "epochs": 20000,
+        "learning_rate": 0.0001,
+        "betas": [0.8, 0.99],
+        "eps": 1e-09,
+        "batch_size": 4,
+        "lr_decay": 0.999875,
+        "segment_size": 12800,
+        "init_lr_ratio": 1,
+        "warmup_epochs": 0,
+        "c_mel": 45,
+        "c_kl": 1.0
+    },
+    "data": {
+        "max_wav_value": 32768.0,
+        "sample_rate": 40000,
+        "filter_length": 2048,
+        "hop_length": 400,
+        "win_length": 2048,
+        "n_mel_channels": 125,
+        "mel_fmin": 0.0,
+        "mel_fmax": null
+    },
+    "model": {
+        "inter_channels": 192,
+        "hidden_channels": 192,
+        "filter_channels": 768,
+        "text_enc_hidden_dim": 256,
+        "n_heads": 2,
+        "n_layers": 6,
+        "kernel_size": 3,
+        "p_dropout": 0,
+        "resblock": "1",
+        "resblock_kernel_sizes": [3, 7, 11],
+        "resblock_dilation_sizes": [[1, 3, 5], [1, 3, 5], [1, 3, 5]],
+        "upsample_rates": [10, 10, 2, 2],
+        "upsample_initial_channel": 512,
+        "upsample_kernel_sizes": [16, 16, 4, 4],
+        "use_spectral_norm": false,
+        "gin_channels": 256,
+        "spk_embed_dim": 109
+    }
+}

configs/v1/44100.json ADDED Viewed

	@@ -0,0 +1,46 @@

+{
+    "train": {
+        "log_interval": 200,
+        "seed": 1234,
+        "epochs": 20000,
+        "learning_rate": 0.0001,
+        "betas": [0.8, 0.99],
+        "eps": 1e-09,
+        "batch_size": 4,
+        "lr_decay": 0.999875,
+        "segment_size": 15876,
+        "init_lr_ratio": 1,
+        "warmup_epochs": 0,
+        "c_mel": 45,
+        "c_kl": 1.0
+    },
+    "data": {
+        "max_wav_value": 32768.0,
+        "sample_rate": 44100,
+        "filter_length": 2048,
+        "hop_length": 441,
+        "win_length": 2048,
+        "n_mel_channels": 160,
+        "mel_fmin": 0.0,
+        "mel_fmax": null
+    },
+    "model": {
+        "inter_channels": 192,
+        "hidden_channels": 192,
+        "filter_channels": 768,
+        "text_enc_hidden_dim": 256,
+        "n_heads": 2,
+        "n_layers": 6,
+        "kernel_size": 3,
+        "p_dropout": 0,
+        "resblock": "1",
+        "resblock_kernel_sizes": [3, 7, 11],
+        "resblock_dilation_sizes": [[1, 3, 5], [ 1, 3, 5], [1, 3, 5]],
+        "upsample_rates": [7, 7, 3, 3],
+        "upsample_initial_channel": 512,
+        "upsample_kernel_sizes": [14, 14, 6, 6],
+        "use_spectral_norm": false,
+        "gin_channels": 256,
+        "spk_embed_dim": 109
+    }
+}

configs/v1/48000.json ADDED Viewed

	@@ -0,0 +1,46 @@

+{
+    "train": {
+        "log_interval": 200,
+        "seed": 1234,
+        "epochs": 20000,
+        "learning_rate": 0.0001,
+        "betas": [0.8, 0.99],
+        "eps": 1e-09,
+        "batch_size": 4,
+        "lr_decay": 0.999875,
+        "segment_size": 11520,
+        "init_lr_ratio": 1,
+        "warmup_epochs": 0,
+        "c_mel": 45,
+        "c_kl": 1.0
+    },
+    "data": {
+        "max_wav_value": 32768.0,
+        "sample_rate": 48000,
+        "filter_length": 2048,
+        "hop_length": 480,
+        "win_length": 2048,
+        "n_mel_channels": 128,
+        "mel_fmin": 0.0,
+        "mel_fmax": null
+    },
+    "model": {
+        "inter_channels": 192,
+        "hidden_channels": 192,
+        "filter_channels": 768,
+        "text_enc_hidden_dim": 256,
+        "n_heads": 2,
+        "n_layers": 6,
+        "kernel_size": 3,
+        "p_dropout": 0,
+        "resblock": "1",
+        "resblock_kernel_sizes": [3, 7, 11],
+        "resblock_dilation_sizes": [[1, 3, 5], [1, 3, 5], [1, 3, 5]],
+        "upsample_rates": [10, 6, 2, 2, 2],
+        "upsample_initial_channel": 512,
+        "upsample_kernel_sizes": [16, 16, 4, 4, 4],
+        "use_spectral_norm": false,
+        "gin_channels": 256,
+        "spk_embed_dim": 109
+    }
+}

configs/v2/32000.json ADDED Viewed

	@@ -0,0 +1,42 @@

+{
+    "train": {
+        "log_interval": 200,
+        "seed": 1234,
+        "learning_rate": 0.0001,
+        "betas": [0.8, 0.99],
+        "eps": 1e-09,
+        "lr_decay": 0.999875,
+        "segment_size": 12800,
+        "c_mel": 45,
+        "c_kl": 1.0
+    },
+    "data": {
+        "max_wav_value": 32768.0,
+        "sample_rate": 32000,
+        "filter_length": 1024,
+        "hop_length": 320,
+        "win_length": 1024,
+        "n_mel_channels": 80,
+        "mel_fmin": 0.0,
+        "mel_fmax": null
+    },
+    "model": {
+        "inter_channels": 192,
+        "hidden_channels": 192,
+        "filter_channels": 768,
+        "text_enc_hidden_dim": 768,
+        "n_heads": 2,
+        "n_layers": 6,
+        "kernel_size": 3,
+        "p_dropout": 0,
+        "resblock": "1",
+        "resblock_kernel_sizes": [3, 7, 11],
+        "resblock_dilation_sizes": [[1, 3, 5], [1, 3, 5], [1, 3, 5]],
+        "upsample_rates": [10, 8, 2, 2],
+        "upsample_initial_channel": 512,
+        "upsample_kernel_sizes": [20, 16, 4, 4],
+        "use_spectral_norm": false,
+        "gin_channels": 256,
+        "spk_embed_dim": 109
+    }
+}

configs/v2/40000.json ADDED Viewed

	@@ -0,0 +1,42 @@

+{
+    "train": {
+        "log_interval": 200,
+        "seed": 1234,
+        "learning_rate": 0.0001,
+        "betas": [0.8, 0.99],
+        "eps": 1e-09,
+        "lr_decay": 0.999875,
+        "segment_size": 12800,
+        "c_mel": 45,
+        "c_kl": 1.0
+    },
+    "data": {
+        "max_wav_value": 32768.0,
+        "sample_rate": 40000,
+        "filter_length": 2048,
+        "hop_length": 400,
+        "win_length": 2048,
+        "n_mel_channels": 125,
+        "mel_fmin": 0.0,
+        "mel_fmax": null
+    },
+    "model": {
+        "inter_channels": 192,
+        "hidden_channels": 192,
+        "filter_channels": 768,
+        "text_enc_hidden_dim": 768,
+        "n_heads": 2,
+        "n_layers": 6,
+        "kernel_size": 3,
+        "p_dropout": 0,
+        "resblock": "1",
+        "resblock_kernel_sizes": [3, 7, 11],
+        "resblock_dilation_sizes": [[1, 3, 5], [1, 3, 5], [1, 3, 5]],
+        "upsample_rates": [10, 10, 2, 2],
+        "upsample_initial_channel": 512,
+        "upsample_kernel_sizes": [16, 16, 4, 4],
+        "use_spectral_norm": false,
+        "gin_channels": 256,
+        "spk_embed_dim": 109
+    }
+}

configs/v2/44100.json ADDED Viewed

	@@ -0,0 +1,42 @@

+{
+    "train": {
+        "log_interval": 200,
+        "seed": 1234,
+        "learning_rate": 0.0001,
+        "betas": [0.8, 0.99],
+        "eps": 1e-09,
+        "lr_decay": 0.999875,
+        "segment_size": 15876,
+        "c_mel": 45,
+        "c_kl": 1.0
+    },
+    "data": {
+        "max_wav_value": 32768.0,
+        "sample_rate": 44100,
+        "filter_length": 2048,
+        "hop_length": 441,
+        "win_length": 2048,
+        "n_mel_channels": 160,
+        "mel_fmin": 0.0,
+        "mel_fmax": null
+    },
+    "model": {
+        "inter_channels": 192,
+        "hidden_channels": 192,
+        "filter_channels": 768,
+        "text_enc_hidden_dim": 768,
+        "n_heads": 2,
+        "n_layers": 6,
+        "kernel_size": 3,
+        "p_dropout": 0,
+        "resblock": "1",
+        "resblock_kernel_sizes": [3, 7, 11],
+        "resblock_dilation_sizes": [[1, 3, 5], [1, 3, 5], [1, 3, 5]],
+        "upsample_rates": [7, 7, 3, 3],
+        "upsample_initial_channel": 512,
+        "upsample_kernel_sizes": [14, 14, 6, 6],
+        "use_spectral_norm": false,
+        "gin_channels": 256,
+        "spk_embed_dim": 109
+    }
+}

configs/v2/48000.json ADDED Viewed

	@@ -0,0 +1,42 @@

+{
+    "train": {
+        "log_interval": 200,
+        "seed": 1234,
+        "learning_rate": 0.0001,
+        "betas": [0.8, 0.99],
+        "eps": 1e-09,
+        "lr_decay": 0.999875,
+        "segment_size": 17280,
+        "c_mel": 45,
+        "c_kl": 1.0
+    },
+    "data": {
+        "max_wav_value": 32768.0,
+        "sample_rate": 48000,
+        "filter_length": 2048,
+        "hop_length": 480,
+        "win_length": 2048,
+        "n_mel_channels": 128,
+        "mel_fmin": 0.0,
+        "mel_fmax": null
+    },
+    "model": {
+        "inter_channels": 192,
+        "hidden_channels": 192,
+        "filter_channels": 768,
+        "text_enc_hidden_dim": 768,
+        "n_heads": 2,
+        "n_layers": 6,
+        "kernel_size": 3,
+        "p_dropout": 0,
+        "resblock": "1",
+        "resblock_kernel_sizes": [3, 7, 11],
+        "resblock_dilation_sizes": [[1, 3, 5], [1, 3, 5], [1, 3, 5]],
+        "upsample_rates": [12, 10, 2, 2],
+        "upsample_initial_channel": 512,
+        "upsample_kernel_sizes": [24, 20, 4, 4],
+        "use_spectral_norm": false,
+        "gin_channels": 256,
+        "spk_embed_dim": 109
+    }
+}