RthItalia commited on
Commit
2c94afe
·
verified ·
1 Parent(s): ecd57b3

Upload folder using huggingface_hub

Browse files
config.json ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_name_or_path": "/workspace/HENLA/hf_exports/HENLA-CONFED-3B-FINEWEB-GATEFIX",
3
+ "architectures": [
4
+ "HenlaConfedForCausalLM"
5
+ ],
6
+ "area_hidden_mult": 4,
7
+ "attn_pdrop": 0.1,
8
+ "auto_map": {
9
+ "AutoConfig": "modeling_henla_confed.HenlaConfedConfig",
10
+ "AutoModelForCausalLM": "modeling_henla_confed.HenlaConfedForCausalLM"
11
+ },
12
+ "bos_token_id": 50256,
13
+ "embd_pdrop": 0.1,
14
+ "eos_token_id": 50256,
15
+ "model_type": "henla_confed",
16
+ "n_areas": 8,
17
+ "n_embd": 1280,
18
+ "n_head": 16,
19
+ "n_layer": 24,
20
+ "n_positions": 512,
21
+ "pad_token_id": 50256,
22
+ "resid_pdrop": 0.1,
23
+ "torch_dtype": "bfloat16",
24
+ "transformers_version": "4.44.2",
25
+ "vocab_size": 50257
26
+ }
generation_config.json ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 50256,
4
+ "eos_token_id": 50256,
5
+ "pad_token_id": 50256,
6
+ "transformers_version": "4.44.2"
7
+ }
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
modeling_henla_confed.py ADDED
@@ -0,0 +1,245 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+
2
+ import math
3
+ import torch
4
+ import torch.nn as nn
5
+ import torch.nn.functional as F
6
+
7
+ from transformers import PretrainedConfig, PreTrainedModel
8
+ from transformers.modeling_outputs import CausalLMOutputWithPast
9
+
10
+
11
+ class HenlaConfedConfig(PretrainedConfig):
12
+ model_type = "henla_confed"
13
+
14
+ def __init__(
15
+ self,
16
+ vocab_size=50257,
17
+ n_positions=1024,
18
+ n_embd=1024,
19
+ n_layer=24,
20
+ n_head=16,
21
+ n_areas=8,
22
+ area_hidden_mult=4,
23
+ resid_pdrop=0.1,
24
+ embd_pdrop=0.1,
25
+ attn_pdrop=0.1,
26
+ bos_token_id=50256,
27
+ eos_token_id=50256,
28
+ pad_token_id=50256,
29
+ **kwargs,
30
+ ):
31
+ super().__init__(
32
+ bos_token_id=bos_token_id,
33
+ eos_token_id=eos_token_id,
34
+ pad_token_id=pad_token_id,
35
+ **kwargs,
36
+ )
37
+ self.vocab_size = vocab_size
38
+ self.n_positions = n_positions
39
+ self.n_embd = n_embd
40
+ self.n_layer = n_layer
41
+ self.n_head = n_head
42
+ self.n_areas = n_areas
43
+ self.area_hidden_mult = area_hidden_mult
44
+ self.resid_pdrop = resid_pdrop
45
+ self.embd_pdrop = embd_pdrop
46
+ self.attn_pdrop = attn_pdrop
47
+
48
+
49
+ class CausalSelfAttention(nn.Module):
50
+ def __init__(self, config):
51
+ super().__init__()
52
+ assert config.n_embd % config.n_head == 0
53
+ self.n_head = config.n_head
54
+ self.head_dim = config.n_embd // config.n_head
55
+ self.c_attn = nn.Linear(config.n_embd, 3 * config.n_embd)
56
+ self.c_proj = nn.Linear(config.n_embd, config.n_embd)
57
+ self.attn_dropout = nn.Dropout(config.attn_pdrop)
58
+ self.resid_dropout = nn.Dropout(config.resid_pdrop)
59
+
60
+ def forward(self, x, attention_mask=None):
61
+ b, t, c = x.size()
62
+ qkv = self.c_attn(x)
63
+ q, k, v = qkv.split(c, dim=2)
64
+
65
+ q = q.view(b, t, self.n_head, self.head_dim).transpose(1, 2)
66
+ k = k.view(b, t, self.n_head, self.head_dim).transpose(1, 2)
67
+ v = v.view(b, t, self.n_head, self.head_dim).transpose(1, 2)
68
+
69
+ att = (q @ k.transpose(-2, -1)) / math.sqrt(self.head_dim)
70
+
71
+ causal = torch.tril(torch.ones(t, t, device=x.device, dtype=torch.bool))
72
+ att = att.masked_fill(~causal.view(1, 1, t, t), torch.finfo(att.dtype).min)
73
+
74
+ if attention_mask is not None:
75
+ # attention_mask: [B,T], 1 keep, 0 mask
76
+ m = attention_mask.view(b, 1, 1, t).to(torch.bool)
77
+ att = att.masked_fill(~m, torch.finfo(att.dtype).min)
78
+
79
+ att = F.softmax(att, dim=-1)
80
+ att = self.attn_dropout(att)
81
+
82
+ y = att @ v
83
+ y = y.transpose(1, 2).contiguous().view(b, t, c)
84
+ y = self.resid_dropout(self.c_proj(y))
85
+ return y
86
+
87
+
88
+ class CognitiveAreaMLP(nn.Module):
89
+ def __init__(self, config):
90
+ super().__init__()
91
+ hidden = config.area_hidden_mult * config.n_embd
92
+ self.net = nn.Sequential(
93
+ nn.Linear(config.n_embd, hidden),
94
+ nn.GELU(),
95
+ nn.Linear(hidden, config.n_embd),
96
+ nn.Dropout(config.resid_pdrop),
97
+ )
98
+
99
+ def forward(self, x):
100
+ return self.net(x)
101
+
102
+
103
+ class HenlaConfederatedBlock(nn.Module):
104
+ """
105
+ One transformer block with federated cognitive areas.
106
+
107
+ Flow:
108
+ token stream -> shared attention
109
+ -> parallel cognitive areas
110
+ -> metacognitive gate over areas
111
+ -> orchestrated residual
112
+ """
113
+ def __init__(self, config):
114
+ super().__init__()
115
+ self.ln_1 = nn.LayerNorm(config.n_embd)
116
+ self.attn = CausalSelfAttention(config)
117
+
118
+ self.ln_2 = nn.LayerNorm(config.n_embd)
119
+ self.areas = nn.ModuleList([CognitiveAreaMLP(config) for _ in range(config.n_areas)])
120
+
121
+ self.gate = nn.Sequential(
122
+ nn.Linear(config.n_embd, config.n_embd),
123
+ nn.GELU(),
124
+ nn.Linear(config.n_embd, config.n_areas),
125
+ )
126
+
127
+ self.area_norm = nn.LayerNorm(config.n_embd)
128
+ self.resid_dropout = nn.Dropout(config.resid_pdrop)
129
+
130
+ def forward(self, x, attention_mask=None):
131
+ x = x + self.attn(self.ln_1(x), attention_mask=attention_mask)
132
+
133
+ h = self.ln_2(x)
134
+ area_outs = torch.stack([area(h) for area in self.areas], dim=2) # B,T,A,C
135
+ gate_logits = self.gate(h) # B,T,A
136
+ gate = F.softmax(gate_logits, dim=-1).unsqueeze(-1) # B,T,A,1
137
+
138
+ fused = (area_outs * gate).sum(dim=2)
139
+ fused = self.area_norm(fused)
140
+
141
+ x = x + self.resid_dropout(fused)
142
+ return x
143
+
144
+
145
+ class HenlaConfedForCausalLM(PreTrainedModel):
146
+ config_class = HenlaConfedConfig
147
+ base_model_prefix = "henla_confed"
148
+ supports_gradient_checkpointing = True
149
+
150
+ def __init__(self, config):
151
+ super().__init__(config)
152
+ self.config = config
153
+
154
+ self.wte = nn.Embedding(config.vocab_size, config.n_embd)
155
+ self.wpe = nn.Embedding(config.n_positions, config.n_embd)
156
+ self.drop = nn.Dropout(config.embd_pdrop)
157
+
158
+ self.blocks = nn.ModuleList([HenlaConfederatedBlock(config) for _ in range(config.n_layer)])
159
+ self.ln_f = nn.LayerNorm(config.n_embd)
160
+
161
+ self.lm_head = nn.Linear(config.n_embd, config.vocab_size, bias=False)
162
+ self.lm_head.weight = self.wte.weight
163
+
164
+ self.gradient_checkpointing = False
165
+ self.post_init()
166
+
167
+ def _init_weights(self, module):
168
+ if isinstance(module, nn.Linear):
169
+ torch.nn.init.normal_(module.weight, mean=0.0, std=0.02)
170
+ if module.bias is not None:
171
+ torch.nn.init.zeros_(module.bias)
172
+ elif isinstance(module, nn.Embedding):
173
+ torch.nn.init.normal_(module.weight, mean=0.0, std=0.02)
174
+
175
+ def gradient_checkpointing_enable(self, gradient_checkpointing_kwargs=None):
176
+ self.gradient_checkpointing = True
177
+
178
+ def gradient_checkpointing_disable(self):
179
+ self.gradient_checkpointing = False
180
+
181
+ def get_input_embeddings(self):
182
+ return self.wte
183
+
184
+ def set_input_embeddings(self, value):
185
+ self.wte = value
186
+ self.lm_head.weight = self.wte.weight
187
+
188
+ def prepare_inputs_for_generation(self, input_ids, attention_mask=None, **kwargs):
189
+ return {
190
+ "input_ids": input_ids,
191
+ "attention_mask": attention_mask,
192
+ }
193
+
194
+ def forward(
195
+ self,
196
+ input_ids=None,
197
+ attention_mask=None,
198
+ labels=None,
199
+ **kwargs,
200
+ ):
201
+ b, t = input_ids.shape
202
+ if t > self.config.n_positions:
203
+ input_ids = input_ids[:, -self.config.n_positions:]
204
+ if attention_mask is not None:
205
+ attention_mask = attention_mask[:, -self.config.n_positions:]
206
+ if labels is not None:
207
+ labels = labels[:, -self.config.n_positions:]
208
+ b, t = input_ids.shape
209
+
210
+ pos = torch.arange(0, t, dtype=torch.long, device=input_ids.device).unsqueeze(0)
211
+
212
+ x = self.wte(input_ids) + self.wpe(pos)
213
+ x = self.drop(x)
214
+
215
+ for block in self.blocks:
216
+ if self.gradient_checkpointing and self.training:
217
+ x = torch.utils.checkpoint.checkpoint(
218
+ block,
219
+ x,
220
+ attention_mask,
221
+ use_reentrant=False,
222
+ )
223
+ else:
224
+ x = block(x, attention_mask=attention_mask)
225
+
226
+ x = self.ln_f(x)
227
+ logits = self.lm_head(x)
228
+
229
+ loss = None
230
+ if labels is not None:
231
+ shift_logits = logits[:, :-1, :].contiguous()
232
+ shift_labels = labels[:, 1:].contiguous()
233
+ loss = F.cross_entropy(
234
+ shift_logits.view(-1, shift_logits.size(-1)),
235
+ shift_labels.view(-1),
236
+ ignore_index=-100,
237
+ )
238
+
239
+ return CausalLMOutputWithPast(
240
+ loss=loss,
241
+ logits=logits,
242
+ past_key_values=None,
243
+ hidden_states=None,
244
+ attentions=None,
245
+ )
pytorch_model-00001-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:43b60c4554b52fa91e0b86329df093fee77f682d4f2c232cc2d7da78e8dbdc47
3
+ size 500508482
pytorch_model-00002-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:11096dd34250da87b1e6f26cd31f23493cfe0e4392d2054a0aa8c28dde289a29
3
+ size 504988914
pytorch_model-00003-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:994551afeeb9224f8fb2385b8a781ef8ab95ff862a4bc5c84565fd15929139c1
3
+ size 508315734
pytorch_model-00004-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e46c3eae9225cf375a47d9c1e6a567085793e95177aa070fb56b264cb6fef86a
3
+ size 504988914
pytorch_model-00005-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fd2d1995bc22e74342e5af7c5e51dd1870f3d656e7f4f8d5f60c282f842b38ec
3
+ size 504988914
pytorch_model-00006-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bac995c6cd6e0cc043b65e4560e6638d815a15eb79fe736ab7fbc07841fe2de1
3
+ size 504988978
pytorch_model-00007-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fbc1e6f0e9415bdaa0024f7df77b27b1b4b3b6ac4330e007c30528573e4c989a
3
+ size 508308182
pytorch_model-00008-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ee82374510ed839479d0f8eedc23ee2303e34375cd33dc2a04ddfcbab01890ac
3
+ size 504988978
pytorch_model-00009-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9add2d0eedc2312d482fc58af5e872936279ef358181f95804bd46f044d5ab6d
3
+ size 504988978
pytorch_model-00010-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e8ba589a0104c43d7b1a965bc09701c9372e603f6085d38e33bd8c0158df5f4d
3
+ size 504988978
pytorch_model-00011-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1d12e1da8ed78a963e77a9650b933ae279dee7bac7744ad83ef8b99adfbe6012
3
+ size 508301706
pytorch_model-00012-of-00012.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d67d91f1628fae60205428a17c0559fb80d0be81a59c0c235175df9c4fc5046a
3
+ size 128659333
pytorch_model.bin.index.json ADDED
@@ -0,0 +1,1116 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_size": 5688637824
4
+ },
5
+ "weight_map": {
6
+ "blocks.0.area_norm.bias": "pytorch_model-00001-of-00012.bin",
7
+ "blocks.0.area_norm.weight": "pytorch_model-00001-of-00012.bin",
8
+ "blocks.0.areas.0.net.0.bias": "pytorch_model-00001-of-00012.bin",
9
+ "blocks.0.areas.0.net.0.weight": "pytorch_model-00001-of-00012.bin",
10
+ "blocks.0.areas.0.net.2.bias": "pytorch_model-00001-of-00012.bin",
11
+ "blocks.0.areas.0.net.2.weight": "pytorch_model-00001-of-00012.bin",
12
+ "blocks.0.areas.1.net.0.bias": "pytorch_model-00001-of-00012.bin",
13
+ "blocks.0.areas.1.net.0.weight": "pytorch_model-00001-of-00012.bin",
14
+ "blocks.0.areas.1.net.2.bias": "pytorch_model-00001-of-00012.bin",
15
+ "blocks.0.areas.1.net.2.weight": "pytorch_model-00001-of-00012.bin",
16
+ "blocks.0.areas.2.net.0.bias": "pytorch_model-00001-of-00012.bin",
17
+ "blocks.0.areas.2.net.0.weight": "pytorch_model-00001-of-00012.bin",
18
+ "blocks.0.areas.2.net.2.bias": "pytorch_model-00001-of-00012.bin",
19
+ "blocks.0.areas.2.net.2.weight": "pytorch_model-00001-of-00012.bin",
20
+ "blocks.0.areas.3.net.0.bias": "pytorch_model-00001-of-00012.bin",
21
+ "blocks.0.areas.3.net.0.weight": "pytorch_model-00001-of-00012.bin",
22
+ "blocks.0.areas.3.net.2.bias": "pytorch_model-00001-of-00012.bin",
23
+ "blocks.0.areas.3.net.2.weight": "pytorch_model-00001-of-00012.bin",
24
+ "blocks.0.areas.4.net.0.bias": "pytorch_model-00001-of-00012.bin",
25
+ "blocks.0.areas.4.net.0.weight": "pytorch_model-00001-of-00012.bin",
26
+ "blocks.0.areas.4.net.2.bias": "pytorch_model-00001-of-00012.bin",
27
+ "blocks.0.areas.4.net.2.weight": "pytorch_model-00001-of-00012.bin",
28
+ "blocks.0.areas.5.net.0.bias": "pytorch_model-00001-of-00012.bin",
29
+ "blocks.0.areas.5.net.0.weight": "pytorch_model-00001-of-00012.bin",
30
+ "blocks.0.areas.5.net.2.bias": "pytorch_model-00001-of-00012.bin",
31
+ "blocks.0.areas.5.net.2.weight": "pytorch_model-00001-of-00012.bin",
32
+ "blocks.0.areas.6.net.0.bias": "pytorch_model-00001-of-00012.bin",
33
+ "blocks.0.areas.6.net.0.weight": "pytorch_model-00001-of-00012.bin",
34
+ "blocks.0.areas.6.net.2.bias": "pytorch_model-00001-of-00012.bin",
35
+ "blocks.0.areas.6.net.2.weight": "pytorch_model-00001-of-00012.bin",
36
+ "blocks.0.areas.7.net.0.bias": "pytorch_model-00001-of-00012.bin",
37
+ "blocks.0.areas.7.net.0.weight": "pytorch_model-00001-of-00012.bin",
38
+ "blocks.0.areas.7.net.2.bias": "pytorch_model-00001-of-00012.bin",
39
+ "blocks.0.areas.7.net.2.weight": "pytorch_model-00001-of-00012.bin",
40
+ "blocks.0.attn.c_attn.bias": "pytorch_model-00001-of-00012.bin",
41
+ "blocks.0.attn.c_attn.weight": "pytorch_model-00001-of-00012.bin",
42
+ "blocks.0.attn.c_proj.bias": "pytorch_model-00001-of-00012.bin",
43
+ "blocks.0.attn.c_proj.weight": "pytorch_model-00001-of-00012.bin",
44
+ "blocks.0.gate.0.bias": "pytorch_model-00001-of-00012.bin",
45
+ "blocks.0.gate.0.weight": "pytorch_model-00001-of-00012.bin",
46
+ "blocks.0.gate.2.bias": "pytorch_model-00001-of-00012.bin",
47
+ "blocks.0.gate.2.weight": "pytorch_model-00001-of-00012.bin",
48
+ "blocks.0.ln_1.bias": "pytorch_model-00001-of-00012.bin",
49
+ "blocks.0.ln_1.weight": "pytorch_model-00001-of-00012.bin",
50
+ "blocks.0.ln_2.bias": "pytorch_model-00001-of-00012.bin",
51
+ "blocks.0.ln_2.weight": "pytorch_model-00001-of-00012.bin",
52
+ "blocks.1.area_norm.bias": "pytorch_model-00002-of-00012.bin",
53
+ "blocks.1.area_norm.weight": "pytorch_model-00002-of-00012.bin",
54
+ "blocks.1.areas.0.net.0.bias": "pytorch_model-00001-of-00012.bin",
55
+ "blocks.1.areas.0.net.0.weight": "pytorch_model-00001-of-00012.bin",
56
+ "blocks.1.areas.0.net.2.bias": "pytorch_model-00001-of-00012.bin",
57
+ "blocks.1.areas.0.net.2.weight": "pytorch_model-00001-of-00012.bin",
58
+ "blocks.1.areas.1.net.0.bias": "pytorch_model-00001-of-00012.bin",
59
+ "blocks.1.areas.1.net.0.weight": "pytorch_model-00001-of-00012.bin",
60
+ "blocks.1.areas.1.net.2.bias": "pytorch_model-00001-of-00012.bin",
61
+ "blocks.1.areas.1.net.2.weight": "pytorch_model-00001-of-00012.bin",
62
+ "blocks.1.areas.2.net.0.bias": "pytorch_model-00001-of-00012.bin",
63
+ "blocks.1.areas.2.net.0.weight": "pytorch_model-00001-of-00012.bin",
64
+ "blocks.1.areas.2.net.2.bias": "pytorch_model-00001-of-00012.bin",
65
+ "blocks.1.areas.2.net.2.weight": "pytorch_model-00001-of-00012.bin",
66
+ "blocks.1.areas.3.net.0.bias": "pytorch_model-00001-of-00012.bin",
67
+ "blocks.1.areas.3.net.0.weight": "pytorch_model-00001-of-00012.bin",
68
+ "blocks.1.areas.3.net.2.bias": "pytorch_model-00001-of-00012.bin",
69
+ "blocks.1.areas.3.net.2.weight": "pytorch_model-00001-of-00012.bin",
70
+ "blocks.1.areas.4.net.0.bias": "pytorch_model-00001-of-00012.bin",
71
+ "blocks.1.areas.4.net.0.weight": "pytorch_model-00001-of-00012.bin",
72
+ "blocks.1.areas.4.net.2.bias": "pytorch_model-00001-of-00012.bin",
73
+ "blocks.1.areas.4.net.2.weight": "pytorch_model-00001-of-00012.bin",
74
+ "blocks.1.areas.5.net.0.bias": "pytorch_model-00002-of-00012.bin",
75
+ "blocks.1.areas.5.net.0.weight": "pytorch_model-00002-of-00012.bin",
76
+ "blocks.1.areas.5.net.2.bias": "pytorch_model-00002-of-00012.bin",
77
+ "blocks.1.areas.5.net.2.weight": "pytorch_model-00002-of-00012.bin",
78
+ "blocks.1.areas.6.net.0.bias": "pytorch_model-00002-of-00012.bin",
79
+ "blocks.1.areas.6.net.0.weight": "pytorch_model-00002-of-00012.bin",
80
+ "blocks.1.areas.6.net.2.bias": "pytorch_model-00002-of-00012.bin",
81
+ "blocks.1.areas.6.net.2.weight": "pytorch_model-00002-of-00012.bin",
82
+ "blocks.1.areas.7.net.0.bias": "pytorch_model-00002-of-00012.bin",
83
+ "blocks.1.areas.7.net.0.weight": "pytorch_model-00002-of-00012.bin",
84
+ "blocks.1.areas.7.net.2.bias": "pytorch_model-00002-of-00012.bin",
85
+ "blocks.1.areas.7.net.2.weight": "pytorch_model-00002-of-00012.bin",
86
+ "blocks.1.attn.c_attn.bias": "pytorch_model-00001-of-00012.bin",
87
+ "blocks.1.attn.c_attn.weight": "pytorch_model-00001-of-00012.bin",
88
+ "blocks.1.attn.c_proj.bias": "pytorch_model-00001-of-00012.bin",
89
+ "blocks.1.attn.c_proj.weight": "pytorch_model-00001-of-00012.bin",
90
+ "blocks.1.gate.0.bias": "pytorch_model-00002-of-00012.bin",
91
+ "blocks.1.gate.0.weight": "pytorch_model-00002-of-00012.bin",
92
+ "blocks.1.gate.2.bias": "pytorch_model-00002-of-00012.bin",
93
+ "blocks.1.gate.2.weight": "pytorch_model-00002-of-00012.bin",
94
+ "blocks.1.ln_1.bias": "pytorch_model-00001-of-00012.bin",
95
+ "blocks.1.ln_1.weight": "pytorch_model-00001-of-00012.bin",
96
+ "blocks.1.ln_2.bias": "pytorch_model-00001-of-00012.bin",
97
+ "blocks.1.ln_2.weight": "pytorch_model-00001-of-00012.bin",
98
+ "blocks.10.area_norm.bias": "pytorch_model-00006-of-00012.bin",
99
+ "blocks.10.area_norm.weight": "pytorch_model-00006-of-00012.bin",
100
+ "blocks.10.areas.0.net.0.bias": "pytorch_model-00005-of-00012.bin",
101
+ "blocks.10.areas.0.net.0.weight": "pytorch_model-00005-of-00012.bin",
102
+ "blocks.10.areas.0.net.2.bias": "pytorch_model-00005-of-00012.bin",
103
+ "blocks.10.areas.0.net.2.weight": "pytorch_model-00005-of-00012.bin",
104
+ "blocks.10.areas.1.net.0.bias": "pytorch_model-00005-of-00012.bin",
105
+ "blocks.10.areas.1.net.0.weight": "pytorch_model-00005-of-00012.bin",
106
+ "blocks.10.areas.1.net.2.bias": "pytorch_model-00005-of-00012.bin",
107
+ "blocks.10.areas.1.net.2.weight": "pytorch_model-00005-of-00012.bin",
108
+ "blocks.10.areas.2.net.0.bias": "pytorch_model-00005-of-00012.bin",
109
+ "blocks.10.areas.2.net.0.weight": "pytorch_model-00005-of-00012.bin",
110
+ "blocks.10.areas.2.net.2.bias": "pytorch_model-00005-of-00012.bin",
111
+ "blocks.10.areas.2.net.2.weight": "pytorch_model-00005-of-00012.bin",
112
+ "blocks.10.areas.3.net.0.bias": "pytorch_model-00005-of-00012.bin",
113
+ "blocks.10.areas.3.net.0.weight": "pytorch_model-00005-of-00012.bin",
114
+ "blocks.10.areas.3.net.2.bias": "pytorch_model-00005-of-00012.bin",
115
+ "blocks.10.areas.3.net.2.weight": "pytorch_model-00005-of-00012.bin",
116
+ "blocks.10.areas.4.net.0.bias": "pytorch_model-00005-of-00012.bin",
117
+ "blocks.10.areas.4.net.0.weight": "pytorch_model-00005-of-00012.bin",
118
+ "blocks.10.areas.4.net.2.bias": "pytorch_model-00006-of-00012.bin",
119
+ "blocks.10.areas.4.net.2.weight": "pytorch_model-00006-of-00012.bin",
120
+ "blocks.10.areas.5.net.0.bias": "pytorch_model-00006-of-00012.bin",
121
+ "blocks.10.areas.5.net.0.weight": "pytorch_model-00006-of-00012.bin",
122
+ "blocks.10.areas.5.net.2.bias": "pytorch_model-00006-of-00012.bin",
123
+ "blocks.10.areas.5.net.2.weight": "pytorch_model-00006-of-00012.bin",
124
+ "blocks.10.areas.6.net.0.bias": "pytorch_model-00006-of-00012.bin",
125
+ "blocks.10.areas.6.net.0.weight": "pytorch_model-00006-of-00012.bin",
126
+ "blocks.10.areas.6.net.2.bias": "pytorch_model-00006-of-00012.bin",
127
+ "blocks.10.areas.6.net.2.weight": "pytorch_model-00006-of-00012.bin",
128
+ "blocks.10.areas.7.net.0.bias": "pytorch_model-00006-of-00012.bin",
129
+ "blocks.10.areas.7.net.0.weight": "pytorch_model-00006-of-00012.bin",
130
+ "blocks.10.areas.7.net.2.bias": "pytorch_model-00006-of-00012.bin",
131
+ "blocks.10.areas.7.net.2.weight": "pytorch_model-00006-of-00012.bin",
132
+ "blocks.10.attn.c_attn.bias": "pytorch_model-00005-of-00012.bin",
133
+ "blocks.10.attn.c_attn.weight": "pytorch_model-00005-of-00012.bin",
134
+ "blocks.10.attn.c_proj.bias": "pytorch_model-00005-of-00012.bin",
135
+ "blocks.10.attn.c_proj.weight": "pytorch_model-00005-of-00012.bin",
136
+ "blocks.10.gate.0.bias": "pytorch_model-00006-of-00012.bin",
137
+ "blocks.10.gate.0.weight": "pytorch_model-00006-of-00012.bin",
138
+ "blocks.10.gate.2.bias": "pytorch_model-00006-of-00012.bin",
139
+ "blocks.10.gate.2.weight": "pytorch_model-00006-of-00012.bin",
140
+ "blocks.10.ln_1.bias": "pytorch_model-00005-of-00012.bin",
141
+ "blocks.10.ln_1.weight": "pytorch_model-00005-of-00012.bin",
142
+ "blocks.10.ln_2.bias": "pytorch_model-00005-of-00012.bin",
143
+ "blocks.10.ln_2.weight": "pytorch_model-00005-of-00012.bin",
144
+ "blocks.11.area_norm.bias": "pytorch_model-00006-of-00012.bin",
145
+ "blocks.11.area_norm.weight": "pytorch_model-00006-of-00012.bin",
146
+ "blocks.11.areas.0.net.0.bias": "pytorch_model-00006-of-00012.bin",
147
+ "blocks.11.areas.0.net.0.weight": "pytorch_model-00006-of-00012.bin",
148
+ "blocks.11.areas.0.net.2.bias": "pytorch_model-00006-of-00012.bin",
149
+ "blocks.11.areas.0.net.2.weight": "pytorch_model-00006-of-00012.bin",
150
+ "blocks.11.areas.1.net.0.bias": "pytorch_model-00006-of-00012.bin",
151
+ "blocks.11.areas.1.net.0.weight": "pytorch_model-00006-of-00012.bin",
152
+ "blocks.11.areas.1.net.2.bias": "pytorch_model-00006-of-00012.bin",
153
+ "blocks.11.areas.1.net.2.weight": "pytorch_model-00006-of-00012.bin",
154
+ "blocks.11.areas.2.net.0.bias": "pytorch_model-00006-of-00012.bin",
155
+ "blocks.11.areas.2.net.0.weight": "pytorch_model-00006-of-00012.bin",
156
+ "blocks.11.areas.2.net.2.bias": "pytorch_model-00006-of-00012.bin",
157
+ "blocks.11.areas.2.net.2.weight": "pytorch_model-00006-of-00012.bin",
158
+ "blocks.11.areas.3.net.0.bias": "pytorch_model-00006-of-00012.bin",
159
+ "blocks.11.areas.3.net.0.weight": "pytorch_model-00006-of-00012.bin",
160
+ "blocks.11.areas.3.net.2.bias": "pytorch_model-00006-of-00012.bin",
161
+ "blocks.11.areas.3.net.2.weight": "pytorch_model-00006-of-00012.bin",
162
+ "blocks.11.areas.4.net.0.bias": "pytorch_model-00006-of-00012.bin",
163
+ "blocks.11.areas.4.net.0.weight": "pytorch_model-00006-of-00012.bin",
164
+ "blocks.11.areas.4.net.2.bias": "pytorch_model-00006-of-00012.bin",
165
+ "blocks.11.areas.4.net.2.weight": "pytorch_model-00006-of-00012.bin",
166
+ "blocks.11.areas.5.net.0.bias": "pytorch_model-00006-of-00012.bin",
167
+ "blocks.11.areas.5.net.0.weight": "pytorch_model-00006-of-00012.bin",
168
+ "blocks.11.areas.5.net.2.bias": "pytorch_model-00006-of-00012.bin",
169
+ "blocks.11.areas.5.net.2.weight": "pytorch_model-00006-of-00012.bin",
170
+ "blocks.11.areas.6.net.0.bias": "pytorch_model-00006-of-00012.bin",
171
+ "blocks.11.areas.6.net.0.weight": "pytorch_model-00006-of-00012.bin",
172
+ "blocks.11.areas.6.net.2.bias": "pytorch_model-00006-of-00012.bin",
173
+ "blocks.11.areas.6.net.2.weight": "pytorch_model-00006-of-00012.bin",
174
+ "blocks.11.areas.7.net.0.bias": "pytorch_model-00006-of-00012.bin",
175
+ "blocks.11.areas.7.net.0.weight": "pytorch_model-00006-of-00012.bin",
176
+ "blocks.11.areas.7.net.2.bias": "pytorch_model-00006-of-00012.bin",
177
+ "blocks.11.areas.7.net.2.weight": "pytorch_model-00006-of-00012.bin",
178
+ "blocks.11.attn.c_attn.bias": "pytorch_model-00006-of-00012.bin",
179
+ "blocks.11.attn.c_attn.weight": "pytorch_model-00006-of-00012.bin",
180
+ "blocks.11.attn.c_proj.bias": "pytorch_model-00006-of-00012.bin",
181
+ "blocks.11.attn.c_proj.weight": "pytorch_model-00006-of-00012.bin",
182
+ "blocks.11.gate.0.bias": "pytorch_model-00006-of-00012.bin",
183
+ "blocks.11.gate.0.weight": "pytorch_model-00006-of-00012.bin",
184
+ "blocks.11.gate.2.bias": "pytorch_model-00006-of-00012.bin",
185
+ "blocks.11.gate.2.weight": "pytorch_model-00006-of-00012.bin",
186
+ "blocks.11.ln_1.bias": "pytorch_model-00006-of-00012.bin",
187
+ "blocks.11.ln_1.weight": "pytorch_model-00006-of-00012.bin",
188
+ "blocks.11.ln_2.bias": "pytorch_model-00006-of-00012.bin",
189
+ "blocks.11.ln_2.weight": "pytorch_model-00006-of-00012.bin",
190
+ "blocks.12.area_norm.bias": "pytorch_model-00007-of-00012.bin",
191
+ "blocks.12.area_norm.weight": "pytorch_model-00007-of-00012.bin",
192
+ "blocks.12.areas.0.net.0.bias": "pytorch_model-00006-of-00012.bin",
193
+ "blocks.12.areas.0.net.0.weight": "pytorch_model-00006-of-00012.bin",
194
+ "blocks.12.areas.0.net.2.bias": "pytorch_model-00006-of-00012.bin",
195
+ "blocks.12.areas.0.net.2.weight": "pytorch_model-00006-of-00012.bin",
196
+ "blocks.12.areas.1.net.0.bias": "pytorch_model-00006-of-00012.bin",
197
+ "blocks.12.areas.1.net.0.weight": "pytorch_model-00006-of-00012.bin",
198
+ "blocks.12.areas.1.net.2.bias": "pytorch_model-00006-of-00012.bin",
199
+ "blocks.12.areas.1.net.2.weight": "pytorch_model-00006-of-00012.bin",
200
+ "blocks.12.areas.2.net.0.bias": "pytorch_model-00006-of-00012.bin",
201
+ "blocks.12.areas.2.net.0.weight": "pytorch_model-00006-of-00012.bin",
202
+ "blocks.12.areas.2.net.2.bias": "pytorch_model-00006-of-00012.bin",
203
+ "blocks.12.areas.2.net.2.weight": "pytorch_model-00006-of-00012.bin",
204
+ "blocks.12.areas.3.net.0.bias": "pytorch_model-00006-of-00012.bin",
205
+ "blocks.12.areas.3.net.0.weight": "pytorch_model-00006-of-00012.bin",
206
+ "blocks.12.areas.3.net.2.bias": "pytorch_model-00006-of-00012.bin",
207
+ "blocks.12.areas.3.net.2.weight": "pytorch_model-00006-of-00012.bin",
208
+ "blocks.12.areas.4.net.0.bias": "pytorch_model-00006-of-00012.bin",
209
+ "blocks.12.areas.4.net.0.weight": "pytorch_model-00006-of-00012.bin",
210
+ "blocks.12.areas.4.net.2.bias": "pytorch_model-00006-of-00012.bin",
211
+ "blocks.12.areas.4.net.2.weight": "pytorch_model-00006-of-00012.bin",
212
+ "blocks.12.areas.5.net.0.bias": "pytorch_model-00006-of-00012.bin",
213
+ "blocks.12.areas.5.net.0.weight": "pytorch_model-00006-of-00012.bin",
214
+ "blocks.12.areas.5.net.2.bias": "pytorch_model-00006-of-00012.bin",
215
+ "blocks.12.areas.5.net.2.weight": "pytorch_model-00006-of-00012.bin",
216
+ "blocks.12.areas.6.net.0.bias": "pytorch_model-00006-of-00012.bin",
217
+ "blocks.12.areas.6.net.0.weight": "pytorch_model-00006-of-00012.bin",
218
+ "blocks.12.areas.6.net.2.bias": "pytorch_model-00007-of-00012.bin",
219
+ "blocks.12.areas.6.net.2.weight": "pytorch_model-00007-of-00012.bin",
220
+ "blocks.12.areas.7.net.0.bias": "pytorch_model-00007-of-00012.bin",
221
+ "blocks.12.areas.7.net.0.weight": "pytorch_model-00007-of-00012.bin",
222
+ "blocks.12.areas.7.net.2.bias": "pytorch_model-00007-of-00012.bin",
223
+ "blocks.12.areas.7.net.2.weight": "pytorch_model-00007-of-00012.bin",
224
+ "blocks.12.attn.c_attn.bias": "pytorch_model-00006-of-00012.bin",
225
+ "blocks.12.attn.c_attn.weight": "pytorch_model-00006-of-00012.bin",
226
+ "blocks.12.attn.c_proj.bias": "pytorch_model-00006-of-00012.bin",
227
+ "blocks.12.attn.c_proj.weight": "pytorch_model-00006-of-00012.bin",
228
+ "blocks.12.gate.0.bias": "pytorch_model-00007-of-00012.bin",
229
+ "blocks.12.gate.0.weight": "pytorch_model-00007-of-00012.bin",
230
+ "blocks.12.gate.2.bias": "pytorch_model-00007-of-00012.bin",
231
+ "blocks.12.gate.2.weight": "pytorch_model-00007-of-00012.bin",
232
+ "blocks.12.ln_1.bias": "pytorch_model-00006-of-00012.bin",
233
+ "blocks.12.ln_1.weight": "pytorch_model-00006-of-00012.bin",
234
+ "blocks.12.ln_2.bias": "pytorch_model-00006-of-00012.bin",
235
+ "blocks.12.ln_2.weight": "pytorch_model-00006-of-00012.bin",
236
+ "blocks.13.area_norm.bias": "pytorch_model-00007-of-00012.bin",
237
+ "blocks.13.area_norm.weight": "pytorch_model-00007-of-00012.bin",
238
+ "blocks.13.areas.0.net.0.bias": "pytorch_model-00007-of-00012.bin",
239
+ "blocks.13.areas.0.net.0.weight": "pytorch_model-00007-of-00012.bin",
240
+ "blocks.13.areas.0.net.2.bias": "pytorch_model-00007-of-00012.bin",
241
+ "blocks.13.areas.0.net.2.weight": "pytorch_model-00007-of-00012.bin",
242
+ "blocks.13.areas.1.net.0.bias": "pytorch_model-00007-of-00012.bin",
243
+ "blocks.13.areas.1.net.0.weight": "pytorch_model-00007-of-00012.bin",
244
+ "blocks.13.areas.1.net.2.bias": "pytorch_model-00007-of-00012.bin",
245
+ "blocks.13.areas.1.net.2.weight": "pytorch_model-00007-of-00012.bin",
246
+ "blocks.13.areas.2.net.0.bias": "pytorch_model-00007-of-00012.bin",
247
+ "blocks.13.areas.2.net.0.weight": "pytorch_model-00007-of-00012.bin",
248
+ "blocks.13.areas.2.net.2.bias": "pytorch_model-00007-of-00012.bin",
249
+ "blocks.13.areas.2.net.2.weight": "pytorch_model-00007-of-00012.bin",
250
+ "blocks.13.areas.3.net.0.bias": "pytorch_model-00007-of-00012.bin",
251
+ "blocks.13.areas.3.net.0.weight": "pytorch_model-00007-of-00012.bin",
252
+ "blocks.13.areas.3.net.2.bias": "pytorch_model-00007-of-00012.bin",
253
+ "blocks.13.areas.3.net.2.weight": "pytorch_model-00007-of-00012.bin",
254
+ "blocks.13.areas.4.net.0.bias": "pytorch_model-00007-of-00012.bin",
255
+ "blocks.13.areas.4.net.0.weight": "pytorch_model-00007-of-00012.bin",
256
+ "blocks.13.areas.4.net.2.bias": "pytorch_model-00007-of-00012.bin",
257
+ "blocks.13.areas.4.net.2.weight": "pytorch_model-00007-of-00012.bin",
258
+ "blocks.13.areas.5.net.0.bias": "pytorch_model-00007-of-00012.bin",
259
+ "blocks.13.areas.5.net.0.weight": "pytorch_model-00007-of-00012.bin",
260
+ "blocks.13.areas.5.net.2.bias": "pytorch_model-00007-of-00012.bin",
261
+ "blocks.13.areas.5.net.2.weight": "pytorch_model-00007-of-00012.bin",
262
+ "blocks.13.areas.6.net.0.bias": "pytorch_model-00007-of-00012.bin",
263
+ "blocks.13.areas.6.net.0.weight": "pytorch_model-00007-of-00012.bin",
264
+ "blocks.13.areas.6.net.2.bias": "pytorch_model-00007-of-00012.bin",
265
+ "blocks.13.areas.6.net.2.weight": "pytorch_model-00007-of-00012.bin",
266
+ "blocks.13.areas.7.net.0.bias": "pytorch_model-00007-of-00012.bin",
267
+ "blocks.13.areas.7.net.0.weight": "pytorch_model-00007-of-00012.bin",
268
+ "blocks.13.areas.7.net.2.bias": "pytorch_model-00007-of-00012.bin",
269
+ "blocks.13.areas.7.net.2.weight": "pytorch_model-00007-of-00012.bin",
270
+ "blocks.13.attn.c_attn.bias": "pytorch_model-00007-of-00012.bin",
271
+ "blocks.13.attn.c_attn.weight": "pytorch_model-00007-of-00012.bin",
272
+ "blocks.13.attn.c_proj.bias": "pytorch_model-00007-of-00012.bin",
273
+ "blocks.13.attn.c_proj.weight": "pytorch_model-00007-of-00012.bin",
274
+ "blocks.13.gate.0.bias": "pytorch_model-00007-of-00012.bin",
275
+ "blocks.13.gate.0.weight": "pytorch_model-00007-of-00012.bin",
276
+ "blocks.13.gate.2.bias": "pytorch_model-00007-of-00012.bin",
277
+ "blocks.13.gate.2.weight": "pytorch_model-00007-of-00012.bin",
278
+ "blocks.13.ln_1.bias": "pytorch_model-00007-of-00012.bin",
279
+ "blocks.13.ln_1.weight": "pytorch_model-00007-of-00012.bin",
280
+ "blocks.13.ln_2.bias": "pytorch_model-00007-of-00012.bin",
281
+ "blocks.13.ln_2.weight": "pytorch_model-00007-of-00012.bin",
282
+ "blocks.14.area_norm.bias": "pytorch_model-00007-of-00012.bin",
283
+ "blocks.14.area_norm.weight": "pytorch_model-00007-of-00012.bin",
284
+ "blocks.14.areas.0.net.0.bias": "pytorch_model-00007-of-00012.bin",
285
+ "blocks.14.areas.0.net.0.weight": "pytorch_model-00007-of-00012.bin",
286
+ "blocks.14.areas.0.net.2.bias": "pytorch_model-00007-of-00012.bin",
287
+ "blocks.14.areas.0.net.2.weight": "pytorch_model-00007-of-00012.bin",
288
+ "blocks.14.areas.1.net.0.bias": "pytorch_model-00007-of-00012.bin",
289
+ "blocks.14.areas.1.net.0.weight": "pytorch_model-00007-of-00012.bin",
290
+ "blocks.14.areas.1.net.2.bias": "pytorch_model-00007-of-00012.bin",
291
+ "blocks.14.areas.1.net.2.weight": "pytorch_model-00007-of-00012.bin",
292
+ "blocks.14.areas.2.net.0.bias": "pytorch_model-00007-of-00012.bin",
293
+ "blocks.14.areas.2.net.0.weight": "pytorch_model-00007-of-00012.bin",
294
+ "blocks.14.areas.2.net.2.bias": "pytorch_model-00007-of-00012.bin",
295
+ "blocks.14.areas.2.net.2.weight": "pytorch_model-00007-of-00012.bin",
296
+ "blocks.14.areas.3.net.0.bias": "pytorch_model-00007-of-00012.bin",
297
+ "blocks.14.areas.3.net.0.weight": "pytorch_model-00007-of-00012.bin",
298
+ "blocks.14.areas.3.net.2.bias": "pytorch_model-00007-of-00012.bin",
299
+ "blocks.14.areas.3.net.2.weight": "pytorch_model-00007-of-00012.bin",
300
+ "blocks.14.areas.4.net.0.bias": "pytorch_model-00007-of-00012.bin",
301
+ "blocks.14.areas.4.net.0.weight": "pytorch_model-00007-of-00012.bin",
302
+ "blocks.14.areas.4.net.2.bias": "pytorch_model-00007-of-00012.bin",
303
+ "blocks.14.areas.4.net.2.weight": "pytorch_model-00007-of-00012.bin",
304
+ "blocks.14.areas.5.net.0.bias": "pytorch_model-00007-of-00012.bin",
305
+ "blocks.14.areas.5.net.0.weight": "pytorch_model-00007-of-00012.bin",
306
+ "blocks.14.areas.5.net.2.bias": "pytorch_model-00007-of-00012.bin",
307
+ "blocks.14.areas.5.net.2.weight": "pytorch_model-00007-of-00012.bin",
308
+ "blocks.14.areas.6.net.0.bias": "pytorch_model-00007-of-00012.bin",
309
+ "blocks.14.areas.6.net.0.weight": "pytorch_model-00007-of-00012.bin",
310
+ "blocks.14.areas.6.net.2.bias": "pytorch_model-00007-of-00012.bin",
311
+ "blocks.14.areas.6.net.2.weight": "pytorch_model-00007-of-00012.bin",
312
+ "blocks.14.areas.7.net.0.bias": "pytorch_model-00007-of-00012.bin",
313
+ "blocks.14.areas.7.net.0.weight": "pytorch_model-00007-of-00012.bin",
314
+ "blocks.14.areas.7.net.2.bias": "pytorch_model-00007-of-00012.bin",
315
+ "blocks.14.areas.7.net.2.weight": "pytorch_model-00007-of-00012.bin",
316
+ "blocks.14.attn.c_attn.bias": "pytorch_model-00007-of-00012.bin",
317
+ "blocks.14.attn.c_attn.weight": "pytorch_model-00007-of-00012.bin",
318
+ "blocks.14.attn.c_proj.bias": "pytorch_model-00007-of-00012.bin",
319
+ "blocks.14.attn.c_proj.weight": "pytorch_model-00007-of-00012.bin",
320
+ "blocks.14.gate.0.bias": "pytorch_model-00007-of-00012.bin",
321
+ "blocks.14.gate.0.weight": "pytorch_model-00007-of-00012.bin",
322
+ "blocks.14.gate.2.bias": "pytorch_model-00007-of-00012.bin",
323
+ "blocks.14.gate.2.weight": "pytorch_model-00007-of-00012.bin",
324
+ "blocks.14.ln_1.bias": "pytorch_model-00007-of-00012.bin",
325
+ "blocks.14.ln_1.weight": "pytorch_model-00007-of-00012.bin",
326
+ "blocks.14.ln_2.bias": "pytorch_model-00007-of-00012.bin",
327
+ "blocks.14.ln_2.weight": "pytorch_model-00007-of-00012.bin",
328
+ "blocks.15.area_norm.bias": "pytorch_model-00008-of-00012.bin",
329
+ "blocks.15.area_norm.weight": "pytorch_model-00008-of-00012.bin",
330
+ "blocks.15.areas.0.net.0.bias": "pytorch_model-00008-of-00012.bin",
331
+ "blocks.15.areas.0.net.0.weight": "pytorch_model-00008-of-00012.bin",
332
+ "blocks.15.areas.0.net.2.bias": "pytorch_model-00008-of-00012.bin",
333
+ "blocks.15.areas.0.net.2.weight": "pytorch_model-00008-of-00012.bin",
334
+ "blocks.15.areas.1.net.0.bias": "pytorch_model-00008-of-00012.bin",
335
+ "blocks.15.areas.1.net.0.weight": "pytorch_model-00008-of-00012.bin",
336
+ "blocks.15.areas.1.net.2.bias": "pytorch_model-00008-of-00012.bin",
337
+ "blocks.15.areas.1.net.2.weight": "pytorch_model-00008-of-00012.bin",
338
+ "blocks.15.areas.2.net.0.bias": "pytorch_model-00008-of-00012.bin",
339
+ "blocks.15.areas.2.net.0.weight": "pytorch_model-00008-of-00012.bin",
340
+ "blocks.15.areas.2.net.2.bias": "pytorch_model-00008-of-00012.bin",
341
+ "blocks.15.areas.2.net.2.weight": "pytorch_model-00008-of-00012.bin",
342
+ "blocks.15.areas.3.net.0.bias": "pytorch_model-00008-of-00012.bin",
343
+ "blocks.15.areas.3.net.0.weight": "pytorch_model-00008-of-00012.bin",
344
+ "blocks.15.areas.3.net.2.bias": "pytorch_model-00008-of-00012.bin",
345
+ "blocks.15.areas.3.net.2.weight": "pytorch_model-00008-of-00012.bin",
346
+ "blocks.15.areas.4.net.0.bias": "pytorch_model-00008-of-00012.bin",
347
+ "blocks.15.areas.4.net.0.weight": "pytorch_model-00008-of-00012.bin",
348
+ "blocks.15.areas.4.net.2.bias": "pytorch_model-00008-of-00012.bin",
349
+ "blocks.15.areas.4.net.2.weight": "pytorch_model-00008-of-00012.bin",
350
+ "blocks.15.areas.5.net.0.bias": "pytorch_model-00008-of-00012.bin",
351
+ "blocks.15.areas.5.net.0.weight": "pytorch_model-00008-of-00012.bin",
352
+ "blocks.15.areas.5.net.2.bias": "pytorch_model-00008-of-00012.bin",
353
+ "blocks.15.areas.5.net.2.weight": "pytorch_model-00008-of-00012.bin",
354
+ "blocks.15.areas.6.net.0.bias": "pytorch_model-00008-of-00012.bin",
355
+ "blocks.15.areas.6.net.0.weight": "pytorch_model-00008-of-00012.bin",
356
+ "blocks.15.areas.6.net.2.bias": "pytorch_model-00008-of-00012.bin",
357
+ "blocks.15.areas.6.net.2.weight": "pytorch_model-00008-of-00012.bin",
358
+ "blocks.15.areas.7.net.0.bias": "pytorch_model-00008-of-00012.bin",
359
+ "blocks.15.areas.7.net.0.weight": "pytorch_model-00008-of-00012.bin",
360
+ "blocks.15.areas.7.net.2.bias": "pytorch_model-00008-of-00012.bin",
361
+ "blocks.15.areas.7.net.2.weight": "pytorch_model-00008-of-00012.bin",
362
+ "blocks.15.attn.c_attn.bias": "pytorch_model-00007-of-00012.bin",
363
+ "blocks.15.attn.c_attn.weight": "pytorch_model-00007-of-00012.bin",
364
+ "blocks.15.attn.c_proj.bias": "pytorch_model-00007-of-00012.bin",
365
+ "blocks.15.attn.c_proj.weight": "pytorch_model-00007-of-00012.bin",
366
+ "blocks.15.gate.0.bias": "pytorch_model-00008-of-00012.bin",
367
+ "blocks.15.gate.0.weight": "pytorch_model-00008-of-00012.bin",
368
+ "blocks.15.gate.2.bias": "pytorch_model-00008-of-00012.bin",
369
+ "blocks.15.gate.2.weight": "pytorch_model-00008-of-00012.bin",
370
+ "blocks.15.ln_1.bias": "pytorch_model-00007-of-00012.bin",
371
+ "blocks.15.ln_1.weight": "pytorch_model-00007-of-00012.bin",
372
+ "blocks.15.ln_2.bias": "pytorch_model-00007-of-00012.bin",
373
+ "blocks.15.ln_2.weight": "pytorch_model-00007-of-00012.bin",
374
+ "blocks.16.area_norm.bias": "pytorch_model-00008-of-00012.bin",
375
+ "blocks.16.area_norm.weight": "pytorch_model-00008-of-00012.bin",
376
+ "blocks.16.areas.0.net.0.bias": "pytorch_model-00008-of-00012.bin",
377
+ "blocks.16.areas.0.net.0.weight": "pytorch_model-00008-of-00012.bin",
378
+ "blocks.16.areas.0.net.2.bias": "pytorch_model-00008-of-00012.bin",
379
+ "blocks.16.areas.0.net.2.weight": "pytorch_model-00008-of-00012.bin",
380
+ "blocks.16.areas.1.net.0.bias": "pytorch_model-00008-of-00012.bin",
381
+ "blocks.16.areas.1.net.0.weight": "pytorch_model-00008-of-00012.bin",
382
+ "blocks.16.areas.1.net.2.bias": "pytorch_model-00008-of-00012.bin",
383
+ "blocks.16.areas.1.net.2.weight": "pytorch_model-00008-of-00012.bin",
384
+ "blocks.16.areas.2.net.0.bias": "pytorch_model-00008-of-00012.bin",
385
+ "blocks.16.areas.2.net.0.weight": "pytorch_model-00008-of-00012.bin",
386
+ "blocks.16.areas.2.net.2.bias": "pytorch_model-00008-of-00012.bin",
387
+ "blocks.16.areas.2.net.2.weight": "pytorch_model-00008-of-00012.bin",
388
+ "blocks.16.areas.3.net.0.bias": "pytorch_model-00008-of-00012.bin",
389
+ "blocks.16.areas.3.net.0.weight": "pytorch_model-00008-of-00012.bin",
390
+ "blocks.16.areas.3.net.2.bias": "pytorch_model-00008-of-00012.bin",
391
+ "blocks.16.areas.3.net.2.weight": "pytorch_model-00008-of-00012.bin",
392
+ "blocks.16.areas.4.net.0.bias": "pytorch_model-00008-of-00012.bin",
393
+ "blocks.16.areas.4.net.0.weight": "pytorch_model-00008-of-00012.bin",
394
+ "blocks.16.areas.4.net.2.bias": "pytorch_model-00008-of-00012.bin",
395
+ "blocks.16.areas.4.net.2.weight": "pytorch_model-00008-of-00012.bin",
396
+ "blocks.16.areas.5.net.0.bias": "pytorch_model-00008-of-00012.bin",
397
+ "blocks.16.areas.5.net.0.weight": "pytorch_model-00008-of-00012.bin",
398
+ "blocks.16.areas.5.net.2.bias": "pytorch_model-00008-of-00012.bin",
399
+ "blocks.16.areas.5.net.2.weight": "pytorch_model-00008-of-00012.bin",
400
+ "blocks.16.areas.6.net.0.bias": "pytorch_model-00008-of-00012.bin",
401
+ "blocks.16.areas.6.net.0.weight": "pytorch_model-00008-of-00012.bin",
402
+ "blocks.16.areas.6.net.2.bias": "pytorch_model-00008-of-00012.bin",
403
+ "blocks.16.areas.6.net.2.weight": "pytorch_model-00008-of-00012.bin",
404
+ "blocks.16.areas.7.net.0.bias": "pytorch_model-00008-of-00012.bin",
405
+ "blocks.16.areas.7.net.0.weight": "pytorch_model-00008-of-00012.bin",
406
+ "blocks.16.areas.7.net.2.bias": "pytorch_model-00008-of-00012.bin",
407
+ "blocks.16.areas.7.net.2.weight": "pytorch_model-00008-of-00012.bin",
408
+ "blocks.16.attn.c_attn.bias": "pytorch_model-00008-of-00012.bin",
409
+ "blocks.16.attn.c_attn.weight": "pytorch_model-00008-of-00012.bin",
410
+ "blocks.16.attn.c_proj.bias": "pytorch_model-00008-of-00012.bin",
411
+ "blocks.16.attn.c_proj.weight": "pytorch_model-00008-of-00012.bin",
412
+ "blocks.16.gate.0.bias": "pytorch_model-00008-of-00012.bin",
413
+ "blocks.16.gate.0.weight": "pytorch_model-00008-of-00012.bin",
414
+ "blocks.16.gate.2.bias": "pytorch_model-00008-of-00012.bin",
415
+ "blocks.16.gate.2.weight": "pytorch_model-00008-of-00012.bin",
416
+ "blocks.16.ln_1.bias": "pytorch_model-00008-of-00012.bin",
417
+ "blocks.16.ln_1.weight": "pytorch_model-00008-of-00012.bin",
418
+ "blocks.16.ln_2.bias": "pytorch_model-00008-of-00012.bin",
419
+ "blocks.16.ln_2.weight": "pytorch_model-00008-of-00012.bin",
420
+ "blocks.17.area_norm.bias": "pytorch_model-00009-of-00012.bin",
421
+ "blocks.17.area_norm.weight": "pytorch_model-00009-of-00012.bin",
422
+ "blocks.17.areas.0.net.0.bias": "pytorch_model-00008-of-00012.bin",
423
+ "blocks.17.areas.0.net.0.weight": "pytorch_model-00008-of-00012.bin",
424
+ "blocks.17.areas.0.net.2.bias": "pytorch_model-00008-of-00012.bin",
425
+ "blocks.17.areas.0.net.2.weight": "pytorch_model-00008-of-00012.bin",
426
+ "blocks.17.areas.1.net.0.bias": "pytorch_model-00008-of-00012.bin",
427
+ "blocks.17.areas.1.net.0.weight": "pytorch_model-00008-of-00012.bin",
428
+ "blocks.17.areas.1.net.2.bias": "pytorch_model-00008-of-00012.bin",
429
+ "blocks.17.areas.1.net.2.weight": "pytorch_model-00008-of-00012.bin",
430
+ "blocks.17.areas.2.net.0.bias": "pytorch_model-00009-of-00012.bin",
431
+ "blocks.17.areas.2.net.0.weight": "pytorch_model-00009-of-00012.bin",
432
+ "blocks.17.areas.2.net.2.bias": "pytorch_model-00009-of-00012.bin",
433
+ "blocks.17.areas.2.net.2.weight": "pytorch_model-00009-of-00012.bin",
434
+ "blocks.17.areas.3.net.0.bias": "pytorch_model-00009-of-00012.bin",
435
+ "blocks.17.areas.3.net.0.weight": "pytorch_model-00009-of-00012.bin",
436
+ "blocks.17.areas.3.net.2.bias": "pytorch_model-00009-of-00012.bin",
437
+ "blocks.17.areas.3.net.2.weight": "pytorch_model-00009-of-00012.bin",
438
+ "blocks.17.areas.4.net.0.bias": "pytorch_model-00009-of-00012.bin",
439
+ "blocks.17.areas.4.net.0.weight": "pytorch_model-00009-of-00012.bin",
440
+ "blocks.17.areas.4.net.2.bias": "pytorch_model-00009-of-00012.bin",
441
+ "blocks.17.areas.4.net.2.weight": "pytorch_model-00009-of-00012.bin",
442
+ "blocks.17.areas.5.net.0.bias": "pytorch_model-00009-of-00012.bin",
443
+ "blocks.17.areas.5.net.0.weight": "pytorch_model-00009-of-00012.bin",
444
+ "blocks.17.areas.5.net.2.bias": "pytorch_model-00009-of-00012.bin",
445
+ "blocks.17.areas.5.net.2.weight": "pytorch_model-00009-of-00012.bin",
446
+ "blocks.17.areas.6.net.0.bias": "pytorch_model-00009-of-00012.bin",
447
+ "blocks.17.areas.6.net.0.weight": "pytorch_model-00009-of-00012.bin",
448
+ "blocks.17.areas.6.net.2.bias": "pytorch_model-00009-of-00012.bin",
449
+ "blocks.17.areas.6.net.2.weight": "pytorch_model-00009-of-00012.bin",
450
+ "blocks.17.areas.7.net.0.bias": "pytorch_model-00009-of-00012.bin",
451
+ "blocks.17.areas.7.net.0.weight": "pytorch_model-00009-of-00012.bin",
452
+ "blocks.17.areas.7.net.2.bias": "pytorch_model-00009-of-00012.bin",
453
+ "blocks.17.areas.7.net.2.weight": "pytorch_model-00009-of-00012.bin",
454
+ "blocks.17.attn.c_attn.bias": "pytorch_model-00008-of-00012.bin",
455
+ "blocks.17.attn.c_attn.weight": "pytorch_model-00008-of-00012.bin",
456
+ "blocks.17.attn.c_proj.bias": "pytorch_model-00008-of-00012.bin",
457
+ "blocks.17.attn.c_proj.weight": "pytorch_model-00008-of-00012.bin",
458
+ "blocks.17.gate.0.bias": "pytorch_model-00009-of-00012.bin",
459
+ "blocks.17.gate.0.weight": "pytorch_model-00009-of-00012.bin",
460
+ "blocks.17.gate.2.bias": "pytorch_model-00009-of-00012.bin",
461
+ "blocks.17.gate.2.weight": "pytorch_model-00009-of-00012.bin",
462
+ "blocks.17.ln_1.bias": "pytorch_model-00008-of-00012.bin",
463
+ "blocks.17.ln_1.weight": "pytorch_model-00008-of-00012.bin",
464
+ "blocks.17.ln_2.bias": "pytorch_model-00008-of-00012.bin",
465
+ "blocks.17.ln_2.weight": "pytorch_model-00008-of-00012.bin",
466
+ "blocks.18.area_norm.bias": "pytorch_model-00009-of-00012.bin",
467
+ "blocks.18.area_norm.weight": "pytorch_model-00009-of-00012.bin",
468
+ "blocks.18.areas.0.net.0.bias": "pytorch_model-00009-of-00012.bin",
469
+ "blocks.18.areas.0.net.0.weight": "pytorch_model-00009-of-00012.bin",
470
+ "blocks.18.areas.0.net.2.bias": "pytorch_model-00009-of-00012.bin",
471
+ "blocks.18.areas.0.net.2.weight": "pytorch_model-00009-of-00012.bin",
472
+ "blocks.18.areas.1.net.0.bias": "pytorch_model-00009-of-00012.bin",
473
+ "blocks.18.areas.1.net.0.weight": "pytorch_model-00009-of-00012.bin",
474
+ "blocks.18.areas.1.net.2.bias": "pytorch_model-00009-of-00012.bin",
475
+ "blocks.18.areas.1.net.2.weight": "pytorch_model-00009-of-00012.bin",
476
+ "blocks.18.areas.2.net.0.bias": "pytorch_model-00009-of-00012.bin",
477
+ "blocks.18.areas.2.net.0.weight": "pytorch_model-00009-of-00012.bin",
478
+ "blocks.18.areas.2.net.2.bias": "pytorch_model-00009-of-00012.bin",
479
+ "blocks.18.areas.2.net.2.weight": "pytorch_model-00009-of-00012.bin",
480
+ "blocks.18.areas.3.net.0.bias": "pytorch_model-00009-of-00012.bin",
481
+ "blocks.18.areas.3.net.0.weight": "pytorch_model-00009-of-00012.bin",
482
+ "blocks.18.areas.3.net.2.bias": "pytorch_model-00009-of-00012.bin",
483
+ "blocks.18.areas.3.net.2.weight": "pytorch_model-00009-of-00012.bin",
484
+ "blocks.18.areas.4.net.0.bias": "pytorch_model-00009-of-00012.bin",
485
+ "blocks.18.areas.4.net.0.weight": "pytorch_model-00009-of-00012.bin",
486
+ "blocks.18.areas.4.net.2.bias": "pytorch_model-00009-of-00012.bin",
487
+ "blocks.18.areas.4.net.2.weight": "pytorch_model-00009-of-00012.bin",
488
+ "blocks.18.areas.5.net.0.bias": "pytorch_model-00009-of-00012.bin",
489
+ "blocks.18.areas.5.net.0.weight": "pytorch_model-00009-of-00012.bin",
490
+ "blocks.18.areas.5.net.2.bias": "pytorch_model-00009-of-00012.bin",
491
+ "blocks.18.areas.5.net.2.weight": "pytorch_model-00009-of-00012.bin",
492
+ "blocks.18.areas.6.net.0.bias": "pytorch_model-00009-of-00012.bin",
493
+ "blocks.18.areas.6.net.0.weight": "pytorch_model-00009-of-00012.bin",
494
+ "blocks.18.areas.6.net.2.bias": "pytorch_model-00009-of-00012.bin",
495
+ "blocks.18.areas.6.net.2.weight": "pytorch_model-00009-of-00012.bin",
496
+ "blocks.18.areas.7.net.0.bias": "pytorch_model-00009-of-00012.bin",
497
+ "blocks.18.areas.7.net.0.weight": "pytorch_model-00009-of-00012.bin",
498
+ "blocks.18.areas.7.net.2.bias": "pytorch_model-00009-of-00012.bin",
499
+ "blocks.18.areas.7.net.2.weight": "pytorch_model-00009-of-00012.bin",
500
+ "blocks.18.attn.c_attn.bias": "pytorch_model-00009-of-00012.bin",
501
+ "blocks.18.attn.c_attn.weight": "pytorch_model-00009-of-00012.bin",
502
+ "blocks.18.attn.c_proj.bias": "pytorch_model-00009-of-00012.bin",
503
+ "blocks.18.attn.c_proj.weight": "pytorch_model-00009-of-00012.bin",
504
+ "blocks.18.gate.0.bias": "pytorch_model-00009-of-00012.bin",
505
+ "blocks.18.gate.0.weight": "pytorch_model-00009-of-00012.bin",
506
+ "blocks.18.gate.2.bias": "pytorch_model-00009-of-00012.bin",
507
+ "blocks.18.gate.2.weight": "pytorch_model-00009-of-00012.bin",
508
+ "blocks.18.ln_1.bias": "pytorch_model-00009-of-00012.bin",
509
+ "blocks.18.ln_1.weight": "pytorch_model-00009-of-00012.bin",
510
+ "blocks.18.ln_2.bias": "pytorch_model-00009-of-00012.bin",
511
+ "blocks.18.ln_2.weight": "pytorch_model-00009-of-00012.bin",
512
+ "blocks.19.area_norm.bias": "pytorch_model-00010-of-00012.bin",
513
+ "blocks.19.area_norm.weight": "pytorch_model-00010-of-00012.bin",
514
+ "blocks.19.areas.0.net.0.bias": "pytorch_model-00009-of-00012.bin",
515
+ "blocks.19.areas.0.net.0.weight": "pytorch_model-00009-of-00012.bin",
516
+ "blocks.19.areas.0.net.2.bias": "pytorch_model-00009-of-00012.bin",
517
+ "blocks.19.areas.0.net.2.weight": "pytorch_model-00009-of-00012.bin",
518
+ "blocks.19.areas.1.net.0.bias": "pytorch_model-00009-of-00012.bin",
519
+ "blocks.19.areas.1.net.0.weight": "pytorch_model-00009-of-00012.bin",
520
+ "blocks.19.areas.1.net.2.bias": "pytorch_model-00009-of-00012.bin",
521
+ "blocks.19.areas.1.net.2.weight": "pytorch_model-00009-of-00012.bin",
522
+ "blocks.19.areas.2.net.0.bias": "pytorch_model-00009-of-00012.bin",
523
+ "blocks.19.areas.2.net.0.weight": "pytorch_model-00009-of-00012.bin",
524
+ "blocks.19.areas.2.net.2.bias": "pytorch_model-00009-of-00012.bin",
525
+ "blocks.19.areas.2.net.2.weight": "pytorch_model-00009-of-00012.bin",
526
+ "blocks.19.areas.3.net.0.bias": "pytorch_model-00009-of-00012.bin",
527
+ "blocks.19.areas.3.net.0.weight": "pytorch_model-00009-of-00012.bin",
528
+ "blocks.19.areas.3.net.2.bias": "pytorch_model-00009-of-00012.bin",
529
+ "blocks.19.areas.3.net.2.weight": "pytorch_model-00009-of-00012.bin",
530
+ "blocks.19.areas.4.net.0.bias": "pytorch_model-00010-of-00012.bin",
531
+ "blocks.19.areas.4.net.0.weight": "pytorch_model-00010-of-00012.bin",
532
+ "blocks.19.areas.4.net.2.bias": "pytorch_model-00010-of-00012.bin",
533
+ "blocks.19.areas.4.net.2.weight": "pytorch_model-00010-of-00012.bin",
534
+ "blocks.19.areas.5.net.0.bias": "pytorch_model-00010-of-00012.bin",
535
+ "blocks.19.areas.5.net.0.weight": "pytorch_model-00010-of-00012.bin",
536
+ "blocks.19.areas.5.net.2.bias": "pytorch_model-00010-of-00012.bin",
537
+ "blocks.19.areas.5.net.2.weight": "pytorch_model-00010-of-00012.bin",
538
+ "blocks.19.areas.6.net.0.bias": "pytorch_model-00010-of-00012.bin",
539
+ "blocks.19.areas.6.net.0.weight": "pytorch_model-00010-of-00012.bin",
540
+ "blocks.19.areas.6.net.2.bias": "pytorch_model-00010-of-00012.bin",
541
+ "blocks.19.areas.6.net.2.weight": "pytorch_model-00010-of-00012.bin",
542
+ "blocks.19.areas.7.net.0.bias": "pytorch_model-00010-of-00012.bin",
543
+ "blocks.19.areas.7.net.0.weight": "pytorch_model-00010-of-00012.bin",
544
+ "blocks.19.areas.7.net.2.bias": "pytorch_model-00010-of-00012.bin",
545
+ "blocks.19.areas.7.net.2.weight": "pytorch_model-00010-of-00012.bin",
546
+ "blocks.19.attn.c_attn.bias": "pytorch_model-00009-of-00012.bin",
547
+ "blocks.19.attn.c_attn.weight": "pytorch_model-00009-of-00012.bin",
548
+ "blocks.19.attn.c_proj.bias": "pytorch_model-00009-of-00012.bin",
549
+ "blocks.19.attn.c_proj.weight": "pytorch_model-00009-of-00012.bin",
550
+ "blocks.19.gate.0.bias": "pytorch_model-00010-of-00012.bin",
551
+ "blocks.19.gate.0.weight": "pytorch_model-00010-of-00012.bin",
552
+ "blocks.19.gate.2.bias": "pytorch_model-00010-of-00012.bin",
553
+ "blocks.19.gate.2.weight": "pytorch_model-00010-of-00012.bin",
554
+ "blocks.19.ln_1.bias": "pytorch_model-00009-of-00012.bin",
555
+ "blocks.19.ln_1.weight": "pytorch_model-00009-of-00012.bin",
556
+ "blocks.19.ln_2.bias": "pytorch_model-00009-of-00012.bin",
557
+ "blocks.19.ln_2.weight": "pytorch_model-00009-of-00012.bin",
558
+ "blocks.2.area_norm.bias": "pytorch_model-00002-of-00012.bin",
559
+ "blocks.2.area_norm.weight": "pytorch_model-00002-of-00012.bin",
560
+ "blocks.2.areas.0.net.0.bias": "pytorch_model-00002-of-00012.bin",
561
+ "blocks.2.areas.0.net.0.weight": "pytorch_model-00002-of-00012.bin",
562
+ "blocks.2.areas.0.net.2.bias": "pytorch_model-00002-of-00012.bin",
563
+ "blocks.2.areas.0.net.2.weight": "pytorch_model-00002-of-00012.bin",
564
+ "blocks.2.areas.1.net.0.bias": "pytorch_model-00002-of-00012.bin",
565
+ "blocks.2.areas.1.net.0.weight": "pytorch_model-00002-of-00012.bin",
566
+ "blocks.2.areas.1.net.2.bias": "pytorch_model-00002-of-00012.bin",
567
+ "blocks.2.areas.1.net.2.weight": "pytorch_model-00002-of-00012.bin",
568
+ "blocks.2.areas.2.net.0.bias": "pytorch_model-00002-of-00012.bin",
569
+ "blocks.2.areas.2.net.0.weight": "pytorch_model-00002-of-00012.bin",
570
+ "blocks.2.areas.2.net.2.bias": "pytorch_model-00002-of-00012.bin",
571
+ "blocks.2.areas.2.net.2.weight": "pytorch_model-00002-of-00012.bin",
572
+ "blocks.2.areas.3.net.0.bias": "pytorch_model-00002-of-00012.bin",
573
+ "blocks.2.areas.3.net.0.weight": "pytorch_model-00002-of-00012.bin",
574
+ "blocks.2.areas.3.net.2.bias": "pytorch_model-00002-of-00012.bin",
575
+ "blocks.2.areas.3.net.2.weight": "pytorch_model-00002-of-00012.bin",
576
+ "blocks.2.areas.4.net.0.bias": "pytorch_model-00002-of-00012.bin",
577
+ "blocks.2.areas.4.net.0.weight": "pytorch_model-00002-of-00012.bin",
578
+ "blocks.2.areas.4.net.2.bias": "pytorch_model-00002-of-00012.bin",
579
+ "blocks.2.areas.4.net.2.weight": "pytorch_model-00002-of-00012.bin",
580
+ "blocks.2.areas.5.net.0.bias": "pytorch_model-00002-of-00012.bin",
581
+ "blocks.2.areas.5.net.0.weight": "pytorch_model-00002-of-00012.bin",
582
+ "blocks.2.areas.5.net.2.bias": "pytorch_model-00002-of-00012.bin",
583
+ "blocks.2.areas.5.net.2.weight": "pytorch_model-00002-of-00012.bin",
584
+ "blocks.2.areas.6.net.0.bias": "pytorch_model-00002-of-00012.bin",
585
+ "blocks.2.areas.6.net.0.weight": "pytorch_model-00002-of-00012.bin",
586
+ "blocks.2.areas.6.net.2.bias": "pytorch_model-00002-of-00012.bin",
587
+ "blocks.2.areas.6.net.2.weight": "pytorch_model-00002-of-00012.bin",
588
+ "blocks.2.areas.7.net.0.bias": "pytorch_model-00002-of-00012.bin",
589
+ "blocks.2.areas.7.net.0.weight": "pytorch_model-00002-of-00012.bin",
590
+ "blocks.2.areas.7.net.2.bias": "pytorch_model-00002-of-00012.bin",
591
+ "blocks.2.areas.7.net.2.weight": "pytorch_model-00002-of-00012.bin",
592
+ "blocks.2.attn.c_attn.bias": "pytorch_model-00002-of-00012.bin",
593
+ "blocks.2.attn.c_attn.weight": "pytorch_model-00002-of-00012.bin",
594
+ "blocks.2.attn.c_proj.bias": "pytorch_model-00002-of-00012.bin",
595
+ "blocks.2.attn.c_proj.weight": "pytorch_model-00002-of-00012.bin",
596
+ "blocks.2.gate.0.bias": "pytorch_model-00002-of-00012.bin",
597
+ "blocks.2.gate.0.weight": "pytorch_model-00002-of-00012.bin",
598
+ "blocks.2.gate.2.bias": "pytorch_model-00002-of-00012.bin",
599
+ "blocks.2.gate.2.weight": "pytorch_model-00002-of-00012.bin",
600
+ "blocks.2.ln_1.bias": "pytorch_model-00002-of-00012.bin",
601
+ "blocks.2.ln_1.weight": "pytorch_model-00002-of-00012.bin",
602
+ "blocks.2.ln_2.bias": "pytorch_model-00002-of-00012.bin",
603
+ "blocks.2.ln_2.weight": "pytorch_model-00002-of-00012.bin",
604
+ "blocks.20.area_norm.bias": "pytorch_model-00010-of-00012.bin",
605
+ "blocks.20.area_norm.weight": "pytorch_model-00010-of-00012.bin",
606
+ "blocks.20.areas.0.net.0.bias": "pytorch_model-00010-of-00012.bin",
607
+ "blocks.20.areas.0.net.0.weight": "pytorch_model-00010-of-00012.bin",
608
+ "blocks.20.areas.0.net.2.bias": "pytorch_model-00010-of-00012.bin",
609
+ "blocks.20.areas.0.net.2.weight": "pytorch_model-00010-of-00012.bin",
610
+ "blocks.20.areas.1.net.0.bias": "pytorch_model-00010-of-00012.bin",
611
+ "blocks.20.areas.1.net.0.weight": "pytorch_model-00010-of-00012.bin",
612
+ "blocks.20.areas.1.net.2.bias": "pytorch_model-00010-of-00012.bin",
613
+ "blocks.20.areas.1.net.2.weight": "pytorch_model-00010-of-00012.bin",
614
+ "blocks.20.areas.2.net.0.bias": "pytorch_model-00010-of-00012.bin",
615
+ "blocks.20.areas.2.net.0.weight": "pytorch_model-00010-of-00012.bin",
616
+ "blocks.20.areas.2.net.2.bias": "pytorch_model-00010-of-00012.bin",
617
+ "blocks.20.areas.2.net.2.weight": "pytorch_model-00010-of-00012.bin",
618
+ "blocks.20.areas.3.net.0.bias": "pytorch_model-00010-of-00012.bin",
619
+ "blocks.20.areas.3.net.0.weight": "pytorch_model-00010-of-00012.bin",
620
+ "blocks.20.areas.3.net.2.bias": "pytorch_model-00010-of-00012.bin",
621
+ "blocks.20.areas.3.net.2.weight": "pytorch_model-00010-of-00012.bin",
622
+ "blocks.20.areas.4.net.0.bias": "pytorch_model-00010-of-00012.bin",
623
+ "blocks.20.areas.4.net.0.weight": "pytorch_model-00010-of-00012.bin",
624
+ "blocks.20.areas.4.net.2.bias": "pytorch_model-00010-of-00012.bin",
625
+ "blocks.20.areas.4.net.2.weight": "pytorch_model-00010-of-00012.bin",
626
+ "blocks.20.areas.5.net.0.bias": "pytorch_model-00010-of-00012.bin",
627
+ "blocks.20.areas.5.net.0.weight": "pytorch_model-00010-of-00012.bin",
628
+ "blocks.20.areas.5.net.2.bias": "pytorch_model-00010-of-00012.bin",
629
+ "blocks.20.areas.5.net.2.weight": "pytorch_model-00010-of-00012.bin",
630
+ "blocks.20.areas.6.net.0.bias": "pytorch_model-00010-of-00012.bin",
631
+ "blocks.20.areas.6.net.0.weight": "pytorch_model-00010-of-00012.bin",
632
+ "blocks.20.areas.6.net.2.bias": "pytorch_model-00010-of-00012.bin",
633
+ "blocks.20.areas.6.net.2.weight": "pytorch_model-00010-of-00012.bin",
634
+ "blocks.20.areas.7.net.0.bias": "pytorch_model-00010-of-00012.bin",
635
+ "blocks.20.areas.7.net.0.weight": "pytorch_model-00010-of-00012.bin",
636
+ "blocks.20.areas.7.net.2.bias": "pytorch_model-00010-of-00012.bin",
637
+ "blocks.20.areas.7.net.2.weight": "pytorch_model-00010-of-00012.bin",
638
+ "blocks.20.attn.c_attn.bias": "pytorch_model-00010-of-00012.bin",
639
+ "blocks.20.attn.c_attn.weight": "pytorch_model-00010-of-00012.bin",
640
+ "blocks.20.attn.c_proj.bias": "pytorch_model-00010-of-00012.bin",
641
+ "blocks.20.attn.c_proj.weight": "pytorch_model-00010-of-00012.bin",
642
+ "blocks.20.gate.0.bias": "pytorch_model-00010-of-00012.bin",
643
+ "blocks.20.gate.0.weight": "pytorch_model-00010-of-00012.bin",
644
+ "blocks.20.gate.2.bias": "pytorch_model-00010-of-00012.bin",
645
+ "blocks.20.gate.2.weight": "pytorch_model-00010-of-00012.bin",
646
+ "blocks.20.ln_1.bias": "pytorch_model-00010-of-00012.bin",
647
+ "blocks.20.ln_1.weight": "pytorch_model-00010-of-00012.bin",
648
+ "blocks.20.ln_2.bias": "pytorch_model-00010-of-00012.bin",
649
+ "blocks.20.ln_2.weight": "pytorch_model-00010-of-00012.bin",
650
+ "blocks.21.area_norm.bias": "pytorch_model-00011-of-00012.bin",
651
+ "blocks.21.area_norm.weight": "pytorch_model-00011-of-00012.bin",
652
+ "blocks.21.areas.0.net.0.bias": "pytorch_model-00010-of-00012.bin",
653
+ "blocks.21.areas.0.net.0.weight": "pytorch_model-00010-of-00012.bin",
654
+ "blocks.21.areas.0.net.2.bias": "pytorch_model-00010-of-00012.bin",
655
+ "blocks.21.areas.0.net.2.weight": "pytorch_model-00010-of-00012.bin",
656
+ "blocks.21.areas.1.net.0.bias": "pytorch_model-00010-of-00012.bin",
657
+ "blocks.21.areas.1.net.0.weight": "pytorch_model-00010-of-00012.bin",
658
+ "blocks.21.areas.1.net.2.bias": "pytorch_model-00010-of-00012.bin",
659
+ "blocks.21.areas.1.net.2.weight": "pytorch_model-00010-of-00012.bin",
660
+ "blocks.21.areas.2.net.0.bias": "pytorch_model-00010-of-00012.bin",
661
+ "blocks.21.areas.2.net.0.weight": "pytorch_model-00010-of-00012.bin",
662
+ "blocks.21.areas.2.net.2.bias": "pytorch_model-00010-of-00012.bin",
663
+ "blocks.21.areas.2.net.2.weight": "pytorch_model-00010-of-00012.bin",
664
+ "blocks.21.areas.3.net.0.bias": "pytorch_model-00010-of-00012.bin",
665
+ "blocks.21.areas.3.net.0.weight": "pytorch_model-00010-of-00012.bin",
666
+ "blocks.21.areas.3.net.2.bias": "pytorch_model-00010-of-00012.bin",
667
+ "blocks.21.areas.3.net.2.weight": "pytorch_model-00010-of-00012.bin",
668
+ "blocks.21.areas.4.net.0.bias": "pytorch_model-00010-of-00012.bin",
669
+ "blocks.21.areas.4.net.0.weight": "pytorch_model-00010-of-00012.bin",
670
+ "blocks.21.areas.4.net.2.bias": "pytorch_model-00010-of-00012.bin",
671
+ "blocks.21.areas.4.net.2.weight": "pytorch_model-00010-of-00012.bin",
672
+ "blocks.21.areas.5.net.0.bias": "pytorch_model-00010-of-00012.bin",
673
+ "blocks.21.areas.5.net.0.weight": "pytorch_model-00010-of-00012.bin",
674
+ "blocks.21.areas.5.net.2.bias": "pytorch_model-00010-of-00012.bin",
675
+ "blocks.21.areas.5.net.2.weight": "pytorch_model-00010-of-00012.bin",
676
+ "blocks.21.areas.6.net.0.bias": "pytorch_model-00011-of-00012.bin",
677
+ "blocks.21.areas.6.net.0.weight": "pytorch_model-00011-of-00012.bin",
678
+ "blocks.21.areas.6.net.2.bias": "pytorch_model-00011-of-00012.bin",
679
+ "blocks.21.areas.6.net.2.weight": "pytorch_model-00011-of-00012.bin",
680
+ "blocks.21.areas.7.net.0.bias": "pytorch_model-00011-of-00012.bin",
681
+ "blocks.21.areas.7.net.0.weight": "pytorch_model-00011-of-00012.bin",
682
+ "blocks.21.areas.7.net.2.bias": "pytorch_model-00011-of-00012.bin",
683
+ "blocks.21.areas.7.net.2.weight": "pytorch_model-00011-of-00012.bin",
684
+ "blocks.21.attn.c_attn.bias": "pytorch_model-00010-of-00012.bin",
685
+ "blocks.21.attn.c_attn.weight": "pytorch_model-00010-of-00012.bin",
686
+ "blocks.21.attn.c_proj.bias": "pytorch_model-00010-of-00012.bin",
687
+ "blocks.21.attn.c_proj.weight": "pytorch_model-00010-of-00012.bin",
688
+ "blocks.21.gate.0.bias": "pytorch_model-00011-of-00012.bin",
689
+ "blocks.21.gate.0.weight": "pytorch_model-00011-of-00012.bin",
690
+ "blocks.21.gate.2.bias": "pytorch_model-00011-of-00012.bin",
691
+ "blocks.21.gate.2.weight": "pytorch_model-00011-of-00012.bin",
692
+ "blocks.21.ln_1.bias": "pytorch_model-00010-of-00012.bin",
693
+ "blocks.21.ln_1.weight": "pytorch_model-00010-of-00012.bin",
694
+ "blocks.21.ln_2.bias": "pytorch_model-00010-of-00012.bin",
695
+ "blocks.21.ln_2.weight": "pytorch_model-00010-of-00012.bin",
696
+ "blocks.22.area_norm.bias": "pytorch_model-00011-of-00012.bin",
697
+ "blocks.22.area_norm.weight": "pytorch_model-00011-of-00012.bin",
698
+ "blocks.22.areas.0.net.0.bias": "pytorch_model-00011-of-00012.bin",
699
+ "blocks.22.areas.0.net.0.weight": "pytorch_model-00011-of-00012.bin",
700
+ "blocks.22.areas.0.net.2.bias": "pytorch_model-00011-of-00012.bin",
701
+ "blocks.22.areas.0.net.2.weight": "pytorch_model-00011-of-00012.bin",
702
+ "blocks.22.areas.1.net.0.bias": "pytorch_model-00011-of-00012.bin",
703
+ "blocks.22.areas.1.net.0.weight": "pytorch_model-00011-of-00012.bin",
704
+ "blocks.22.areas.1.net.2.bias": "pytorch_model-00011-of-00012.bin",
705
+ "blocks.22.areas.1.net.2.weight": "pytorch_model-00011-of-00012.bin",
706
+ "blocks.22.areas.2.net.0.bias": "pytorch_model-00011-of-00012.bin",
707
+ "blocks.22.areas.2.net.0.weight": "pytorch_model-00011-of-00012.bin",
708
+ "blocks.22.areas.2.net.2.bias": "pytorch_model-00011-of-00012.bin",
709
+ "blocks.22.areas.2.net.2.weight": "pytorch_model-00011-of-00012.bin",
710
+ "blocks.22.areas.3.net.0.bias": "pytorch_model-00011-of-00012.bin",
711
+ "blocks.22.areas.3.net.0.weight": "pytorch_model-00011-of-00012.bin",
712
+ "blocks.22.areas.3.net.2.bias": "pytorch_model-00011-of-00012.bin",
713
+ "blocks.22.areas.3.net.2.weight": "pytorch_model-00011-of-00012.bin",
714
+ "blocks.22.areas.4.net.0.bias": "pytorch_model-00011-of-00012.bin",
715
+ "blocks.22.areas.4.net.0.weight": "pytorch_model-00011-of-00012.bin",
716
+ "blocks.22.areas.4.net.2.bias": "pytorch_model-00011-of-00012.bin",
717
+ "blocks.22.areas.4.net.2.weight": "pytorch_model-00011-of-00012.bin",
718
+ "blocks.22.areas.5.net.0.bias": "pytorch_model-00011-of-00012.bin",
719
+ "blocks.22.areas.5.net.0.weight": "pytorch_model-00011-of-00012.bin",
720
+ "blocks.22.areas.5.net.2.bias": "pytorch_model-00011-of-00012.bin",
721
+ "blocks.22.areas.5.net.2.weight": "pytorch_model-00011-of-00012.bin",
722
+ "blocks.22.areas.6.net.0.bias": "pytorch_model-00011-of-00012.bin",
723
+ "blocks.22.areas.6.net.0.weight": "pytorch_model-00011-of-00012.bin",
724
+ "blocks.22.areas.6.net.2.bias": "pytorch_model-00011-of-00012.bin",
725
+ "blocks.22.areas.6.net.2.weight": "pytorch_model-00011-of-00012.bin",
726
+ "blocks.22.areas.7.net.0.bias": "pytorch_model-00011-of-00012.bin",
727
+ "blocks.22.areas.7.net.0.weight": "pytorch_model-00011-of-00012.bin",
728
+ "blocks.22.areas.7.net.2.bias": "pytorch_model-00011-of-00012.bin",
729
+ "blocks.22.areas.7.net.2.weight": "pytorch_model-00011-of-00012.bin",
730
+ "blocks.22.attn.c_attn.bias": "pytorch_model-00011-of-00012.bin",
731
+ "blocks.22.attn.c_attn.weight": "pytorch_model-00011-of-00012.bin",
732
+ "blocks.22.attn.c_proj.bias": "pytorch_model-00011-of-00012.bin",
733
+ "blocks.22.attn.c_proj.weight": "pytorch_model-00011-of-00012.bin",
734
+ "blocks.22.gate.0.bias": "pytorch_model-00011-of-00012.bin",
735
+ "blocks.22.gate.0.weight": "pytorch_model-00011-of-00012.bin",
736
+ "blocks.22.gate.2.bias": "pytorch_model-00011-of-00012.bin",
737
+ "blocks.22.gate.2.weight": "pytorch_model-00011-of-00012.bin",
738
+ "blocks.22.ln_1.bias": "pytorch_model-00011-of-00012.bin",
739
+ "blocks.22.ln_1.weight": "pytorch_model-00011-of-00012.bin",
740
+ "blocks.22.ln_2.bias": "pytorch_model-00011-of-00012.bin",
741
+ "blocks.22.ln_2.weight": "pytorch_model-00011-of-00012.bin",
742
+ "blocks.23.area_norm.bias": "pytorch_model-00011-of-00012.bin",
743
+ "blocks.23.area_norm.weight": "pytorch_model-00011-of-00012.bin",
744
+ "blocks.23.areas.0.net.0.bias": "pytorch_model-00011-of-00012.bin",
745
+ "blocks.23.areas.0.net.0.weight": "pytorch_model-00011-of-00012.bin",
746
+ "blocks.23.areas.0.net.2.bias": "pytorch_model-00011-of-00012.bin",
747
+ "blocks.23.areas.0.net.2.weight": "pytorch_model-00011-of-00012.bin",
748
+ "blocks.23.areas.1.net.0.bias": "pytorch_model-00011-of-00012.bin",
749
+ "blocks.23.areas.1.net.0.weight": "pytorch_model-00011-of-00012.bin",
750
+ "blocks.23.areas.1.net.2.bias": "pytorch_model-00011-of-00012.bin",
751
+ "blocks.23.areas.1.net.2.weight": "pytorch_model-00011-of-00012.bin",
752
+ "blocks.23.areas.2.net.0.bias": "pytorch_model-00011-of-00012.bin",
753
+ "blocks.23.areas.2.net.0.weight": "pytorch_model-00011-of-00012.bin",
754
+ "blocks.23.areas.2.net.2.bias": "pytorch_model-00011-of-00012.bin",
755
+ "blocks.23.areas.2.net.2.weight": "pytorch_model-00011-of-00012.bin",
756
+ "blocks.23.areas.3.net.0.bias": "pytorch_model-00011-of-00012.bin",
757
+ "blocks.23.areas.3.net.0.weight": "pytorch_model-00011-of-00012.bin",
758
+ "blocks.23.areas.3.net.2.bias": "pytorch_model-00011-of-00012.bin",
759
+ "blocks.23.areas.3.net.2.weight": "pytorch_model-00011-of-00012.bin",
760
+ "blocks.23.areas.4.net.0.bias": "pytorch_model-00011-of-00012.bin",
761
+ "blocks.23.areas.4.net.0.weight": "pytorch_model-00011-of-00012.bin",
762
+ "blocks.23.areas.4.net.2.bias": "pytorch_model-00011-of-00012.bin",
763
+ "blocks.23.areas.4.net.2.weight": "pytorch_model-00011-of-00012.bin",
764
+ "blocks.23.areas.5.net.0.bias": "pytorch_model-00011-of-00012.bin",
765
+ "blocks.23.areas.5.net.0.weight": "pytorch_model-00011-of-00012.bin",
766
+ "blocks.23.areas.5.net.2.bias": "pytorch_model-00011-of-00012.bin",
767
+ "blocks.23.areas.5.net.2.weight": "pytorch_model-00011-of-00012.bin",
768
+ "blocks.23.areas.6.net.0.bias": "pytorch_model-00011-of-00012.bin",
769
+ "blocks.23.areas.6.net.0.weight": "pytorch_model-00011-of-00012.bin",
770
+ "blocks.23.areas.6.net.2.bias": "pytorch_model-00011-of-00012.bin",
771
+ "blocks.23.areas.6.net.2.weight": "pytorch_model-00011-of-00012.bin",
772
+ "blocks.23.areas.7.net.0.bias": "pytorch_model-00011-of-00012.bin",
773
+ "blocks.23.areas.7.net.0.weight": "pytorch_model-00011-of-00012.bin",
774
+ "blocks.23.areas.7.net.2.bias": "pytorch_model-00011-of-00012.bin",
775
+ "blocks.23.areas.7.net.2.weight": "pytorch_model-00011-of-00012.bin",
776
+ "blocks.23.attn.c_attn.bias": "pytorch_model-00011-of-00012.bin",
777
+ "blocks.23.attn.c_attn.weight": "pytorch_model-00011-of-00012.bin",
778
+ "blocks.23.attn.c_proj.bias": "pytorch_model-00011-of-00012.bin",
779
+ "blocks.23.attn.c_proj.weight": "pytorch_model-00011-of-00012.bin",
780
+ "blocks.23.gate.0.bias": "pytorch_model-00011-of-00012.bin",
781
+ "blocks.23.gate.0.weight": "pytorch_model-00011-of-00012.bin",
782
+ "blocks.23.gate.2.bias": "pytorch_model-00011-of-00012.bin",
783
+ "blocks.23.gate.2.weight": "pytorch_model-00011-of-00012.bin",
784
+ "blocks.23.ln_1.bias": "pytorch_model-00011-of-00012.bin",
785
+ "blocks.23.ln_1.weight": "pytorch_model-00011-of-00012.bin",
786
+ "blocks.23.ln_2.bias": "pytorch_model-00011-of-00012.bin",
787
+ "blocks.23.ln_2.weight": "pytorch_model-00011-of-00012.bin",
788
+ "blocks.3.area_norm.bias": "pytorch_model-00003-of-00012.bin",
789
+ "blocks.3.area_norm.weight": "pytorch_model-00003-of-00012.bin",
790
+ "blocks.3.areas.0.net.0.bias": "pytorch_model-00002-of-00012.bin",
791
+ "blocks.3.areas.0.net.0.weight": "pytorch_model-00002-of-00012.bin",
792
+ "blocks.3.areas.0.net.2.bias": "pytorch_model-00002-of-00012.bin",
793
+ "blocks.3.areas.0.net.2.weight": "pytorch_model-00002-of-00012.bin",
794
+ "blocks.3.areas.1.net.0.bias": "pytorch_model-00002-of-00012.bin",
795
+ "blocks.3.areas.1.net.0.weight": "pytorch_model-00002-of-00012.bin",
796
+ "blocks.3.areas.1.net.2.bias": "pytorch_model-00002-of-00012.bin",
797
+ "blocks.3.areas.1.net.2.weight": "pytorch_model-00002-of-00012.bin",
798
+ "blocks.3.areas.2.net.0.bias": "pytorch_model-00002-of-00012.bin",
799
+ "blocks.3.areas.2.net.0.weight": "pytorch_model-00002-of-00012.bin",
800
+ "blocks.3.areas.2.net.2.bias": "pytorch_model-00002-of-00012.bin",
801
+ "blocks.3.areas.2.net.2.weight": "pytorch_model-00002-of-00012.bin",
802
+ "blocks.3.areas.3.net.0.bias": "pytorch_model-00002-of-00012.bin",
803
+ "blocks.3.areas.3.net.0.weight": "pytorch_model-00002-of-00012.bin",
804
+ "blocks.3.areas.3.net.2.bias": "pytorch_model-00002-of-00012.bin",
805
+ "blocks.3.areas.3.net.2.weight": "pytorch_model-00002-of-00012.bin",
806
+ "blocks.3.areas.4.net.0.bias": "pytorch_model-00002-of-00012.bin",
807
+ "blocks.3.areas.4.net.0.weight": "pytorch_model-00002-of-00012.bin",
808
+ "blocks.3.areas.4.net.2.bias": "pytorch_model-00002-of-00012.bin",
809
+ "blocks.3.areas.4.net.2.weight": "pytorch_model-00002-of-00012.bin",
810
+ "blocks.3.areas.5.net.0.bias": "pytorch_model-00002-of-00012.bin",
811
+ "blocks.3.areas.5.net.0.weight": "pytorch_model-00002-of-00012.bin",
812
+ "blocks.3.areas.5.net.2.bias": "pytorch_model-00002-of-00012.bin",
813
+ "blocks.3.areas.5.net.2.weight": "pytorch_model-00002-of-00012.bin",
814
+ "blocks.3.areas.6.net.0.bias": "pytorch_model-00002-of-00012.bin",
815
+ "blocks.3.areas.6.net.0.weight": "pytorch_model-00002-of-00012.bin",
816
+ "blocks.3.areas.6.net.2.bias": "pytorch_model-00002-of-00012.bin",
817
+ "blocks.3.areas.6.net.2.weight": "pytorch_model-00002-of-00012.bin",
818
+ "blocks.3.areas.7.net.0.bias": "pytorch_model-00003-of-00012.bin",
819
+ "blocks.3.areas.7.net.0.weight": "pytorch_model-00003-of-00012.bin",
820
+ "blocks.3.areas.7.net.2.bias": "pytorch_model-00003-of-00012.bin",
821
+ "blocks.3.areas.7.net.2.weight": "pytorch_model-00003-of-00012.bin",
822
+ "blocks.3.attn.c_attn.bias": "pytorch_model-00002-of-00012.bin",
823
+ "blocks.3.attn.c_attn.weight": "pytorch_model-00002-of-00012.bin",
824
+ "blocks.3.attn.c_proj.bias": "pytorch_model-00002-of-00012.bin",
825
+ "blocks.3.attn.c_proj.weight": "pytorch_model-00002-of-00012.bin",
826
+ "blocks.3.gate.0.bias": "pytorch_model-00003-of-00012.bin",
827
+ "blocks.3.gate.0.weight": "pytorch_model-00003-of-00012.bin",
828
+ "blocks.3.gate.2.bias": "pytorch_model-00003-of-00012.bin",
829
+ "blocks.3.gate.2.weight": "pytorch_model-00003-of-00012.bin",
830
+ "blocks.3.ln_1.bias": "pytorch_model-00002-of-00012.bin",
831
+ "blocks.3.ln_1.weight": "pytorch_model-00002-of-00012.bin",
832
+ "blocks.3.ln_2.bias": "pytorch_model-00002-of-00012.bin",
833
+ "blocks.3.ln_2.weight": "pytorch_model-00002-of-00012.bin",
834
+ "blocks.4.area_norm.bias": "pytorch_model-00003-of-00012.bin",
835
+ "blocks.4.area_norm.weight": "pytorch_model-00003-of-00012.bin",
836
+ "blocks.4.areas.0.net.0.bias": "pytorch_model-00003-of-00012.bin",
837
+ "blocks.4.areas.0.net.0.weight": "pytorch_model-00003-of-00012.bin",
838
+ "blocks.4.areas.0.net.2.bias": "pytorch_model-00003-of-00012.bin",
839
+ "blocks.4.areas.0.net.2.weight": "pytorch_model-00003-of-00012.bin",
840
+ "blocks.4.areas.1.net.0.bias": "pytorch_model-00003-of-00012.bin",
841
+ "blocks.4.areas.1.net.0.weight": "pytorch_model-00003-of-00012.bin",
842
+ "blocks.4.areas.1.net.2.bias": "pytorch_model-00003-of-00012.bin",
843
+ "blocks.4.areas.1.net.2.weight": "pytorch_model-00003-of-00012.bin",
844
+ "blocks.4.areas.2.net.0.bias": "pytorch_model-00003-of-00012.bin",
845
+ "blocks.4.areas.2.net.0.weight": "pytorch_model-00003-of-00012.bin",
846
+ "blocks.4.areas.2.net.2.bias": "pytorch_model-00003-of-00012.bin",
847
+ "blocks.4.areas.2.net.2.weight": "pytorch_model-00003-of-00012.bin",
848
+ "blocks.4.areas.3.net.0.bias": "pytorch_model-00003-of-00012.bin",
849
+ "blocks.4.areas.3.net.0.weight": "pytorch_model-00003-of-00012.bin",
850
+ "blocks.4.areas.3.net.2.bias": "pytorch_model-00003-of-00012.bin",
851
+ "blocks.4.areas.3.net.2.weight": "pytorch_model-00003-of-00012.bin",
852
+ "blocks.4.areas.4.net.0.bias": "pytorch_model-00003-of-00012.bin",
853
+ "blocks.4.areas.4.net.0.weight": "pytorch_model-00003-of-00012.bin",
854
+ "blocks.4.areas.4.net.2.bias": "pytorch_model-00003-of-00012.bin",
855
+ "blocks.4.areas.4.net.2.weight": "pytorch_model-00003-of-00012.bin",
856
+ "blocks.4.areas.5.net.0.bias": "pytorch_model-00003-of-00012.bin",
857
+ "blocks.4.areas.5.net.0.weight": "pytorch_model-00003-of-00012.bin",
858
+ "blocks.4.areas.5.net.2.bias": "pytorch_model-00003-of-00012.bin",
859
+ "blocks.4.areas.5.net.2.weight": "pytorch_model-00003-of-00012.bin",
860
+ "blocks.4.areas.6.net.0.bias": "pytorch_model-00003-of-00012.bin",
861
+ "blocks.4.areas.6.net.0.weight": "pytorch_model-00003-of-00012.bin",
862
+ "blocks.4.areas.6.net.2.bias": "pytorch_model-00003-of-00012.bin",
863
+ "blocks.4.areas.6.net.2.weight": "pytorch_model-00003-of-00012.bin",
864
+ "blocks.4.areas.7.net.0.bias": "pytorch_model-00003-of-00012.bin",
865
+ "blocks.4.areas.7.net.0.weight": "pytorch_model-00003-of-00012.bin",
866
+ "blocks.4.areas.7.net.2.bias": "pytorch_model-00003-of-00012.bin",
867
+ "blocks.4.areas.7.net.2.weight": "pytorch_model-00003-of-00012.bin",
868
+ "blocks.4.attn.c_attn.bias": "pytorch_model-00003-of-00012.bin",
869
+ "blocks.4.attn.c_attn.weight": "pytorch_model-00003-of-00012.bin",
870
+ "blocks.4.attn.c_proj.bias": "pytorch_model-00003-of-00012.bin",
871
+ "blocks.4.attn.c_proj.weight": "pytorch_model-00003-of-00012.bin",
872
+ "blocks.4.gate.0.bias": "pytorch_model-00003-of-00012.bin",
873
+ "blocks.4.gate.0.weight": "pytorch_model-00003-of-00012.bin",
874
+ "blocks.4.gate.2.bias": "pytorch_model-00003-of-00012.bin",
875
+ "blocks.4.gate.2.weight": "pytorch_model-00003-of-00012.bin",
876
+ "blocks.4.ln_1.bias": "pytorch_model-00003-of-00012.bin",
877
+ "blocks.4.ln_1.weight": "pytorch_model-00003-of-00012.bin",
878
+ "blocks.4.ln_2.bias": "pytorch_model-00003-of-00012.bin",
879
+ "blocks.4.ln_2.weight": "pytorch_model-00003-of-00012.bin",
880
+ "blocks.5.area_norm.bias": "pytorch_model-00003-of-00012.bin",
881
+ "blocks.5.area_norm.weight": "pytorch_model-00003-of-00012.bin",
882
+ "blocks.5.areas.0.net.0.bias": "pytorch_model-00003-of-00012.bin",
883
+ "blocks.5.areas.0.net.0.weight": "pytorch_model-00003-of-00012.bin",
884
+ "blocks.5.areas.0.net.2.bias": "pytorch_model-00003-of-00012.bin",
885
+ "blocks.5.areas.0.net.2.weight": "pytorch_model-00003-of-00012.bin",
886
+ "blocks.5.areas.1.net.0.bias": "pytorch_model-00003-of-00012.bin",
887
+ "blocks.5.areas.1.net.0.weight": "pytorch_model-00003-of-00012.bin",
888
+ "blocks.5.areas.1.net.2.bias": "pytorch_model-00003-of-00012.bin",
889
+ "blocks.5.areas.1.net.2.weight": "pytorch_model-00003-of-00012.bin",
890
+ "blocks.5.areas.2.net.0.bias": "pytorch_model-00003-of-00012.bin",
891
+ "blocks.5.areas.2.net.0.weight": "pytorch_model-00003-of-00012.bin",
892
+ "blocks.5.areas.2.net.2.bias": "pytorch_model-00003-of-00012.bin",
893
+ "blocks.5.areas.2.net.2.weight": "pytorch_model-00003-of-00012.bin",
894
+ "blocks.5.areas.3.net.0.bias": "pytorch_model-00003-of-00012.bin",
895
+ "blocks.5.areas.3.net.0.weight": "pytorch_model-00003-of-00012.bin",
896
+ "blocks.5.areas.3.net.2.bias": "pytorch_model-00003-of-00012.bin",
897
+ "blocks.5.areas.3.net.2.weight": "pytorch_model-00003-of-00012.bin",
898
+ "blocks.5.areas.4.net.0.bias": "pytorch_model-00003-of-00012.bin",
899
+ "blocks.5.areas.4.net.0.weight": "pytorch_model-00003-of-00012.bin",
900
+ "blocks.5.areas.4.net.2.bias": "pytorch_model-00003-of-00012.bin",
901
+ "blocks.5.areas.4.net.2.weight": "pytorch_model-00003-of-00012.bin",
902
+ "blocks.5.areas.5.net.0.bias": "pytorch_model-00003-of-00012.bin",
903
+ "blocks.5.areas.5.net.0.weight": "pytorch_model-00003-of-00012.bin",
904
+ "blocks.5.areas.5.net.2.bias": "pytorch_model-00003-of-00012.bin",
905
+ "blocks.5.areas.5.net.2.weight": "pytorch_model-00003-of-00012.bin",
906
+ "blocks.5.areas.6.net.0.bias": "pytorch_model-00003-of-00012.bin",
907
+ "blocks.5.areas.6.net.0.weight": "pytorch_model-00003-of-00012.bin",
908
+ "blocks.5.areas.6.net.2.bias": "pytorch_model-00003-of-00012.bin",
909
+ "blocks.5.areas.6.net.2.weight": "pytorch_model-00003-of-00012.bin",
910
+ "blocks.5.areas.7.net.0.bias": "pytorch_model-00003-of-00012.bin",
911
+ "blocks.5.areas.7.net.0.weight": "pytorch_model-00003-of-00012.bin",
912
+ "blocks.5.areas.7.net.2.bias": "pytorch_model-00003-of-00012.bin",
913
+ "blocks.5.areas.7.net.2.weight": "pytorch_model-00003-of-00012.bin",
914
+ "blocks.5.attn.c_attn.bias": "pytorch_model-00003-of-00012.bin",
915
+ "blocks.5.attn.c_attn.weight": "pytorch_model-00003-of-00012.bin",
916
+ "blocks.5.attn.c_proj.bias": "pytorch_model-00003-of-00012.bin",
917
+ "blocks.5.attn.c_proj.weight": "pytorch_model-00003-of-00012.bin",
918
+ "blocks.5.gate.0.bias": "pytorch_model-00003-of-00012.bin",
919
+ "blocks.5.gate.0.weight": "pytorch_model-00003-of-00012.bin",
920
+ "blocks.5.gate.2.bias": "pytorch_model-00003-of-00012.bin",
921
+ "blocks.5.gate.2.weight": "pytorch_model-00003-of-00012.bin",
922
+ "blocks.5.ln_1.bias": "pytorch_model-00003-of-00012.bin",
923
+ "blocks.5.ln_1.weight": "pytorch_model-00003-of-00012.bin",
924
+ "blocks.5.ln_2.bias": "pytorch_model-00003-of-00012.bin",
925
+ "blocks.5.ln_2.weight": "pytorch_model-00003-of-00012.bin",
926
+ "blocks.6.area_norm.bias": "pytorch_model-00004-of-00012.bin",
927
+ "blocks.6.area_norm.weight": "pytorch_model-00004-of-00012.bin",
928
+ "blocks.6.areas.0.net.0.bias": "pytorch_model-00003-of-00012.bin",
929
+ "blocks.6.areas.0.net.0.weight": "pytorch_model-00003-of-00012.bin",
930
+ "blocks.6.areas.0.net.2.bias": "pytorch_model-00004-of-00012.bin",
931
+ "blocks.6.areas.0.net.2.weight": "pytorch_model-00004-of-00012.bin",
932
+ "blocks.6.areas.1.net.0.bias": "pytorch_model-00004-of-00012.bin",
933
+ "blocks.6.areas.1.net.0.weight": "pytorch_model-00004-of-00012.bin",
934
+ "blocks.6.areas.1.net.2.bias": "pytorch_model-00004-of-00012.bin",
935
+ "blocks.6.areas.1.net.2.weight": "pytorch_model-00004-of-00012.bin",
936
+ "blocks.6.areas.2.net.0.bias": "pytorch_model-00004-of-00012.bin",
937
+ "blocks.6.areas.2.net.0.weight": "pytorch_model-00004-of-00012.bin",
938
+ "blocks.6.areas.2.net.2.bias": "pytorch_model-00004-of-00012.bin",
939
+ "blocks.6.areas.2.net.2.weight": "pytorch_model-00004-of-00012.bin",
940
+ "blocks.6.areas.3.net.0.bias": "pytorch_model-00004-of-00012.bin",
941
+ "blocks.6.areas.3.net.0.weight": "pytorch_model-00004-of-00012.bin",
942
+ "blocks.6.areas.3.net.2.bias": "pytorch_model-00004-of-00012.bin",
943
+ "blocks.6.areas.3.net.2.weight": "pytorch_model-00004-of-00012.bin",
944
+ "blocks.6.areas.4.net.0.bias": "pytorch_model-00004-of-00012.bin",
945
+ "blocks.6.areas.4.net.0.weight": "pytorch_model-00004-of-00012.bin",
946
+ "blocks.6.areas.4.net.2.bias": "pytorch_model-00004-of-00012.bin",
947
+ "blocks.6.areas.4.net.2.weight": "pytorch_model-00004-of-00012.bin",
948
+ "blocks.6.areas.5.net.0.bias": "pytorch_model-00004-of-00012.bin",
949
+ "blocks.6.areas.5.net.0.weight": "pytorch_model-00004-of-00012.bin",
950
+ "blocks.6.areas.5.net.2.bias": "pytorch_model-00004-of-00012.bin",
951
+ "blocks.6.areas.5.net.2.weight": "pytorch_model-00004-of-00012.bin",
952
+ "blocks.6.areas.6.net.0.bias": "pytorch_model-00004-of-00012.bin",
953
+ "blocks.6.areas.6.net.0.weight": "pytorch_model-00004-of-00012.bin",
954
+ "blocks.6.areas.6.net.2.bias": "pytorch_model-00004-of-00012.bin",
955
+ "blocks.6.areas.6.net.2.weight": "pytorch_model-00004-of-00012.bin",
956
+ "blocks.6.areas.7.net.0.bias": "pytorch_model-00004-of-00012.bin",
957
+ "blocks.6.areas.7.net.0.weight": "pytorch_model-00004-of-00012.bin",
958
+ "blocks.6.areas.7.net.2.bias": "pytorch_model-00004-of-00012.bin",
959
+ "blocks.6.areas.7.net.2.weight": "pytorch_model-00004-of-00012.bin",
960
+ "blocks.6.attn.c_attn.bias": "pytorch_model-00003-of-00012.bin",
961
+ "blocks.6.attn.c_attn.weight": "pytorch_model-00003-of-00012.bin",
962
+ "blocks.6.attn.c_proj.bias": "pytorch_model-00003-of-00012.bin",
963
+ "blocks.6.attn.c_proj.weight": "pytorch_model-00003-of-00012.bin",
964
+ "blocks.6.gate.0.bias": "pytorch_model-00004-of-00012.bin",
965
+ "blocks.6.gate.0.weight": "pytorch_model-00004-of-00012.bin",
966
+ "blocks.6.gate.2.bias": "pytorch_model-00004-of-00012.bin",
967
+ "blocks.6.gate.2.weight": "pytorch_model-00004-of-00012.bin",
968
+ "blocks.6.ln_1.bias": "pytorch_model-00003-of-00012.bin",
969
+ "blocks.6.ln_1.weight": "pytorch_model-00003-of-00012.bin",
970
+ "blocks.6.ln_2.bias": "pytorch_model-00003-of-00012.bin",
971
+ "blocks.6.ln_2.weight": "pytorch_model-00003-of-00012.bin",
972
+ "blocks.7.area_norm.bias": "pytorch_model-00004-of-00012.bin",
973
+ "blocks.7.area_norm.weight": "pytorch_model-00004-of-00012.bin",
974
+ "blocks.7.areas.0.net.0.bias": "pytorch_model-00004-of-00012.bin",
975
+ "blocks.7.areas.0.net.0.weight": "pytorch_model-00004-of-00012.bin",
976
+ "blocks.7.areas.0.net.2.bias": "pytorch_model-00004-of-00012.bin",
977
+ "blocks.7.areas.0.net.2.weight": "pytorch_model-00004-of-00012.bin",
978
+ "blocks.7.areas.1.net.0.bias": "pytorch_model-00004-of-00012.bin",
979
+ "blocks.7.areas.1.net.0.weight": "pytorch_model-00004-of-00012.bin",
980
+ "blocks.7.areas.1.net.2.bias": "pytorch_model-00004-of-00012.bin",
981
+ "blocks.7.areas.1.net.2.weight": "pytorch_model-00004-of-00012.bin",
982
+ "blocks.7.areas.2.net.0.bias": "pytorch_model-00004-of-00012.bin",
983
+ "blocks.7.areas.2.net.0.weight": "pytorch_model-00004-of-00012.bin",
984
+ "blocks.7.areas.2.net.2.bias": "pytorch_model-00004-of-00012.bin",
985
+ "blocks.7.areas.2.net.2.weight": "pytorch_model-00004-of-00012.bin",
986
+ "blocks.7.areas.3.net.0.bias": "pytorch_model-00004-of-00012.bin",
987
+ "blocks.7.areas.3.net.0.weight": "pytorch_model-00004-of-00012.bin",
988
+ "blocks.7.areas.3.net.2.bias": "pytorch_model-00004-of-00012.bin",
989
+ "blocks.7.areas.3.net.2.weight": "pytorch_model-00004-of-00012.bin",
990
+ "blocks.7.areas.4.net.0.bias": "pytorch_model-00004-of-00012.bin",
991
+ "blocks.7.areas.4.net.0.weight": "pytorch_model-00004-of-00012.bin",
992
+ "blocks.7.areas.4.net.2.bias": "pytorch_model-00004-of-00012.bin",
993
+ "blocks.7.areas.4.net.2.weight": "pytorch_model-00004-of-00012.bin",
994
+ "blocks.7.areas.5.net.0.bias": "pytorch_model-00004-of-00012.bin",
995
+ "blocks.7.areas.5.net.0.weight": "pytorch_model-00004-of-00012.bin",
996
+ "blocks.7.areas.5.net.2.bias": "pytorch_model-00004-of-00012.bin",
997
+ "blocks.7.areas.5.net.2.weight": "pytorch_model-00004-of-00012.bin",
998
+ "blocks.7.areas.6.net.0.bias": "pytorch_model-00004-of-00012.bin",
999
+ "blocks.7.areas.6.net.0.weight": "pytorch_model-00004-of-00012.bin",
1000
+ "blocks.7.areas.6.net.2.bias": "pytorch_model-00004-of-00012.bin",
1001
+ "blocks.7.areas.6.net.2.weight": "pytorch_model-00004-of-00012.bin",
1002
+ "blocks.7.areas.7.net.0.bias": "pytorch_model-00004-of-00012.bin",
1003
+ "blocks.7.areas.7.net.0.weight": "pytorch_model-00004-of-00012.bin",
1004
+ "blocks.7.areas.7.net.2.bias": "pytorch_model-00004-of-00012.bin",
1005
+ "blocks.7.areas.7.net.2.weight": "pytorch_model-00004-of-00012.bin",
1006
+ "blocks.7.attn.c_attn.bias": "pytorch_model-00004-of-00012.bin",
1007
+ "blocks.7.attn.c_attn.weight": "pytorch_model-00004-of-00012.bin",
1008
+ "blocks.7.attn.c_proj.bias": "pytorch_model-00004-of-00012.bin",
1009
+ "blocks.7.attn.c_proj.weight": "pytorch_model-00004-of-00012.bin",
1010
+ "blocks.7.gate.0.bias": "pytorch_model-00004-of-00012.bin",
1011
+ "blocks.7.gate.0.weight": "pytorch_model-00004-of-00012.bin",
1012
+ "blocks.7.gate.2.bias": "pytorch_model-00004-of-00012.bin",
1013
+ "blocks.7.gate.2.weight": "pytorch_model-00004-of-00012.bin",
1014
+ "blocks.7.ln_1.bias": "pytorch_model-00004-of-00012.bin",
1015
+ "blocks.7.ln_1.weight": "pytorch_model-00004-of-00012.bin",
1016
+ "blocks.7.ln_2.bias": "pytorch_model-00004-of-00012.bin",
1017
+ "blocks.7.ln_2.weight": "pytorch_model-00004-of-00012.bin",
1018
+ "blocks.8.area_norm.bias": "pytorch_model-00005-of-00012.bin",
1019
+ "blocks.8.area_norm.weight": "pytorch_model-00005-of-00012.bin",
1020
+ "blocks.8.areas.0.net.0.bias": "pytorch_model-00004-of-00012.bin",
1021
+ "blocks.8.areas.0.net.0.weight": "pytorch_model-00004-of-00012.bin",
1022
+ "blocks.8.areas.0.net.2.bias": "pytorch_model-00004-of-00012.bin",
1023
+ "blocks.8.areas.0.net.2.weight": "pytorch_model-00004-of-00012.bin",
1024
+ "blocks.8.areas.1.net.0.bias": "pytorch_model-00004-of-00012.bin",
1025
+ "blocks.8.areas.1.net.0.weight": "pytorch_model-00004-of-00012.bin",
1026
+ "blocks.8.areas.1.net.2.bias": "pytorch_model-00004-of-00012.bin",
1027
+ "blocks.8.areas.1.net.2.weight": "pytorch_model-00004-of-00012.bin",
1028
+ "blocks.8.areas.2.net.0.bias": "pytorch_model-00004-of-00012.bin",
1029
+ "blocks.8.areas.2.net.0.weight": "pytorch_model-00004-of-00012.bin",
1030
+ "blocks.8.areas.2.net.2.bias": "pytorch_model-00005-of-00012.bin",
1031
+ "blocks.8.areas.2.net.2.weight": "pytorch_model-00005-of-00012.bin",
1032
+ "blocks.8.areas.3.net.0.bias": "pytorch_model-00005-of-00012.bin",
1033
+ "blocks.8.areas.3.net.0.weight": "pytorch_model-00005-of-00012.bin",
1034
+ "blocks.8.areas.3.net.2.bias": "pytorch_model-00005-of-00012.bin",
1035
+ "blocks.8.areas.3.net.2.weight": "pytorch_model-00005-of-00012.bin",
1036
+ "blocks.8.areas.4.net.0.bias": "pytorch_model-00005-of-00012.bin",
1037
+ "blocks.8.areas.4.net.0.weight": "pytorch_model-00005-of-00012.bin",
1038
+ "blocks.8.areas.4.net.2.bias": "pytorch_model-00005-of-00012.bin",
1039
+ "blocks.8.areas.4.net.2.weight": "pytorch_model-00005-of-00012.bin",
1040
+ "blocks.8.areas.5.net.0.bias": "pytorch_model-00005-of-00012.bin",
1041
+ "blocks.8.areas.5.net.0.weight": "pytorch_model-00005-of-00012.bin",
1042
+ "blocks.8.areas.5.net.2.bias": "pytorch_model-00005-of-00012.bin",
1043
+ "blocks.8.areas.5.net.2.weight": "pytorch_model-00005-of-00012.bin",
1044
+ "blocks.8.areas.6.net.0.bias": "pytorch_model-00005-of-00012.bin",
1045
+ "blocks.8.areas.6.net.0.weight": "pytorch_model-00005-of-00012.bin",
1046
+ "blocks.8.areas.6.net.2.bias": "pytorch_model-00005-of-00012.bin",
1047
+ "blocks.8.areas.6.net.2.weight": "pytorch_model-00005-of-00012.bin",
1048
+ "blocks.8.areas.7.net.0.bias": "pytorch_model-00005-of-00012.bin",
1049
+ "blocks.8.areas.7.net.0.weight": "pytorch_model-00005-of-00012.bin",
1050
+ "blocks.8.areas.7.net.2.bias": "pytorch_model-00005-of-00012.bin",
1051
+ "blocks.8.areas.7.net.2.weight": "pytorch_model-00005-of-00012.bin",
1052
+ "blocks.8.attn.c_attn.bias": "pytorch_model-00004-of-00012.bin",
1053
+ "blocks.8.attn.c_attn.weight": "pytorch_model-00004-of-00012.bin",
1054
+ "blocks.8.attn.c_proj.bias": "pytorch_model-00004-of-00012.bin",
1055
+ "blocks.8.attn.c_proj.weight": "pytorch_model-00004-of-00012.bin",
1056
+ "blocks.8.gate.0.bias": "pytorch_model-00005-of-00012.bin",
1057
+ "blocks.8.gate.0.weight": "pytorch_model-00005-of-00012.bin",
1058
+ "blocks.8.gate.2.bias": "pytorch_model-00005-of-00012.bin",
1059
+ "blocks.8.gate.2.weight": "pytorch_model-00005-of-00012.bin",
1060
+ "blocks.8.ln_1.bias": "pytorch_model-00004-of-00012.bin",
1061
+ "blocks.8.ln_1.weight": "pytorch_model-00004-of-00012.bin",
1062
+ "blocks.8.ln_2.bias": "pytorch_model-00004-of-00012.bin",
1063
+ "blocks.8.ln_2.weight": "pytorch_model-00004-of-00012.bin",
1064
+ "blocks.9.area_norm.bias": "pytorch_model-00005-of-00012.bin",
1065
+ "blocks.9.area_norm.weight": "pytorch_model-00005-of-00012.bin",
1066
+ "blocks.9.areas.0.net.0.bias": "pytorch_model-00005-of-00012.bin",
1067
+ "blocks.9.areas.0.net.0.weight": "pytorch_model-00005-of-00012.bin",
1068
+ "blocks.9.areas.0.net.2.bias": "pytorch_model-00005-of-00012.bin",
1069
+ "blocks.9.areas.0.net.2.weight": "pytorch_model-00005-of-00012.bin",
1070
+ "blocks.9.areas.1.net.0.bias": "pytorch_model-00005-of-00012.bin",
1071
+ "blocks.9.areas.1.net.0.weight": "pytorch_model-00005-of-00012.bin",
1072
+ "blocks.9.areas.1.net.2.bias": "pytorch_model-00005-of-00012.bin",
1073
+ "blocks.9.areas.1.net.2.weight": "pytorch_model-00005-of-00012.bin",
1074
+ "blocks.9.areas.2.net.0.bias": "pytorch_model-00005-of-00012.bin",
1075
+ "blocks.9.areas.2.net.0.weight": "pytorch_model-00005-of-00012.bin",
1076
+ "blocks.9.areas.2.net.2.bias": "pytorch_model-00005-of-00012.bin",
1077
+ "blocks.9.areas.2.net.2.weight": "pytorch_model-00005-of-00012.bin",
1078
+ "blocks.9.areas.3.net.0.bias": "pytorch_model-00005-of-00012.bin",
1079
+ "blocks.9.areas.3.net.0.weight": "pytorch_model-00005-of-00012.bin",
1080
+ "blocks.9.areas.3.net.2.bias": "pytorch_model-00005-of-00012.bin",
1081
+ "blocks.9.areas.3.net.2.weight": "pytorch_model-00005-of-00012.bin",
1082
+ "blocks.9.areas.4.net.0.bias": "pytorch_model-00005-of-00012.bin",
1083
+ "blocks.9.areas.4.net.0.weight": "pytorch_model-00005-of-00012.bin",
1084
+ "blocks.9.areas.4.net.2.bias": "pytorch_model-00005-of-00012.bin",
1085
+ "blocks.9.areas.4.net.2.weight": "pytorch_model-00005-of-00012.bin",
1086
+ "blocks.9.areas.5.net.0.bias": "pytorch_model-00005-of-00012.bin",
1087
+ "blocks.9.areas.5.net.0.weight": "pytorch_model-00005-of-00012.bin",
1088
+ "blocks.9.areas.5.net.2.bias": "pytorch_model-00005-of-00012.bin",
1089
+ "blocks.9.areas.5.net.2.weight": "pytorch_model-00005-of-00012.bin",
1090
+ "blocks.9.areas.6.net.0.bias": "pytorch_model-00005-of-00012.bin",
1091
+ "blocks.9.areas.6.net.0.weight": "pytorch_model-00005-of-00012.bin",
1092
+ "blocks.9.areas.6.net.2.bias": "pytorch_model-00005-of-00012.bin",
1093
+ "blocks.9.areas.6.net.2.weight": "pytorch_model-00005-of-00012.bin",
1094
+ "blocks.9.areas.7.net.0.bias": "pytorch_model-00005-of-00012.bin",
1095
+ "blocks.9.areas.7.net.0.weight": "pytorch_model-00005-of-00012.bin",
1096
+ "blocks.9.areas.7.net.2.bias": "pytorch_model-00005-of-00012.bin",
1097
+ "blocks.9.areas.7.net.2.weight": "pytorch_model-00005-of-00012.bin",
1098
+ "blocks.9.attn.c_attn.bias": "pytorch_model-00005-of-00012.bin",
1099
+ "blocks.9.attn.c_attn.weight": "pytorch_model-00005-of-00012.bin",
1100
+ "blocks.9.attn.c_proj.bias": "pytorch_model-00005-of-00012.bin",
1101
+ "blocks.9.attn.c_proj.weight": "pytorch_model-00005-of-00012.bin",
1102
+ "blocks.9.gate.0.bias": "pytorch_model-00005-of-00012.bin",
1103
+ "blocks.9.gate.0.weight": "pytorch_model-00005-of-00012.bin",
1104
+ "blocks.9.gate.2.bias": "pytorch_model-00005-of-00012.bin",
1105
+ "blocks.9.gate.2.weight": "pytorch_model-00005-of-00012.bin",
1106
+ "blocks.9.ln_1.bias": "pytorch_model-00005-of-00012.bin",
1107
+ "blocks.9.ln_1.weight": "pytorch_model-00005-of-00012.bin",
1108
+ "blocks.9.ln_2.bias": "pytorch_model-00005-of-00012.bin",
1109
+ "blocks.9.ln_2.weight": "pytorch_model-00005-of-00012.bin",
1110
+ "lm_head.weight": "pytorch_model-00012-of-00012.bin",
1111
+ "ln_f.bias": "pytorch_model-00011-of-00012.bin",
1112
+ "ln_f.weight": "pytorch_model-00011-of-00012.bin",
1113
+ "wpe.weight": "pytorch_model-00001-of-00012.bin",
1114
+ "wte.weight": "pytorch_model-00001-of-00012.bin"
1115
+ }
1116
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,30 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token": {
3
+ "content": "<|endoftext|>",
4
+ "lstrip": false,
5
+ "normalized": true,
6
+ "rstrip": false,
7
+ "single_word": false
8
+ },
9
+ "eos_token": {
10
+ "content": "<|endoftext|>",
11
+ "lstrip": false,
12
+ "normalized": true,
13
+ "rstrip": false,
14
+ "single_word": false
15
+ },
16
+ "pad_token": {
17
+ "content": "<|endoftext|>",
18
+ "lstrip": false,
19
+ "normalized": true,
20
+ "rstrip": false,
21
+ "single_word": false
22
+ },
23
+ "unk_token": {
24
+ "content": "<|endoftext|>",
25
+ "lstrip": false,
26
+ "normalized": true,
27
+ "rstrip": false,
28
+ "single_word": false
29
+ }
30
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "added_tokens_decoder": {
4
+ "50256": {
5
+ "content": "<|endoftext|>",
6
+ "lstrip": false,
7
+ "normalized": true,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ }
12
+ },
13
+ "bos_token": "<|endoftext|>",
14
+ "clean_up_tokenization_spaces": true,
15
+ "eos_token": "<|endoftext|>",
16
+ "model_max_length": 1024,
17
+ "pad_token": "<|endoftext|>",
18
+ "tokenizer_class": "GPT2Tokenizer",
19
+ "unk_token": "<|endoftext|>"
20
+ }
vocab.json ADDED
The diff for this file is too large to render. See raw diff