OzzyGT HF Staff commited on
Commit
060b75c
·
verified ·
1 Parent(s): 1a8f224

Upload 10 files

Browse files
.gitattributes CHANGED
@@ -34,3 +34,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  LICENSE.pdf filter=lfs diff=lfs merge=lfs -text
 
 
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  LICENSE.pdf filter=lfs diff=lfs merge=lfs -text
37
+ tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text
scheduler/scheduler_config.json ADDED
@@ -0,0 +1,18 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_class_name": "FlowMatchEulerDiscreteScheduler",
3
+ "_diffusers_version": "0.39.0.dev0",
4
+ "base_image_seq_len": 256,
5
+ "base_shift": 0.5,
6
+ "invert_sigmas": false,
7
+ "max_image_seq_len": 6400,
8
+ "max_shift": 1.15,
9
+ "num_train_timesteps": 1000,
10
+ "shift": 1.0,
11
+ "shift_terminal": null,
12
+ "stochastic_sampling": false,
13
+ "time_shift_type": "exponential",
14
+ "use_beta_sigmas": false,
15
+ "use_dynamic_shifting": true,
16
+ "use_exponential_sigmas": false,
17
+ "use_karras_sigmas": false
18
+ }
text_encoder/config.json ADDED
@@ -0,0 +1,682 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3VLModel"
4
+ ],
5
+ "dtype": "bfloat16",
6
+ "image_token_id": 151655,
7
+ "model_type": "qwen3_vl",
8
+ "quantization_config": {
9
+ "add_skip_keys": true,
10
+ "dequantize_fp32": false,
11
+ "dynamic_loss_threshold": 0.01,
12
+ "group_size": 0,
13
+ "hadamard_group_size": 256,
14
+ "is_integer": true,
15
+ "is_training": false,
16
+ "modules_dtype_dict": {
17
+ "uint4": [
18
+ "language_model.layers.0.mlp.down_proj.weight",
19
+ "language_model.layers.0.mlp.gate_proj.weight",
20
+ "language_model.layers.0.mlp.up_proj.weight",
21
+ "language_model.layers.0.self_attn.k_proj.weight",
22
+ "language_model.layers.0.self_attn.o_proj.weight",
23
+ "language_model.layers.0.self_attn.q_proj.weight",
24
+ "language_model.layers.0.self_attn.v_proj.weight",
25
+ "language_model.layers.1.mlp.down_proj.weight",
26
+ "language_model.layers.1.mlp.gate_proj.weight",
27
+ "language_model.layers.1.mlp.up_proj.weight",
28
+ "language_model.layers.1.self_attn.k_proj.weight",
29
+ "language_model.layers.1.self_attn.o_proj.weight",
30
+ "language_model.layers.1.self_attn.q_proj.weight",
31
+ "language_model.layers.1.self_attn.v_proj.weight",
32
+ "language_model.layers.2.mlp.down_proj.weight",
33
+ "language_model.layers.2.mlp.gate_proj.weight",
34
+ "language_model.layers.2.mlp.up_proj.weight",
35
+ "language_model.layers.2.self_attn.k_proj.weight",
36
+ "language_model.layers.2.self_attn.o_proj.weight",
37
+ "language_model.layers.2.self_attn.q_proj.weight",
38
+ "language_model.layers.2.self_attn.v_proj.weight",
39
+ "language_model.layers.3.mlp.down_proj.weight",
40
+ "language_model.layers.3.mlp.gate_proj.weight",
41
+ "language_model.layers.3.mlp.up_proj.weight",
42
+ "language_model.layers.3.self_attn.k_proj.weight",
43
+ "language_model.layers.3.self_attn.o_proj.weight",
44
+ "language_model.layers.3.self_attn.q_proj.weight",
45
+ "language_model.layers.3.self_attn.v_proj.weight",
46
+ "language_model.layers.4.mlp.down_proj.weight",
47
+ "language_model.layers.4.mlp.gate_proj.weight",
48
+ "language_model.layers.4.mlp.up_proj.weight",
49
+ "language_model.layers.4.self_attn.k_proj.weight",
50
+ "language_model.layers.4.self_attn.o_proj.weight",
51
+ "language_model.layers.4.self_attn.q_proj.weight",
52
+ "language_model.layers.4.self_attn.v_proj.weight",
53
+ "language_model.layers.5.mlp.down_proj.weight",
54
+ "language_model.layers.5.mlp.gate_proj.weight",
55
+ "language_model.layers.5.mlp.up_proj.weight",
56
+ "language_model.layers.5.self_attn.k_proj.weight",
57
+ "language_model.layers.5.self_attn.o_proj.weight",
58
+ "language_model.layers.5.self_attn.q_proj.weight",
59
+ "language_model.layers.5.self_attn.v_proj.weight",
60
+ "language_model.layers.6.mlp.down_proj.weight",
61
+ "language_model.layers.6.mlp.gate_proj.weight",
62
+ "language_model.layers.6.mlp.up_proj.weight",
63
+ "language_model.layers.6.self_attn.k_proj.weight",
64
+ "language_model.layers.6.self_attn.o_proj.weight",
65
+ "language_model.layers.6.self_attn.q_proj.weight",
66
+ "language_model.layers.6.self_attn.v_proj.weight",
67
+ "language_model.layers.7.mlp.down_proj.weight",
68
+ "language_model.layers.7.mlp.gate_proj.weight",
69
+ "language_model.layers.7.mlp.up_proj.weight",
70
+ "language_model.layers.7.self_attn.k_proj.weight",
71
+ "language_model.layers.7.self_attn.o_proj.weight",
72
+ "language_model.layers.7.self_attn.q_proj.weight",
73
+ "language_model.layers.7.self_attn.v_proj.weight",
74
+ "language_model.layers.8.mlp.down_proj.weight",
75
+ "language_model.layers.8.mlp.gate_proj.weight",
76
+ "language_model.layers.8.mlp.up_proj.weight",
77
+ "language_model.layers.8.self_attn.k_proj.weight",
78
+ "language_model.layers.8.self_attn.o_proj.weight",
79
+ "language_model.layers.8.self_attn.q_proj.weight",
80
+ "language_model.layers.8.self_attn.v_proj.weight",
81
+ "language_model.layers.9.mlp.down_proj.weight",
82
+ "language_model.layers.9.mlp.gate_proj.weight",
83
+ "language_model.layers.9.mlp.up_proj.weight",
84
+ "language_model.layers.9.self_attn.k_proj.weight",
85
+ "language_model.layers.9.self_attn.o_proj.weight",
86
+ "language_model.layers.9.self_attn.q_proj.weight",
87
+ "language_model.layers.9.self_attn.v_proj.weight",
88
+ "language_model.layers.10.mlp.down_proj.weight",
89
+ "language_model.layers.10.mlp.gate_proj.weight",
90
+ "language_model.layers.10.mlp.up_proj.weight",
91
+ "language_model.layers.10.self_attn.k_proj.weight",
92
+ "language_model.layers.10.self_attn.o_proj.weight",
93
+ "language_model.layers.10.self_attn.q_proj.weight",
94
+ "language_model.layers.10.self_attn.v_proj.weight",
95
+ "language_model.layers.11.mlp.down_proj.weight",
96
+ "language_model.layers.11.mlp.gate_proj.weight",
97
+ "language_model.layers.11.mlp.up_proj.weight",
98
+ "language_model.layers.11.self_attn.k_proj.weight",
99
+ "language_model.layers.11.self_attn.o_proj.weight",
100
+ "language_model.layers.11.self_attn.q_proj.weight",
101
+ "language_model.layers.11.self_attn.v_proj.weight",
102
+ "language_model.layers.12.mlp.down_proj.weight",
103
+ "language_model.layers.12.mlp.gate_proj.weight",
104
+ "language_model.layers.12.mlp.up_proj.weight",
105
+ "language_model.layers.12.self_attn.k_proj.weight",
106
+ "language_model.layers.12.self_attn.o_proj.weight",
107
+ "language_model.layers.12.self_attn.q_proj.weight",
108
+ "language_model.layers.12.self_attn.v_proj.weight",
109
+ "language_model.layers.13.mlp.down_proj.weight",
110
+ "language_model.layers.13.mlp.gate_proj.weight",
111
+ "language_model.layers.13.mlp.up_proj.weight",
112
+ "language_model.layers.13.self_attn.k_proj.weight",
113
+ "language_model.layers.13.self_attn.o_proj.weight",
114
+ "language_model.layers.13.self_attn.q_proj.weight",
115
+ "language_model.layers.13.self_attn.v_proj.weight",
116
+ "language_model.layers.14.mlp.down_proj.weight",
117
+ "language_model.layers.14.mlp.gate_proj.weight",
118
+ "language_model.layers.14.mlp.up_proj.weight",
119
+ "language_model.layers.14.self_attn.k_proj.weight",
120
+ "language_model.layers.14.self_attn.o_proj.weight",
121
+ "language_model.layers.14.self_attn.q_proj.weight",
122
+ "language_model.layers.14.self_attn.v_proj.weight",
123
+ "language_model.layers.15.mlp.down_proj.weight",
124
+ "language_model.layers.15.mlp.gate_proj.weight",
125
+ "language_model.layers.15.mlp.up_proj.weight",
126
+ "language_model.layers.15.self_attn.k_proj.weight",
127
+ "language_model.layers.15.self_attn.o_proj.weight",
128
+ "language_model.layers.15.self_attn.q_proj.weight",
129
+ "language_model.layers.15.self_attn.v_proj.weight",
130
+ "language_model.layers.16.mlp.down_proj.weight",
131
+ "language_model.layers.16.mlp.gate_proj.weight",
132
+ "language_model.layers.16.mlp.up_proj.weight",
133
+ "language_model.layers.16.self_attn.k_proj.weight",
134
+ "language_model.layers.16.self_attn.o_proj.weight",
135
+ "language_model.layers.16.self_attn.q_proj.weight",
136
+ "language_model.layers.16.self_attn.v_proj.weight",
137
+ "language_model.layers.17.mlp.down_proj.weight",
138
+ "language_model.layers.17.mlp.gate_proj.weight",
139
+ "language_model.layers.17.mlp.up_proj.weight",
140
+ "language_model.layers.17.self_attn.k_proj.weight",
141
+ "language_model.layers.17.self_attn.o_proj.weight",
142
+ "language_model.layers.17.self_attn.q_proj.weight",
143
+ "language_model.layers.17.self_attn.v_proj.weight",
144
+ "language_model.layers.18.mlp.down_proj.weight",
145
+ "language_model.layers.18.mlp.gate_proj.weight",
146
+ "language_model.layers.18.mlp.up_proj.weight",
147
+ "language_model.layers.18.self_attn.k_proj.weight",
148
+ "language_model.layers.18.self_attn.o_proj.weight",
149
+ "language_model.layers.18.self_attn.q_proj.weight",
150
+ "language_model.layers.18.self_attn.v_proj.weight",
151
+ "language_model.layers.19.mlp.down_proj.weight",
152
+ "language_model.layers.19.mlp.gate_proj.weight",
153
+ "language_model.layers.19.mlp.up_proj.weight",
154
+ "language_model.layers.19.self_attn.k_proj.weight",
155
+ "language_model.layers.19.self_attn.o_proj.weight",
156
+ "language_model.layers.19.self_attn.q_proj.weight",
157
+ "language_model.layers.19.self_attn.v_proj.weight",
158
+ "language_model.layers.20.mlp.down_proj.weight",
159
+ "language_model.layers.20.mlp.gate_proj.weight",
160
+ "language_model.layers.20.mlp.up_proj.weight",
161
+ "language_model.layers.20.self_attn.k_proj.weight",
162
+ "language_model.layers.20.self_attn.o_proj.weight",
163
+ "language_model.layers.20.self_attn.q_proj.weight",
164
+ "language_model.layers.20.self_attn.v_proj.weight",
165
+ "language_model.layers.21.mlp.down_proj.weight",
166
+ "language_model.layers.21.mlp.gate_proj.weight",
167
+ "language_model.layers.21.mlp.up_proj.weight",
168
+ "language_model.layers.21.self_attn.k_proj.weight",
169
+ "language_model.layers.21.self_attn.o_proj.weight",
170
+ "language_model.layers.21.self_attn.q_proj.weight",
171
+ "language_model.layers.21.self_attn.v_proj.weight",
172
+ "language_model.layers.22.mlp.down_proj.weight",
173
+ "language_model.layers.22.mlp.gate_proj.weight",
174
+ "language_model.layers.22.mlp.up_proj.weight",
175
+ "language_model.layers.22.self_attn.k_proj.weight",
176
+ "language_model.layers.22.self_attn.o_proj.weight",
177
+ "language_model.layers.22.self_attn.q_proj.weight",
178
+ "language_model.layers.22.self_attn.v_proj.weight",
179
+ "language_model.layers.23.mlp.down_proj.weight",
180
+ "language_model.layers.23.mlp.gate_proj.weight",
181
+ "language_model.layers.23.mlp.up_proj.weight",
182
+ "language_model.layers.23.self_attn.k_proj.weight",
183
+ "language_model.layers.23.self_attn.o_proj.weight",
184
+ "language_model.layers.23.self_attn.q_proj.weight",
185
+ "language_model.layers.23.self_attn.v_proj.weight",
186
+ "language_model.layers.24.mlp.down_proj.weight",
187
+ "language_model.layers.24.mlp.gate_proj.weight",
188
+ "language_model.layers.24.mlp.up_proj.weight",
189
+ "language_model.layers.24.self_attn.k_proj.weight",
190
+ "language_model.layers.24.self_attn.o_proj.weight",
191
+ "language_model.layers.24.self_attn.q_proj.weight",
192
+ "language_model.layers.24.self_attn.v_proj.weight",
193
+ "language_model.layers.25.mlp.down_proj.weight",
194
+ "language_model.layers.25.mlp.gate_proj.weight",
195
+ "language_model.layers.25.mlp.up_proj.weight",
196
+ "language_model.layers.25.self_attn.k_proj.weight",
197
+ "language_model.layers.25.self_attn.o_proj.weight",
198
+ "language_model.layers.25.self_attn.q_proj.weight",
199
+ "language_model.layers.25.self_attn.v_proj.weight",
200
+ "language_model.layers.26.mlp.down_proj.weight",
201
+ "language_model.layers.26.mlp.gate_proj.weight",
202
+ "language_model.layers.26.mlp.up_proj.weight",
203
+ "language_model.layers.26.self_attn.k_proj.weight",
204
+ "language_model.layers.26.self_attn.o_proj.weight",
205
+ "language_model.layers.26.self_attn.q_proj.weight",
206
+ "language_model.layers.26.self_attn.v_proj.weight",
207
+ "language_model.layers.27.mlp.down_proj.weight",
208
+ "language_model.layers.27.mlp.gate_proj.weight",
209
+ "language_model.layers.27.mlp.up_proj.weight",
210
+ "language_model.layers.27.self_attn.k_proj.weight",
211
+ "language_model.layers.27.self_attn.o_proj.weight",
212
+ "language_model.layers.27.self_attn.q_proj.weight",
213
+ "language_model.layers.27.self_attn.v_proj.weight",
214
+ "language_model.layers.28.mlp.down_proj.weight",
215
+ "language_model.layers.28.mlp.gate_proj.weight",
216
+ "language_model.layers.28.mlp.up_proj.weight",
217
+ "language_model.layers.28.self_attn.k_proj.weight",
218
+ "language_model.layers.28.self_attn.o_proj.weight",
219
+ "language_model.layers.28.self_attn.q_proj.weight",
220
+ "language_model.layers.28.self_attn.v_proj.weight",
221
+ "language_model.layers.29.mlp.down_proj.weight",
222
+ "language_model.layers.29.mlp.gate_proj.weight",
223
+ "language_model.layers.29.mlp.up_proj.weight",
224
+ "language_model.layers.29.self_attn.k_proj.weight",
225
+ "language_model.layers.29.self_attn.o_proj.weight",
226
+ "language_model.layers.29.self_attn.q_proj.weight",
227
+ "language_model.layers.29.self_attn.v_proj.weight",
228
+ "language_model.layers.30.mlp.down_proj.weight",
229
+ "language_model.layers.30.mlp.gate_proj.weight",
230
+ "language_model.layers.30.mlp.up_proj.weight",
231
+ "language_model.layers.30.self_attn.k_proj.weight",
232
+ "language_model.layers.30.self_attn.o_proj.weight",
233
+ "language_model.layers.30.self_attn.q_proj.weight",
234
+ "language_model.layers.30.self_attn.v_proj.weight",
235
+ "language_model.layers.31.mlp.down_proj.weight",
236
+ "language_model.layers.31.mlp.gate_proj.weight",
237
+ "language_model.layers.31.mlp.up_proj.weight",
238
+ "language_model.layers.31.self_attn.k_proj.weight",
239
+ "language_model.layers.31.self_attn.o_proj.weight",
240
+ "language_model.layers.31.self_attn.q_proj.weight",
241
+ "language_model.layers.31.self_attn.v_proj.weight",
242
+ "language_model.layers.32.mlp.down_proj.weight",
243
+ "language_model.layers.32.mlp.gate_proj.weight",
244
+ "language_model.layers.32.mlp.up_proj.weight",
245
+ "language_model.layers.32.self_attn.k_proj.weight",
246
+ "language_model.layers.32.self_attn.o_proj.weight",
247
+ "language_model.layers.32.self_attn.q_proj.weight",
248
+ "language_model.layers.32.self_attn.v_proj.weight",
249
+ "language_model.layers.33.mlp.down_proj.weight",
250
+ "language_model.layers.33.mlp.gate_proj.weight",
251
+ "language_model.layers.33.mlp.up_proj.weight",
252
+ "language_model.layers.33.self_attn.k_proj.weight",
253
+ "language_model.layers.33.self_attn.o_proj.weight",
254
+ "language_model.layers.33.self_attn.q_proj.weight",
255
+ "language_model.layers.33.self_attn.v_proj.weight",
256
+ "language_model.layers.34.mlp.down_proj.weight",
257
+ "language_model.layers.34.mlp.gate_proj.weight",
258
+ "language_model.layers.34.mlp.up_proj.weight",
259
+ "language_model.layers.34.self_attn.k_proj.weight",
260
+ "language_model.layers.34.self_attn.o_proj.weight",
261
+ "language_model.layers.34.self_attn.q_proj.weight",
262
+ "language_model.layers.34.self_attn.v_proj.weight",
263
+ "language_model.layers.35.mlp.down_proj.weight",
264
+ "language_model.layers.35.mlp.gate_proj.weight",
265
+ "language_model.layers.35.mlp.up_proj.weight",
266
+ "language_model.layers.35.self_attn.k_proj.weight",
267
+ "language_model.layers.35.self_attn.o_proj.weight",
268
+ "language_model.layers.35.self_attn.q_proj.weight",
269
+ "language_model.layers.35.self_attn.v_proj.weight",
270
+ "visual.blocks.0.attn.proj.weight",
271
+ "visual.blocks.0.attn.qkv.weight",
272
+ "visual.blocks.0.mlp.linear_fc1.weight",
273
+ "visual.blocks.0.mlp.linear_fc2.weight",
274
+ "visual.blocks.1.attn.proj.weight",
275
+ "visual.blocks.1.attn.qkv.weight",
276
+ "visual.blocks.1.mlp.linear_fc1.weight",
277
+ "visual.blocks.1.mlp.linear_fc2.weight",
278
+ "visual.blocks.2.attn.proj.weight",
279
+ "visual.blocks.2.attn.qkv.weight",
280
+ "visual.blocks.2.mlp.linear_fc1.weight",
281
+ "visual.blocks.2.mlp.linear_fc2.weight",
282
+ "visual.blocks.3.attn.proj.weight",
283
+ "visual.blocks.3.attn.qkv.weight",
284
+ "visual.blocks.3.mlp.linear_fc1.weight",
285
+ "visual.blocks.3.mlp.linear_fc2.weight",
286
+ "visual.blocks.4.attn.proj.weight",
287
+ "visual.blocks.4.attn.qkv.weight",
288
+ "visual.blocks.4.mlp.linear_fc1.weight",
289
+ "visual.blocks.4.mlp.linear_fc2.weight",
290
+ "visual.blocks.5.attn.proj.weight",
291
+ "visual.blocks.5.attn.qkv.weight",
292
+ "visual.blocks.5.mlp.linear_fc1.weight",
293
+ "visual.blocks.5.mlp.linear_fc2.weight",
294
+ "visual.blocks.6.attn.proj.weight",
295
+ "visual.blocks.6.attn.qkv.weight",
296
+ "visual.blocks.6.mlp.linear_fc1.weight",
297
+ "visual.blocks.6.mlp.linear_fc2.weight",
298
+ "visual.blocks.7.attn.proj.weight",
299
+ "visual.blocks.7.attn.qkv.weight",
300
+ "visual.blocks.7.mlp.linear_fc1.weight",
301
+ "visual.blocks.7.mlp.linear_fc2.weight",
302
+ "visual.blocks.8.attn.proj.weight",
303
+ "visual.blocks.8.attn.qkv.weight",
304
+ "visual.blocks.8.mlp.linear_fc1.weight",
305
+ "visual.blocks.8.mlp.linear_fc2.weight",
306
+ "visual.blocks.9.attn.proj.weight",
307
+ "visual.blocks.9.attn.qkv.weight",
308
+ "visual.blocks.9.mlp.linear_fc1.weight",
309
+ "visual.blocks.9.mlp.linear_fc2.weight",
310
+ "visual.blocks.10.attn.proj.weight",
311
+ "visual.blocks.10.attn.qkv.weight",
312
+ "visual.blocks.10.mlp.linear_fc1.weight",
313
+ "visual.blocks.10.mlp.linear_fc2.weight",
314
+ "visual.blocks.11.attn.proj.weight",
315
+ "visual.blocks.11.attn.qkv.weight",
316
+ "visual.blocks.11.mlp.linear_fc1.weight",
317
+ "visual.blocks.11.mlp.linear_fc2.weight",
318
+ "visual.blocks.12.attn.proj.weight",
319
+ "visual.blocks.12.attn.qkv.weight",
320
+ "visual.blocks.12.mlp.linear_fc1.weight",
321
+ "visual.blocks.12.mlp.linear_fc2.weight",
322
+ "visual.blocks.13.attn.proj.weight",
323
+ "visual.blocks.13.attn.qkv.weight",
324
+ "visual.blocks.13.mlp.linear_fc1.weight",
325
+ "visual.blocks.13.mlp.linear_fc2.weight",
326
+ "visual.blocks.14.attn.proj.weight",
327
+ "visual.blocks.14.attn.qkv.weight",
328
+ "visual.blocks.14.mlp.linear_fc1.weight",
329
+ "visual.blocks.14.mlp.linear_fc2.weight",
330
+ "visual.blocks.15.attn.proj.weight",
331
+ "visual.blocks.15.attn.qkv.weight",
332
+ "visual.blocks.15.mlp.linear_fc1.weight",
333
+ "visual.blocks.15.mlp.linear_fc2.weight",
334
+ "visual.blocks.16.attn.proj.weight",
335
+ "visual.blocks.16.attn.qkv.weight",
336
+ "visual.blocks.16.mlp.linear_fc1.weight",
337
+ "visual.blocks.16.mlp.linear_fc2.weight",
338
+ "visual.blocks.17.attn.proj.weight",
339
+ "visual.blocks.17.attn.qkv.weight",
340
+ "visual.blocks.17.mlp.linear_fc1.weight",
341
+ "visual.blocks.17.mlp.linear_fc2.weight",
342
+ "visual.blocks.18.attn.proj.weight",
343
+ "visual.blocks.18.attn.qkv.weight",
344
+ "visual.blocks.18.mlp.linear_fc1.weight",
345
+ "visual.blocks.18.mlp.linear_fc2.weight",
346
+ "visual.blocks.19.attn.proj.weight",
347
+ "visual.blocks.19.attn.qkv.weight",
348
+ "visual.blocks.19.mlp.linear_fc1.weight",
349
+ "visual.blocks.19.mlp.linear_fc2.weight",
350
+ "visual.blocks.20.attn.proj.weight",
351
+ "visual.blocks.20.attn.qkv.weight",
352
+ "visual.blocks.20.mlp.linear_fc1.weight",
353
+ "visual.blocks.20.mlp.linear_fc2.weight",
354
+ "visual.blocks.21.attn.proj.weight",
355
+ "visual.blocks.21.attn.qkv.weight",
356
+ "visual.blocks.21.mlp.linear_fc1.weight",
357
+ "visual.blocks.21.mlp.linear_fc2.weight",
358
+ "visual.blocks.22.attn.proj.weight",
359
+ "visual.blocks.22.attn.qkv.weight",
360
+ "visual.blocks.22.mlp.linear_fc1.weight",
361
+ "visual.blocks.22.mlp.linear_fc2.weight",
362
+ "visual.blocks.23.attn.proj.weight",
363
+ "visual.blocks.23.attn.qkv.weight",
364
+ "visual.blocks.23.mlp.linear_fc1.weight",
365
+ "visual.blocks.23.mlp.linear_fc2.weight",
366
+ "visual.deepstack_merger_list.0.linear_fc1.weight",
367
+ "visual.deepstack_merger_list.0.linear_fc2.weight",
368
+ "visual.deepstack_merger_list.1.linear_fc1.weight",
369
+ "visual.deepstack_merger_list.1.linear_fc2.weight",
370
+ "visual.deepstack_merger_list.2.linear_fc1.weight",
371
+ "visual.deepstack_merger_list.2.linear_fc2.weight",
372
+ "visual.merger.linear_fc1.weight",
373
+ "visual.merger.linear_fc2.weight"
374
+ ]
375
+ },
376
+ "modules_quant_config": {},
377
+ "modules_to_not_convert": [
378
+ ".condition_embedder",
379
+ "patch_embed",
380
+ ".emb_in",
381
+ ".txt_out",
382
+ ".context_embedder",
383
+ ".vid_out",
384
+ "lm_head",
385
+ ".time_embed",
386
+ ".img_out",
387
+ ".final_layer",
388
+ "patch_emb",
389
+ ".norm_out",
390
+ ".txt_in",
391
+ "multi_modal_projector",
392
+ "language_model.norm",
393
+ ".proj_out",
394
+ "patch_embedding",
395
+ ".vid_in",
396
+ ".t_embedder",
397
+ ".x_embedder",
398
+ "time_text_embed",
399
+ ".emb_out",
400
+ ".img_in",
401
+ "wte",
402
+ ".y_embedder",
403
+ "language_model.embed_tokens.weight",
404
+ "language_model.layers.0.input_layernorm.weight",
405
+ "language_model.layers.0.post_attention_layernorm.weight",
406
+ "language_model.layers.0.self_attn.k_norm.weight",
407
+ "language_model.layers.0.self_attn.q_norm.weight",
408
+ "language_model.layers.1.input_layernorm.weight",
409
+ "language_model.layers.1.post_attention_layernorm.weight",
410
+ "language_model.layers.1.self_attn.k_norm.weight",
411
+ "language_model.layers.1.self_attn.q_norm.weight",
412
+ "language_model.layers.2.input_layernorm.weight",
413
+ "language_model.layers.2.post_attention_layernorm.weight",
414
+ "language_model.layers.2.self_attn.k_norm.weight",
415
+ "language_model.layers.2.self_attn.q_norm.weight",
416
+ "language_model.layers.3.input_layernorm.weight",
417
+ "language_model.layers.3.post_attention_layernorm.weight",
418
+ "language_model.layers.3.self_attn.k_norm.weight",
419
+ "language_model.layers.3.self_attn.q_norm.weight",
420
+ "language_model.layers.4.input_layernorm.weight",
421
+ "language_model.layers.4.post_attention_layernorm.weight",
422
+ "language_model.layers.4.self_attn.k_norm.weight",
423
+ "language_model.layers.4.self_attn.q_norm.weight",
424
+ "language_model.layers.5.input_layernorm.weight",
425
+ "language_model.layers.5.post_attention_layernorm.weight",
426
+ "language_model.layers.5.self_attn.k_norm.weight",
427
+ "language_model.layers.5.self_attn.q_norm.weight",
428
+ "language_model.layers.6.input_layernorm.weight",
429
+ "language_model.layers.6.post_attention_layernorm.weight",
430
+ "language_model.layers.6.self_attn.k_norm.weight",
431
+ "language_model.layers.6.self_attn.q_norm.weight",
432
+ "language_model.layers.7.input_layernorm.weight",
433
+ "language_model.layers.7.post_attention_layernorm.weight",
434
+ "language_model.layers.7.self_attn.k_norm.weight",
435
+ "language_model.layers.7.self_attn.q_norm.weight",
436
+ "language_model.layers.8.input_layernorm.weight",
437
+ "language_model.layers.8.post_attention_layernorm.weight",
438
+ "language_model.layers.8.self_attn.k_norm.weight",
439
+ "language_model.layers.8.self_attn.q_norm.weight",
440
+ "language_model.layers.9.input_layernorm.weight",
441
+ "language_model.layers.9.post_attention_layernorm.weight",
442
+ "language_model.layers.9.self_attn.k_norm.weight",
443
+ "language_model.layers.9.self_attn.q_norm.weight",
444
+ "language_model.layers.10.input_layernorm.weight",
445
+ "language_model.layers.10.post_attention_layernorm.weight",
446
+ "language_model.layers.10.self_attn.k_norm.weight",
447
+ "language_model.layers.10.self_attn.q_norm.weight",
448
+ "language_model.layers.11.input_layernorm.weight",
449
+ "language_model.layers.11.post_attention_layernorm.weight",
450
+ "language_model.layers.11.self_attn.k_norm.weight",
451
+ "language_model.layers.11.self_attn.q_norm.weight",
452
+ "language_model.layers.12.input_layernorm.weight",
453
+ "language_model.layers.12.post_attention_layernorm.weight",
454
+ "language_model.layers.12.self_attn.k_norm.weight",
455
+ "language_model.layers.12.self_attn.q_norm.weight",
456
+ "language_model.layers.13.input_layernorm.weight",
457
+ "language_model.layers.13.post_attention_layernorm.weight",
458
+ "language_model.layers.13.self_attn.k_norm.weight",
459
+ "language_model.layers.13.self_attn.q_norm.weight",
460
+ "language_model.layers.14.input_layernorm.weight",
461
+ "language_model.layers.14.post_attention_layernorm.weight",
462
+ "language_model.layers.14.self_attn.k_norm.weight",
463
+ "language_model.layers.14.self_attn.q_norm.weight",
464
+ "language_model.layers.15.input_layernorm.weight",
465
+ "language_model.layers.15.post_attention_layernorm.weight",
466
+ "language_model.layers.15.self_attn.k_norm.weight",
467
+ "language_model.layers.15.self_attn.q_norm.weight",
468
+ "language_model.layers.16.input_layernorm.weight",
469
+ "language_model.layers.16.post_attention_layernorm.weight",
470
+ "language_model.layers.16.self_attn.k_norm.weight",
471
+ "language_model.layers.16.self_attn.q_norm.weight",
472
+ "language_model.layers.17.input_layernorm.weight",
473
+ "language_model.layers.17.post_attention_layernorm.weight",
474
+ "language_model.layers.17.self_attn.k_norm.weight",
475
+ "language_model.layers.17.self_attn.q_norm.weight",
476
+ "language_model.layers.18.input_layernorm.weight",
477
+ "language_model.layers.18.post_attention_layernorm.weight",
478
+ "language_model.layers.18.self_attn.k_norm.weight",
479
+ "language_model.layers.18.self_attn.q_norm.weight",
480
+ "language_model.layers.19.input_layernorm.weight",
481
+ "language_model.layers.19.post_attention_layernorm.weight",
482
+ "language_model.layers.19.self_attn.k_norm.weight",
483
+ "language_model.layers.19.self_attn.q_norm.weight",
484
+ "language_model.layers.20.input_layernorm.weight",
485
+ "language_model.layers.20.post_attention_layernorm.weight",
486
+ "language_model.layers.20.self_attn.k_norm.weight",
487
+ "language_model.layers.20.self_attn.q_norm.weight",
488
+ "language_model.layers.21.input_layernorm.weight",
489
+ "language_model.layers.21.post_attention_layernorm.weight",
490
+ "language_model.layers.21.self_attn.k_norm.weight",
491
+ "language_model.layers.21.self_attn.q_norm.weight",
492
+ "language_model.layers.22.input_layernorm.weight",
493
+ "language_model.layers.22.post_attention_layernorm.weight",
494
+ "language_model.layers.22.self_attn.k_norm.weight",
495
+ "language_model.layers.22.self_attn.q_norm.weight",
496
+ "language_model.layers.23.input_layernorm.weight",
497
+ "language_model.layers.23.post_attention_layernorm.weight",
498
+ "language_model.layers.23.self_attn.k_norm.weight",
499
+ "language_model.layers.23.self_attn.q_norm.weight",
500
+ "language_model.layers.24.input_layernorm.weight",
501
+ "language_model.layers.24.post_attention_layernorm.weight",
502
+ "language_model.layers.24.self_attn.k_norm.weight",
503
+ "language_model.layers.24.self_attn.q_norm.weight",
504
+ "language_model.layers.25.input_layernorm.weight",
505
+ "language_model.layers.25.post_attention_layernorm.weight",
506
+ "language_model.layers.25.self_attn.k_norm.weight",
507
+ "language_model.layers.25.self_attn.q_norm.weight",
508
+ "language_model.layers.26.input_layernorm.weight",
509
+ "language_model.layers.26.post_attention_layernorm.weight",
510
+ "language_model.layers.26.self_attn.k_norm.weight",
511
+ "language_model.layers.26.self_attn.q_norm.weight",
512
+ "language_model.layers.27.input_layernorm.weight",
513
+ "language_model.layers.27.post_attention_layernorm.weight",
514
+ "language_model.layers.27.self_attn.k_norm.weight",
515
+ "language_model.layers.27.self_attn.q_norm.weight",
516
+ "language_model.layers.28.input_layernorm.weight",
517
+ "language_model.layers.28.post_attention_layernorm.weight",
518
+ "language_model.layers.28.self_attn.k_norm.weight",
519
+ "language_model.layers.28.self_attn.q_norm.weight",
520
+ "language_model.layers.29.input_layernorm.weight",
521
+ "language_model.layers.29.post_attention_layernorm.weight",
522
+ "language_model.layers.29.self_attn.k_norm.weight",
523
+ "language_model.layers.29.self_attn.q_norm.weight",
524
+ "language_model.layers.30.input_layernorm.weight",
525
+ "language_model.layers.30.post_attention_layernorm.weight",
526
+ "language_model.layers.30.self_attn.k_norm.weight",
527
+ "language_model.layers.30.self_attn.q_norm.weight",
528
+ "language_model.layers.31.input_layernorm.weight",
529
+ "language_model.layers.31.post_attention_layernorm.weight",
530
+ "language_model.layers.31.self_attn.k_norm.weight",
531
+ "language_model.layers.31.self_attn.q_norm.weight",
532
+ "language_model.layers.32.input_layernorm.weight",
533
+ "language_model.layers.32.post_attention_layernorm.weight",
534
+ "language_model.layers.32.self_attn.k_norm.weight",
535
+ "language_model.layers.32.self_attn.q_norm.weight",
536
+ "language_model.layers.33.input_layernorm.weight",
537
+ "language_model.layers.33.post_attention_layernorm.weight",
538
+ "language_model.layers.33.self_attn.k_norm.weight",
539
+ "language_model.layers.33.self_attn.q_norm.weight",
540
+ "language_model.layers.34.input_layernorm.weight",
541
+ "language_model.layers.34.post_attention_layernorm.weight",
542
+ "language_model.layers.34.self_attn.k_norm.weight",
543
+ "language_model.layers.34.self_attn.q_norm.weight",
544
+ "language_model.layers.35.input_layernorm.weight",
545
+ "language_model.layers.35.post_attention_layernorm.weight",
546
+ "language_model.layers.35.self_attn.k_norm.weight",
547
+ "language_model.layers.35.self_attn.q_norm.weight",
548
+ "language_model.norm.weight",
549
+ "visual.blocks.0.norm1.weight",
550
+ "visual.blocks.0.norm2.weight",
551
+ "visual.blocks.1.norm1.weight",
552
+ "visual.blocks.1.norm2.weight",
553
+ "visual.blocks.2.norm1.weight",
554
+ "visual.blocks.2.norm2.weight",
555
+ "visual.blocks.3.norm1.weight",
556
+ "visual.blocks.3.norm2.weight",
557
+ "visual.blocks.4.norm1.weight",
558
+ "visual.blocks.4.norm2.weight",
559
+ "visual.blocks.5.norm1.weight",
560
+ "visual.blocks.5.norm2.weight",
561
+ "visual.blocks.6.norm1.weight",
562
+ "visual.blocks.6.norm2.weight",
563
+ "visual.blocks.7.norm1.weight",
564
+ "visual.blocks.7.norm2.weight",
565
+ "visual.blocks.8.norm1.weight",
566
+ "visual.blocks.8.norm2.weight",
567
+ "visual.blocks.9.norm1.weight",
568
+ "visual.blocks.9.norm2.weight",
569
+ "visual.blocks.10.norm1.weight",
570
+ "visual.blocks.10.norm2.weight",
571
+ "visual.blocks.11.norm1.weight",
572
+ "visual.blocks.11.norm2.weight",
573
+ "visual.blocks.12.norm1.weight",
574
+ "visual.blocks.12.norm2.weight",
575
+ "visual.blocks.13.norm1.weight",
576
+ "visual.blocks.13.norm2.weight",
577
+ "visual.blocks.14.norm1.weight",
578
+ "visual.blocks.14.norm2.weight",
579
+ "visual.blocks.15.norm1.weight",
580
+ "visual.blocks.15.norm2.weight",
581
+ "visual.blocks.16.norm1.weight",
582
+ "visual.blocks.16.norm2.weight",
583
+ "visual.blocks.17.norm1.weight",
584
+ "visual.blocks.17.norm2.weight",
585
+ "visual.blocks.18.norm1.weight",
586
+ "visual.blocks.18.norm2.weight",
587
+ "visual.blocks.19.norm1.weight",
588
+ "visual.blocks.19.norm2.weight",
589
+ "visual.blocks.20.norm1.weight",
590
+ "visual.blocks.20.norm2.weight",
591
+ "visual.blocks.21.norm1.weight",
592
+ "visual.blocks.21.norm2.weight",
593
+ "visual.blocks.22.norm1.weight",
594
+ "visual.blocks.22.norm2.weight",
595
+ "visual.blocks.23.norm1.weight",
596
+ "visual.blocks.23.norm2.weight",
597
+ "visual.deepstack_merger_list.0.norm.weight",
598
+ "visual.deepstack_merger_list.1.norm.weight",
599
+ "visual.deepstack_merger_list.2.norm.weight",
600
+ "visual.merger.norm.weight",
601
+ "visual.pos_embed.weight"
602
+ ],
603
+ "modules_to_not_use_matmul": [],
604
+ "non_blocking": false,
605
+ "quant_conv": false,
606
+ "quant_embedding": false,
607
+ "quant_method": "sdnq",
608
+ "quantization_device": null,
609
+ "quantized_matmul_dtype": null,
610
+ "return_device": null,
611
+ "sdnq_version": "0.2.0",
612
+ "svd_rank": 32,
613
+ "svd_steps": 8,
614
+ "use_dynamic_quantization": true,
615
+ "use_grad_ckpt": true,
616
+ "use_hadamard": true,
617
+ "use_quantized_matmul": false,
618
+ "use_quantized_matmul_conv": false,
619
+ "use_static_quantization": true,
620
+ "use_stochastic_rounding": false,
621
+ "use_svd": false,
622
+ "weights_dtype": "uint4"
623
+ },
624
+ "text_config": {
625
+ "attention_bias": false,
626
+ "attention_dropout": 0.0,
627
+ "bos_token_id": 151643,
628
+ "dtype": "bfloat16",
629
+ "eos_token_id": 151645,
630
+ "head_dim": 128,
631
+ "hidden_act": "silu",
632
+ "hidden_size": 2560,
633
+ "initializer_range": 0.02,
634
+ "intermediate_size": 9728,
635
+ "max_position_embeddings": 262144,
636
+ "model_type": "qwen3_vl_text",
637
+ "num_attention_heads": 32,
638
+ "num_hidden_layers": 36,
639
+ "num_key_value_heads": 8,
640
+ "pad_token_id": null,
641
+ "rms_norm_eps": 1e-06,
642
+ "rope_parameters": {
643
+ "mrope_interleaved": true,
644
+ "mrope_section": [
645
+ 24,
646
+ 20,
647
+ 20
648
+ ],
649
+ "rope_theta": 5000000,
650
+ "rope_type": "default"
651
+ },
652
+ "tie_word_embeddings": true,
653
+ "use_cache": true,
654
+ "vocab_size": 151936
655
+ },
656
+ "tie_word_embeddings": true,
657
+ "transformers_version": "5.3.0",
658
+ "video_token_id": 151656,
659
+ "vision_config": {
660
+ "deepstack_visual_indexes": [
661
+ 5,
662
+ 11,
663
+ 17
664
+ ],
665
+ "depth": 24,
666
+ "dtype": "bfloat16",
667
+ "hidden_act": "gelu_pytorch_tanh",
668
+ "hidden_size": 1024,
669
+ "in_channels": 3,
670
+ "initializer_range": 0.02,
671
+ "intermediate_size": 4096,
672
+ "model_type": "qwen3_vl",
673
+ "num_heads": 16,
674
+ "num_position_embeddings": 2304,
675
+ "out_hidden_size": 2560,
676
+ "patch_size": 16,
677
+ "spatial_merge_size": 2,
678
+ "temporal_patch_size": 2
679
+ },
680
+ "vision_end_token_id": 151653,
681
+ "vision_start_token_id": 151652
682
+ }
text_encoder/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:afbf7bf5538760a82714c5f15e3d17aee1ed7fd6443a0d6be6419dd7cec68a51
3
+ size 3062036496
tokenizer/chat_template.jinja ADDED
@@ -0,0 +1,120 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0].role == 'system' %}
4
+ {%- if messages[0].content is string %}
5
+ {{- messages[0].content }}
6
+ {%- else %}
7
+ {%- for content in messages[0].content %}
8
+ {%- if 'text' in content %}
9
+ {{- content.text }}
10
+ {%- endif %}
11
+ {%- endfor %}
12
+ {%- endif %}
13
+ {{- '\n\n' }}
14
+ {%- endif %}
15
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
16
+ {%- for tool in tools %}
17
+ {{- "\n" }}
18
+ {{- tool | tojson }}
19
+ {%- endfor %}
20
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
21
+ {%- else %}
22
+ {%- if messages[0].role == 'system' %}
23
+ {{- '<|im_start|>system\n' }}
24
+ {%- if messages[0].content is string %}
25
+ {{- messages[0].content }}
26
+ {%- else %}
27
+ {%- for content in messages[0].content %}
28
+ {%- if 'text' in content %}
29
+ {{- content.text }}
30
+ {%- endif %}
31
+ {%- endfor %}
32
+ {%- endif %}
33
+ {{- '<|im_end|>\n' }}
34
+ {%- endif %}
35
+ {%- endif %}
36
+ {%- set image_count = namespace(value=0) %}
37
+ {%- set video_count = namespace(value=0) %}
38
+ {%- for message in messages %}
39
+ {%- if message.role == "user" %}
40
+ {{- '<|im_start|>' + message.role + '\n' }}
41
+ {%- if message.content is string %}
42
+ {{- message.content }}
43
+ {%- else %}
44
+ {%- for content in message.content %}
45
+ {%- if content.type == 'image' or 'image' in content or 'image_url' in content %}
46
+ {%- set image_count.value = image_count.value + 1 %}
47
+ {%- if add_vision_id %}Picture {{ image_count.value }}: {% endif -%}
48
+ <|vision_start|><|image_pad|><|vision_end|>
49
+ {%- elif content.type == 'video' or 'video' in content %}
50
+ {%- set video_count.value = video_count.value + 1 %}
51
+ {%- if add_vision_id %}Video {{ video_count.value }}: {% endif -%}
52
+ <|vision_start|><|video_pad|><|vision_end|>
53
+ {%- elif 'text' in content %}
54
+ {{- content.text }}
55
+ {%- endif %}
56
+ {%- endfor %}
57
+ {%- endif %}
58
+ {{- '<|im_end|>\n' }}
59
+ {%- elif message.role == "assistant" %}
60
+ {{- '<|im_start|>' + message.role + '\n' }}
61
+ {%- if message.content is string %}
62
+ {{- message.content }}
63
+ {%- else %}
64
+ {%- for content_item in message.content %}
65
+ {%- if 'text' in content_item %}
66
+ {{- content_item.text }}
67
+ {%- endif %}
68
+ {%- endfor %}
69
+ {%- endif %}
70
+ {%- if message.tool_calls %}
71
+ {%- for tool_call in message.tool_calls %}
72
+ {%- if (loop.first and message.content) or (not loop.first) %}
73
+ {{- '\n' }}
74
+ {%- endif %}
75
+ {%- if tool_call.function %}
76
+ {%- set tool_call = tool_call.function %}
77
+ {%- endif %}
78
+ {{- '<tool_call>\n{"name": "' }}
79
+ {{- tool_call.name }}
80
+ {{- '", "arguments": ' }}
81
+ {%- if tool_call.arguments is string %}
82
+ {{- tool_call.arguments }}
83
+ {%- else %}
84
+ {{- tool_call.arguments | tojson }}
85
+ {%- endif %}
86
+ {{- '}\n</tool_call>' }}
87
+ {%- endfor %}
88
+ {%- endif %}
89
+ {{- '<|im_end|>\n' }}
90
+ {%- elif message.role == "tool" %}
91
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
92
+ {{- '<|im_start|>user' }}
93
+ {%- endif %}
94
+ {{- '\n<tool_response>\n' }}
95
+ {%- if message.content is string %}
96
+ {{- message.content }}
97
+ {%- else %}
98
+ {%- for content in message.content %}
99
+ {%- if content.type == 'image' or 'image' in content or 'image_url' in content %}
100
+ {%- set image_count.value = image_count.value + 1 %}
101
+ {%- if add_vision_id %}Picture {{ image_count.value }}: {% endif -%}
102
+ <|vision_start|><|image_pad|><|vision_end|>
103
+ {%- elif content.type == 'video' or 'video' in content %}
104
+ {%- set video_count.value = video_count.value + 1 %}
105
+ {%- if add_vision_id %}Video {{ video_count.value }}: {% endif -%}
106
+ <|vision_start|><|video_pad|><|vision_end|>
107
+ {%- elif 'text' in content %}
108
+ {{- content.text }}
109
+ {%- endif %}
110
+ {%- endfor %}
111
+ {%- endif %}
112
+ {{- '\n</tool_response>' }}
113
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
114
+ {{- '<|im_end|>\n' }}
115
+ {%- endif %}
116
+ {%- endif %}
117
+ {%- endfor %}
118
+ {%- if add_generation_prompt %}
119
+ {{- '<|im_start|>assistant\n' }}
120
+ {%- endif %}
tokenizer/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
3
+ size 11422650
tokenizer/tokenizer_config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "model_max_length": 262144,
25
+ "pad_token": "<|endoftext|>",
26
+ "split_special_tokens": false,
27
+ "tokenizer_class": "Qwen2Tokenizer",
28
+ "unk_token": null
29
+ }
transformer/config.json ADDED
@@ -0,0 +1,350 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_class_name": "Krea2Transformer2DModel",
3
+ "_diffusers_version": "0.39.0.dev0",
4
+ "_name_or_path": "/home/ozzy/Documents/models/Krea-2-Turbo/transformer",
5
+ "attention_head_dim": 128,
6
+ "axes_dims_rope": [
7
+ 32,
8
+ 48,
9
+ 48
10
+ ],
11
+ "in_channels": 64,
12
+ "intermediate_size": 16384,
13
+ "norm_eps": 1e-05,
14
+ "num_attention_heads": 48,
15
+ "num_key_value_heads": 12,
16
+ "num_layers": 28,
17
+ "num_layerwise_text_blocks": 2,
18
+ "num_refiner_text_blocks": 2,
19
+ "num_text_layers": 12,
20
+ "quantization_config": {
21
+ "add_skip_keys": true,
22
+ "dequantize_fp32": false,
23
+ "dynamic_loss_threshold": 0.01,
24
+ "group_size": 0,
25
+ "hadamard_group_size": 256,
26
+ "is_integer": true,
27
+ "is_training": false,
28
+ "modules_dtype_dict": {
29
+ "uint4": [
30
+ "text_fusion.projector.weight",
31
+ "time_mod_proj.weight",
32
+ "text_fusion.layerwise_blocks.0.attn.to_gate.weight",
33
+ "text_fusion.layerwise_blocks.0.attn.to_k.weight",
34
+ "text_fusion.layerwise_blocks.0.attn.to_out.0.weight",
35
+ "text_fusion.layerwise_blocks.0.attn.to_q.weight",
36
+ "text_fusion.layerwise_blocks.0.attn.to_v.weight",
37
+ "text_fusion.layerwise_blocks.0.ff.down.weight",
38
+ "text_fusion.layerwise_blocks.0.ff.gate.weight",
39
+ "text_fusion.layerwise_blocks.0.ff.up.weight",
40
+ "text_fusion.layerwise_blocks.1.attn.to_gate.weight",
41
+ "text_fusion.layerwise_blocks.1.attn.to_k.weight",
42
+ "text_fusion.layerwise_blocks.1.attn.to_out.0.weight",
43
+ "text_fusion.layerwise_blocks.1.attn.to_q.weight",
44
+ "text_fusion.layerwise_blocks.1.attn.to_v.weight",
45
+ "text_fusion.layerwise_blocks.1.ff.down.weight",
46
+ "text_fusion.layerwise_blocks.1.ff.gate.weight",
47
+ "text_fusion.layerwise_blocks.1.ff.up.weight",
48
+ "text_fusion.refiner_blocks.0.attn.to_gate.weight",
49
+ "text_fusion.refiner_blocks.0.attn.to_k.weight",
50
+ "text_fusion.refiner_blocks.0.attn.to_out.0.weight",
51
+ "text_fusion.refiner_blocks.0.attn.to_q.weight",
52
+ "text_fusion.refiner_blocks.0.attn.to_v.weight",
53
+ "text_fusion.refiner_blocks.0.ff.down.weight",
54
+ "text_fusion.refiner_blocks.0.ff.gate.weight",
55
+ "text_fusion.refiner_blocks.0.ff.up.weight",
56
+ "text_fusion.refiner_blocks.1.attn.to_gate.weight",
57
+ "text_fusion.refiner_blocks.1.attn.to_k.weight",
58
+ "text_fusion.refiner_blocks.1.attn.to_out.0.weight",
59
+ "text_fusion.refiner_blocks.1.attn.to_q.weight",
60
+ "text_fusion.refiner_blocks.1.attn.to_v.weight",
61
+ "text_fusion.refiner_blocks.1.ff.down.weight",
62
+ "text_fusion.refiner_blocks.1.ff.gate.weight",
63
+ "text_fusion.refiner_blocks.1.ff.up.weight",
64
+ "transformer_blocks.0.attn.to_gate.weight",
65
+ "transformer_blocks.0.attn.to_k.weight",
66
+ "transformer_blocks.0.attn.to_out.0.weight",
67
+ "transformer_blocks.0.attn.to_q.weight",
68
+ "transformer_blocks.0.attn.to_v.weight",
69
+ "transformer_blocks.0.ff.down.weight",
70
+ "transformer_blocks.0.ff.gate.weight",
71
+ "transformer_blocks.0.ff.up.weight",
72
+ "transformer_blocks.1.attn.to_gate.weight",
73
+ "transformer_blocks.1.attn.to_k.weight",
74
+ "transformer_blocks.1.attn.to_out.0.weight",
75
+ "transformer_blocks.1.attn.to_q.weight",
76
+ "transformer_blocks.1.attn.to_v.weight",
77
+ "transformer_blocks.1.ff.down.weight",
78
+ "transformer_blocks.1.ff.gate.weight",
79
+ "transformer_blocks.1.ff.up.weight",
80
+ "transformer_blocks.2.attn.to_gate.weight",
81
+ "transformer_blocks.2.attn.to_k.weight",
82
+ "transformer_blocks.2.attn.to_out.0.weight",
83
+ "transformer_blocks.2.attn.to_q.weight",
84
+ "transformer_blocks.2.attn.to_v.weight",
85
+ "transformer_blocks.2.ff.down.weight",
86
+ "transformer_blocks.2.ff.gate.weight",
87
+ "transformer_blocks.2.ff.up.weight",
88
+ "transformer_blocks.3.attn.to_gate.weight",
89
+ "transformer_blocks.3.attn.to_k.weight",
90
+ "transformer_blocks.3.attn.to_out.0.weight",
91
+ "transformer_blocks.3.attn.to_q.weight",
92
+ "transformer_blocks.3.attn.to_v.weight",
93
+ "transformer_blocks.3.ff.down.weight",
94
+ "transformer_blocks.3.ff.gate.weight",
95
+ "transformer_blocks.3.ff.up.weight",
96
+ "transformer_blocks.4.attn.to_gate.weight",
97
+ "transformer_blocks.4.attn.to_k.weight",
98
+ "transformer_blocks.4.attn.to_out.0.weight",
99
+ "transformer_blocks.4.attn.to_q.weight",
100
+ "transformer_blocks.4.attn.to_v.weight",
101
+ "transformer_blocks.4.ff.down.weight",
102
+ "transformer_blocks.4.ff.gate.weight",
103
+ "transformer_blocks.4.ff.up.weight",
104
+ "transformer_blocks.5.attn.to_gate.weight",
105
+ "transformer_blocks.5.attn.to_k.weight",
106
+ "transformer_blocks.5.attn.to_out.0.weight",
107
+ "transformer_blocks.5.attn.to_q.weight",
108
+ "transformer_blocks.5.attn.to_v.weight",
109
+ "transformer_blocks.5.ff.down.weight",
110
+ "transformer_blocks.5.ff.gate.weight",
111
+ "transformer_blocks.5.ff.up.weight",
112
+ "transformer_blocks.6.attn.to_gate.weight",
113
+ "transformer_blocks.6.attn.to_k.weight",
114
+ "transformer_blocks.6.attn.to_out.0.weight",
115
+ "transformer_blocks.6.attn.to_q.weight",
116
+ "transformer_blocks.6.attn.to_v.weight",
117
+ "transformer_blocks.6.ff.down.weight",
118
+ "transformer_blocks.6.ff.gate.weight",
119
+ "transformer_blocks.6.ff.up.weight",
120
+ "transformer_blocks.7.attn.to_gate.weight",
121
+ "transformer_blocks.7.attn.to_k.weight",
122
+ "transformer_blocks.7.attn.to_out.0.weight",
123
+ "transformer_blocks.7.attn.to_q.weight",
124
+ "transformer_blocks.7.attn.to_v.weight",
125
+ "transformer_blocks.7.ff.down.weight",
126
+ "transformer_blocks.7.ff.gate.weight",
127
+ "transformer_blocks.7.ff.up.weight",
128
+ "transformer_blocks.8.attn.to_gate.weight",
129
+ "transformer_blocks.8.attn.to_k.weight",
130
+ "transformer_blocks.8.attn.to_out.0.weight",
131
+ "transformer_blocks.8.attn.to_q.weight",
132
+ "transformer_blocks.8.attn.to_v.weight",
133
+ "transformer_blocks.8.ff.down.weight",
134
+ "transformer_blocks.8.ff.gate.weight",
135
+ "transformer_blocks.8.ff.up.weight",
136
+ "transformer_blocks.9.attn.to_gate.weight",
137
+ "transformer_blocks.9.attn.to_k.weight",
138
+ "transformer_blocks.9.attn.to_q.weight",
139
+ "transformer_blocks.9.attn.to_v.weight",
140
+ "transformer_blocks.10.attn.to_gate.weight",
141
+ "transformer_blocks.10.attn.to_k.weight",
142
+ "transformer_blocks.10.attn.to_out.0.weight",
143
+ "transformer_blocks.10.attn.to_q.weight",
144
+ "transformer_blocks.10.attn.to_v.weight",
145
+ "transformer_blocks.10.ff.down.weight",
146
+ "transformer_blocks.10.ff.gate.weight",
147
+ "transformer_blocks.10.ff.up.weight",
148
+ "transformer_blocks.11.attn.to_gate.weight",
149
+ "transformer_blocks.11.attn.to_k.weight",
150
+ "transformer_blocks.11.attn.to_out.0.weight",
151
+ "transformer_blocks.11.attn.to_q.weight",
152
+ "transformer_blocks.11.attn.to_v.weight",
153
+ "transformer_blocks.11.ff.down.weight",
154
+ "transformer_blocks.11.ff.gate.weight",
155
+ "transformer_blocks.11.ff.up.weight",
156
+ "transformer_blocks.12.attn.to_gate.weight",
157
+ "transformer_blocks.12.attn.to_k.weight",
158
+ "transformer_blocks.12.attn.to_out.0.weight",
159
+ "transformer_blocks.12.attn.to_q.weight",
160
+ "transformer_blocks.12.attn.to_v.weight",
161
+ "transformer_blocks.12.ff.down.weight",
162
+ "transformer_blocks.12.ff.gate.weight",
163
+ "transformer_blocks.12.ff.up.weight",
164
+ "transformer_blocks.13.attn.to_gate.weight",
165
+ "transformer_blocks.13.attn.to_k.weight",
166
+ "transformer_blocks.13.attn.to_out.0.weight",
167
+ "transformer_blocks.13.attn.to_q.weight",
168
+ "transformer_blocks.13.attn.to_v.weight",
169
+ "transformer_blocks.13.ff.down.weight",
170
+ "transformer_blocks.13.ff.gate.weight",
171
+ "transformer_blocks.13.ff.up.weight",
172
+ "transformer_blocks.14.attn.to_gate.weight",
173
+ "transformer_blocks.14.attn.to_k.weight",
174
+ "transformer_blocks.14.attn.to_out.0.weight",
175
+ "transformer_blocks.14.attn.to_q.weight",
176
+ "transformer_blocks.14.attn.to_v.weight",
177
+ "transformer_blocks.14.ff.down.weight",
178
+ "transformer_blocks.14.ff.gate.weight",
179
+ "transformer_blocks.14.ff.up.weight",
180
+ "transformer_blocks.15.attn.to_gate.weight",
181
+ "transformer_blocks.15.attn.to_k.weight",
182
+ "transformer_blocks.15.attn.to_out.0.weight",
183
+ "transformer_blocks.15.attn.to_q.weight",
184
+ "transformer_blocks.15.attn.to_v.weight",
185
+ "transformer_blocks.15.ff.down.weight",
186
+ "transformer_blocks.15.ff.gate.weight",
187
+ "transformer_blocks.15.ff.up.weight",
188
+ "transformer_blocks.16.attn.to_gate.weight",
189
+ "transformer_blocks.16.attn.to_k.weight",
190
+ "transformer_blocks.16.attn.to_out.0.weight",
191
+ "transformer_blocks.16.attn.to_q.weight",
192
+ "transformer_blocks.16.attn.to_v.weight",
193
+ "transformer_blocks.16.ff.down.weight",
194
+ "transformer_blocks.16.ff.gate.weight",
195
+ "transformer_blocks.16.ff.up.weight",
196
+ "transformer_blocks.17.attn.to_gate.weight",
197
+ "transformer_blocks.17.attn.to_k.weight",
198
+ "transformer_blocks.17.attn.to_out.0.weight",
199
+ "transformer_blocks.17.attn.to_q.weight",
200
+ "transformer_blocks.17.attn.to_v.weight",
201
+ "transformer_blocks.17.ff.down.weight",
202
+ "transformer_blocks.17.ff.gate.weight",
203
+ "transformer_blocks.17.ff.up.weight",
204
+ "transformer_blocks.18.attn.to_gate.weight",
205
+ "transformer_blocks.18.attn.to_k.weight",
206
+ "transformer_blocks.18.attn.to_out.0.weight",
207
+ "transformer_blocks.18.attn.to_q.weight",
208
+ "transformer_blocks.18.attn.to_v.weight",
209
+ "transformer_blocks.18.ff.down.weight",
210
+ "transformer_blocks.18.ff.gate.weight",
211
+ "transformer_blocks.18.ff.up.weight",
212
+ "transformer_blocks.19.attn.to_gate.weight",
213
+ "transformer_blocks.19.attn.to_k.weight",
214
+ "transformer_blocks.19.attn.to_out.0.weight",
215
+ "transformer_blocks.19.attn.to_q.weight",
216
+ "transformer_blocks.19.attn.to_v.weight",
217
+ "transformer_blocks.19.ff.down.weight",
218
+ "transformer_blocks.19.ff.gate.weight",
219
+ "transformer_blocks.19.ff.up.weight",
220
+ "transformer_blocks.20.attn.to_gate.weight",
221
+ "transformer_blocks.20.attn.to_k.weight",
222
+ "transformer_blocks.20.attn.to_out.0.weight",
223
+ "transformer_blocks.20.attn.to_q.weight",
224
+ "transformer_blocks.20.attn.to_v.weight",
225
+ "transformer_blocks.20.ff.gate.weight",
226
+ "transformer_blocks.9.attn.to_out.0.weight",
227
+ "transformer_blocks.9.ff.down.weight",
228
+ "transformer_blocks.9.ff.gate.weight",
229
+ "transformer_blocks.9.ff.up.weight",
230
+ "transformer_blocks.20.ff.down.weight",
231
+ "transformer_blocks.20.ff.up.weight",
232
+ "transformer_blocks.21.attn.to_gate.weight",
233
+ "transformer_blocks.21.attn.to_k.weight",
234
+ "transformer_blocks.21.attn.to_out.0.weight",
235
+ "transformer_blocks.21.attn.to_q.weight",
236
+ "transformer_blocks.21.attn.to_v.weight",
237
+ "transformer_blocks.21.ff.down.weight",
238
+ "transformer_blocks.21.ff.gate.weight",
239
+ "transformer_blocks.21.ff.up.weight",
240
+ "transformer_blocks.22.attn.to_gate.weight",
241
+ "transformer_blocks.22.attn.to_k.weight",
242
+ "transformer_blocks.22.attn.to_out.0.weight",
243
+ "transformer_blocks.22.attn.to_q.weight",
244
+ "transformer_blocks.22.attn.to_v.weight",
245
+ "transformer_blocks.22.ff.down.weight",
246
+ "transformer_blocks.22.ff.gate.weight",
247
+ "transformer_blocks.22.ff.up.weight",
248
+ "transformer_blocks.23.attn.to_gate.weight",
249
+ "transformer_blocks.23.attn.to_k.weight",
250
+ "transformer_blocks.23.attn.to_out.0.weight",
251
+ "transformer_blocks.23.attn.to_q.weight",
252
+ "transformer_blocks.23.attn.to_v.weight",
253
+ "transformer_blocks.23.ff.down.weight",
254
+ "transformer_blocks.23.ff.gate.weight",
255
+ "transformer_blocks.23.ff.up.weight",
256
+ "transformer_blocks.24.attn.to_gate.weight",
257
+ "transformer_blocks.24.attn.to_k.weight",
258
+ "transformer_blocks.24.attn.to_out.0.weight",
259
+ "transformer_blocks.24.attn.to_q.weight",
260
+ "transformer_blocks.24.attn.to_v.weight",
261
+ "transformer_blocks.24.ff.down.weight",
262
+ "transformer_blocks.24.ff.gate.weight",
263
+ "transformer_blocks.24.ff.up.weight",
264
+ "transformer_blocks.25.attn.to_gate.weight",
265
+ "transformer_blocks.25.attn.to_k.weight",
266
+ "transformer_blocks.25.attn.to_out.0.weight",
267
+ "transformer_blocks.25.attn.to_q.weight",
268
+ "transformer_blocks.25.attn.to_v.weight",
269
+ "transformer_blocks.25.ff.down.weight",
270
+ "transformer_blocks.25.ff.gate.weight",
271
+ "transformer_blocks.25.ff.up.weight",
272
+ "transformer_blocks.26.attn.to_gate.weight",
273
+ "transformer_blocks.26.attn.to_k.weight",
274
+ "transformer_blocks.26.attn.to_out.0.weight",
275
+ "transformer_blocks.26.attn.to_q.weight",
276
+ "transformer_blocks.26.attn.to_v.weight",
277
+ "transformer_blocks.26.ff.down.weight",
278
+ "transformer_blocks.26.ff.gate.weight",
279
+ "transformer_blocks.26.ff.up.weight",
280
+ "transformer_blocks.27.attn.to_gate.weight",
281
+ "transformer_blocks.27.attn.to_k.weight",
282
+ "transformer_blocks.27.attn.to_out.0.weight",
283
+ "transformer_blocks.27.attn.to_q.weight",
284
+ "transformer_blocks.27.attn.to_v.weight",
285
+ "transformer_blocks.27.ff.down.weight",
286
+ "transformer_blocks.27.ff.gate.weight",
287
+ "transformer_blocks.27.ff.up.weight"
288
+ ]
289
+ },
290
+ "modules_quant_config": {},
291
+ "modules_to_not_convert": [
292
+ "norm",
293
+ "norm_k",
294
+ "time_embed",
295
+ ".condition_embedder",
296
+ "patch_embed",
297
+ ".emb_in",
298
+ ".txt_out",
299
+ ".context_embedder",
300
+ ".vid_out",
301
+ "lm_head",
302
+ ".time_embed",
303
+ "norm1",
304
+ ".img_out",
305
+ "norm_q",
306
+ ".final_layer",
307
+ "patch_emb",
308
+ ".norm_out",
309
+ ".txt_in",
310
+ "multi_modal_projector",
311
+ ".proj_out",
312
+ "patch_embedding",
313
+ ".vid_in",
314
+ ".t_embedder",
315
+ ".x_embedder",
316
+ "time_text_embed",
317
+ ".emb_out",
318
+ "norm2",
319
+ ".img_in",
320
+ "wte",
321
+ ".y_embedder"
322
+ ],
323
+ "modules_to_not_use_matmul": [],
324
+ "non_blocking": false,
325
+ "quant_conv": false,
326
+ "quant_embedding": false,
327
+ "quant_method": "sdnq",
328
+ "quantization_device": null,
329
+ "quantized_matmul_dtype": null,
330
+ "return_device": null,
331
+ "sdnq_version": "0.2.0",
332
+ "svd_rank": 32,
333
+ "svd_steps": 8,
334
+ "use_dynamic_quantization": true,
335
+ "use_grad_ckpt": true,
336
+ "use_hadamard": true,
337
+ "use_quantized_matmul": false,
338
+ "use_quantized_matmul_conv": false,
339
+ "use_static_quantization": true,
340
+ "use_stochastic_rounding": false,
341
+ "use_svd": false,
342
+ "weights_dtype": "uint4"
343
+ },
344
+ "rope_theta": 1000.0,
345
+ "text_hidden_dim": 2560,
346
+ "text_intermediate_size": 6912,
347
+ "text_num_attention_heads": 20,
348
+ "text_num_key_value_heads": 20,
349
+ "timestep_embed_dim": 256
350
+ }
transformer/diffusion_pytorch_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b42987209cbbc14daebe46b65053a16336a376bc644e194f07fd1955488d6c3e
3
+ size 7348837562
vae/config.json ADDED
@@ -0,0 +1,58 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_class_name": "AutoencoderKLQwenImage",
3
+ "_diffusers_version": "0.39.0.dev0",
4
+ "_name_or_path": "Qwen/Qwen-Image",
5
+ "attn_scales": [],
6
+ "base_dim": 96,
7
+ "dim_mult": [
8
+ 1,
9
+ 2,
10
+ 4,
11
+ 4
12
+ ],
13
+ "dropout": 0.0,
14
+ "input_channels": 3,
15
+ "latents_mean": [
16
+ -0.7571,
17
+ -0.7089,
18
+ -0.9113,
19
+ 0.1075,
20
+ -0.1745,
21
+ 0.9653,
22
+ -0.1517,
23
+ 1.5508,
24
+ 0.4134,
25
+ -0.0715,
26
+ 0.5517,
27
+ -0.3632,
28
+ -0.1922,
29
+ -0.9497,
30
+ 0.2503,
31
+ -0.2921
32
+ ],
33
+ "latents_std": [
34
+ 2.8184,
35
+ 1.4541,
36
+ 2.3275,
37
+ 2.6558,
38
+ 1.2196,
39
+ 1.7708,
40
+ 2.6052,
41
+ 2.0743,
42
+ 3.2687,
43
+ 2.1526,
44
+ 2.8652,
45
+ 1.5579,
46
+ 1.6382,
47
+ 1.1253,
48
+ 2.8251,
49
+ 1.916
50
+ ],
51
+ "num_res_blocks": 2,
52
+ "temperal_downsample": [
53
+ false,
54
+ true,
55
+ true
56
+ ],
57
+ "z_dim": 16
58
+ }
vae/diffusion_pytorch_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ab1b61103959913d6c7e628cf793dbb2ca4726a40a3b3ae206c52b8e75bf6f08
3
+ size 507591892