programmer-666 commited on
Commit
f8fa4a1
·
verified ·
1 Parent(s): 25aa428

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md CHANGED
@@ -1,231 +1,7 @@
1
  ---
2
- base_model: deepreinforce-ai/Ornith-1.0-35B
3
- base_model_relation: quantized
4
- license: apache-2.0
5
- library_name: mlx
6
  pipeline_tag: text-generation
 
7
  tags:
8
  - mlx
9
- - mlx-optiq
10
- - quantization
11
- - moe
12
- - qwen3.5
13
- - qwen35moe
14
- - apple-silicon
15
- - speculative-decoding
16
- - multi-token-prediction
17
- - qwen3_5
18
  ---
19
-
20
- # Ornith-1.0-35B-oQ7-mtp
21
-
22
- MLX format quantization of [deepreinforce-ai/Ornith-1.0-35B](https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B), produced with mlx-optiq and shipped with a grafted Multi-Token Prediction (MTP) head for speculative decoding on Apple Silicon.
23
-
24
- ## Model Details
25
-
26
- ### Model Description
27
-
28
- This repository contains a mixed precision MLX quantization of Ornith-1.0-35B, a Qwen3.5-35B-A3B based mixture of experts model. The quantization was produced with mlx-optiq, which performs a per-layer KL sensitivity analysis against the original BF16 checkpoint and assigns each layer either 6-bit or 8-bit precision so that the weighted average lands at a target of 7.5 bits per weight (BPW). Layers that are more sensitive to quantization error are kept at 8-bit, while more robust layers are reduced to 6-bit.
29
-
30
- An auxiliary MTP head, grafted from `mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit`, is included as `mtp.safetensors`. It is used as a self-speculative draft model during decoding and is architecturally compatible because Qwen3.5-35B-A3B and Qwen3.6-35B-A3B share the same hidden size, layer count, expert count, and block layout, and Ornith is fine-tuned directly from Qwen3.5-35B-A3B.
31
-
32
- - **Developed by:** programmer-666
33
- - **Model type:** Causal decoder only mixture of experts language model (Qwen3.5-35B-A3B architecture, qwen35moe, 40 layers)
34
- - **Language(s):** Inherited from the base model
35
- - **License:** Apache 2.0 for this repository. See the Licenses section below for the licenses of the underlying components.
36
- - **Quantized from model:** [deepreinforce-ai/Ornith-1.0-35B](https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B)
37
- - **MTP head source:** [mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit](https://huggingface.co/mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit)
38
-
39
- ### Model Sources
40
-
41
- - **Base model:** https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B
42
- - **Quantization tool:** https://mlx-optiq.com
43
- - **Serving engine used for benchmarks:** https://github.com/jundot/omlx
44
-
45
- ## Model Properties
46
-
47
- | Property | Value |
48
- |---|---|
49
- | Base model | deepreinforce-ai/Ornith-1.0-35B |
50
- | Architecture | Qwen3.5-35B-A3B (qwen35moe, 40 layers) |
51
- | Total parameters | 35B |
52
- | Active parameters per token | 3B |
53
- | Quantization | mlx-optiq mixed precision (6 bit / 8 bit) |
54
- | Target BPW | 7.5 |
55
- | Candidate bits | 6, 8 |
56
- | Group size | 32 |
57
- | Calibration sequences | 40 |
58
- | MTP head source | mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit |
59
- | Format | MLX safetensors |
60
-
61
- ## Uses
62
-
63
- ### Direct Use
64
-
65
- This model is intended for local text generation on Apple Silicon devices using MLX based inference engines such as `mlx-lm` or `optiq serve`. It is suited for users who want most of the quality of the BF16 checkpoint at roughly half the memory footprint, with an optional speculative decoding path for faster generation.
66
-
67
- ### Out-of-Scope Use
68
-
69
- This is a quantized derivative of a third party base model. It has not been independently evaluated for safety, factuality, or fitness for any particular downstream task. It should not be used in high stakes settings (medical, legal, financial, or safety critical decisions) without additional evaluation. Refer to the base model card for its intended use cases and known limitations, since these are inherited by this quantization.
70
-
71
- ## Bias, Risks, and Limitations
72
-
73
- Quantization can shift a model's behavior relative to the original weights, even when overall benchmark scores are similar. Mixed precision quantization at 7.5 BPW is expected to be close to BF16 quality, but no independent evaluation of downstream task accuracy, factuality, or bias has been performed for this specific quantized artifact. Users should treat outputs as they would from the base model and are encouraged to run their own evaluations for their use case before deploying it in production.
74
-
75
- ## How to Get Started with the Model
76
-
77
- ### With mlx-optiq serve (enables MTP speculative decoding)
78
-
79
- ```bash
80
- optiq serve \
81
- --model programmer-666/Ornith-1.0-35B-oQ7-mtp \
82
- --mtp \
83
- --port 8080
84
- ```
85
-
86
- ### With mlx-lm
87
-
88
- ```bash
89
- mlx_lm.generate \
90
- --model programmer-666/Ornith-1.0-35B-oQ7-mtp \
91
- --prompt "Your prompt here"
92
- ```
93
-
94
- Note: MTP is not available through `mlx_lm.generate`. Use `optiq serve` or `omlx` if you want speculative decoding.
95
-
96
- ## Training Details
97
-
98
- This repository does not modify the base model's weights beyond quantization; no additional fine-tuning was performed. For training data and training procedure, refer to the [base model card](https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B).
99
-
100
- ### Quantization Procedure
101
-
102
- Quantization was performed with mlx-optiq, which runs a per-layer KL sensitivity analysis to assign bit widths. Layers with higher sensitivity to quantization error retain 8-bit precision, while more robust layers are assigned 6-bit precision. The reference model used during sensitivity calibration was the original BF16 checkpoint.
103
-
104
- Conversion command:
105
-
106
- ```bash
107
- optiq convert deepreinforce-ai/Ornith-1.0-35B \
108
- --candidate-bits 6,8 \
109
- --target-bpw 7.5 \
110
- --reference bf16 \
111
- --n-calibration 40 \
112
- --group-size 32 \
113
- --skip-baselines \
114
- -o Ornith-1.0-35B-oQ7-mtp
115
- ```
116
-
117
- ## Multi-Token Prediction (MTP)
118
-
119
- The `mtp.safetensors` file contains an auxiliary prediction head grafted from `mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit`. This works because Qwen3.5-35B-A3B and Qwen3.6-35B-A3B share an identical structure (hidden dimension 2048, 40 layers, 256 experts, same block layout), and Ornith is fine-tuned directly from Qwen3.5-35B-A3B.
120
-
121
- MTP uses this auxiliary head as a draft model for speculative decoding, giving roughly a 1.3x to 1.4x decode speedup on Apple Silicon during greedy generation.
122
-
123
- ## Hardware Requirements
124
-
125
- | Configuration | Notes |
126
- |---|---|
127
- | Recommended | Apple Silicon with 64GB or more of unified memory |
128
- | Tested on | M4 Max MacBook Pro, 128GB |
129
- | Disk space | Approximately 37GB |
130
-
131
- ## Evaluation
132
-
133
- ### Testing Setup
134
-
135
- Benchmarks were run with [oMLX](https://github.com/jundot/omlx), an LLM inference tool optimized for Apple Silicon Macs. Three models were compared: this repository (`Ornith-1.0-35B-oQ7-mtp`), the original `Ornith-1.0-35B-bf16` checkpoint, and the MTP head's source model, `Qwen3.6-35B-A3B-OptiQ-4bit`. All figures below come from single request runs unless noted as continuous batching.
136
-
137
- ### Performance Benchmarks
138
-
139
- **Ornith-1.0-35B-oQ7-mtp (this repository)**
140
-
141
- | Test | TTFT (ms) | TPOT (ms) | pp TPS | tg TPS | E2E (s) | Throughput | Peak Mem |
142
- |---|---|---|---|---|---|---|---|
143
- | pp1024/tg128 | 787.3 | 10.70 | 1300.6 tok/s | 94.2 tok/s | 2.147 | 536.6 tok/s | 37.36 GB |
144
- | pp4096/tg128 | 2541.2 | 10.96 | 1611.9 tok/s | 91.9 tok/s | 3.934 | 1073.8 tok/s | 38.14 GB |
145
- | pp8192/tg128 | 5421.8 | 11.35 | 1510.9 tok/s | 88.8 tok/s | 6.863 | 1212.3 tok/s | 38.48 GB |
146
- | pp16384/tg128 | 12895.5 | 12.89 | 1270.5 tok/s | 78.2 tok/s | 14.533 | 1136.2 tok/s | 39.10 GB |
147
- | pp32768/tg128 | 29809.2 | 13.68 | 1099.3 tok/s | 73.7 tok/s | 31.546 | 1042.8 tok/s | 40.44 GB |
148
- | pp65536/tg128 | 94152.4 | 25.95 | 696.1 tok/s | 38.8 tok/s | 97.449 | 673.8 tok/s | 43.13 GB |
149
- | pp131072/tg128 | 348440.0 | 30.93 | 376.2 tok/s | 32.6 tok/s | 352.368 | 372.3 tok/s | 48.50 GB |
150
- | pp200000/tg128 | 726434.2 | 36.19 | 275.3 tok/s | 27.9 tok/s | 731.030 | 273.8 tok/s | 54.17 GB |
151
-
152
- Continuous batching, pp1024/tg128:
153
-
154
- | Batch | tg TPS | Speedup | pp TPS | pp TPS/req | TTFT (ms) | E2E (s) |
155
- |---|---|---|---|---|---|---|
156
- | 1x | 94.2 tok/s | 1.00x | 1300.6 tok/s | 1300.6 tok/s | 787.3 | 2.147 |
157
- | 2x | 110.1 tok/s | 1.17x | 549.5 tok/s | 274.8 tok/s | 3726.8 | 6.052 |
158
- | 4x | 125.5 tok/s | 1.33x | 826.0 tok/s | 206.5 tok/s | 4836.1 | 9.038 |
159
-
160
- **Ornith-1.0-35B-bf16 (reference)**
161
-
162
- | Test | TTFT (ms) | TPOT (ms) | pp TPS | tg TPS | E2E (s) | Throughput | Peak Mem |
163
- |---|---|---|---|---|---|---|---|
164
- | pp1024/tg128 | 834.6 | 16.17 | 1227.0 tok/s | 62.3 tok/s | 2.888 | 398.9 tok/s | 65.62 GB |
165
- | pp4096/tg128 | 2269.3 | 16.46 | 1805.0 tok/s | 61.2 tok/s | 4.359 | 969.0 tok/s | 66.40 GB |
166
- | pp8192/tg128 | 4984.5 | 15.94 | 1643.5 tok/s | 63.2 tok/s | 7.009 | 1187.1 tok/s | 66.73 GB |
167
- | pp16384/tg128 | 11321.8 | 16.73 | 1447.1 tok/s | 60.2 tok/s | 13.447 | 1228.0 tok/s | 67.39 GB |
168
- | pp32768/tg128 | 28415.1 | 18.08 | 1153.2 tok/s | 55.7 tok/s | 30.711 | 1071.1 tok/s | 68.70 GB |
169
- | pp65536/tg128 | 85199.7 | 30.94 | 769.2 tok/s | 32.6 tok/s | 89.130 | 736.7 tok/s | 71.35 GB |
170
- | pp131072/tg128 | 346498.2 | 36.68 | 378.3 tok/s | 27.5 tok/s | 351.157 | 373.6 tok/s | 76.79 GB |
171
- | pp200000/tg128 | 630686.4 | 40.49 | 317.1 tok/s | 24.9 tok/s | 635.829 | 314.8 tok/s | 82.47 GB |
172
-
173
- Continuous batching, pp1024/tg128:
174
-
175
- | Batch | tg TPS | Speedup | pp TPS | pp TPS/req | TTFT (ms) | E2E (s) |
176
- |---|---|---|---|---|---|---|
177
- | 1x | 62.3 tok/s | 1.00x | 1227.0 tok/s | 1227.0 tok/s | 834.6 | 2.888 |
178
- | 2x | 43.1 tok/s | 0.69x | 511.9 tok/s | 255.9 tok/s | 4000.4 | 9.941 |
179
- | 4x | 71.0 tok/s | 1.14x | 938.8 tok/s | 234.7 tok/s | 4212.9 | 11.578 |
180
-
181
- **Qwen3.6-35B-A3B-OptiQ-4bit (MTP head source, shown for reference)**
182
-
183
- | Test | TTFT (ms) | TPOT (ms) | pp TPS | tg TPS | E2E (s) | Throughput | Peak Mem |
184
- |---|---|---|---|---|---|---|---|
185
- | pp1024/tg128 | 765.7 | 9.03 | 1337.3 tok/s | 111.6 tok/s | 1.913 | 602.3 tok/s | 21.72 GB |
186
- | pp4096/tg128 | 2466.8 | 9.38 | 1660.5 tok/s | 107.5 tok/s | 3.658 | 1154.7 tok/s | 22.49 GB |
187
- | pp8192/tg128 | 5296.1 | 9.66 | 1546.8 tok/s | 104.4 tok/s | 6.523 | 1275.6 tok/s | 22.83 GB |
188
- | pp16384/tg128 | 12197.2 | 10.30 | 1343.3 tok/s | 97.9 tok/s | 13.505 | 1222.6 tok/s | 23.46 GB |
189
- | pp32768/tg128 | 30598.7 | 11.70 | 1070.9 tok/s | 86.2 tok/s | 32.084 | 1025.3 tok/s | 24.80 GB |
190
- | pp65536/tg128 | 87223.7 | 18.90 | 751.4 tok/s | 53.3 tok/s | 89.624 | 732.7 tok/s | 27.48 GB |
191
- | pp131072/tg128 | 343907.5 | 27.19 | 381.1 tok/s | 37.1 tok/s | 347.361 | 377.7 tok/s | 32.86 GB |
192
- | pp200000/tg128 | 675070.1 | 32.83 | 296.3 tok/s | 30.7 tok/s | 679.240 | 294.6 tok/s | 38.52 GB |
193
-
194
- Continuous batching, pp1024/tg128:
195
-
196
- | Batch | tg TPS | Speedup | pp TPS | pp TPS/req | TTFT (ms) | E2E (s) |
197
- |---|---|---|---|---|---|---|
198
- | 1x | 111.6 tok/s | 1.00x | 1337.3 tok/s | 1337.3 tok/s | 765.7 | 1.913 |
199
- | 2x | 148.6 tok/s | 1.33x | 569.3 tok/s | 284.6 tok/s | 3597.4 | 5.320 |
200
- | 4x | 161.0 tok/s | 1.44x | 873.2 tok/s | 218.3 tok/s | 4564.0 | 7.870 |
201
-
202
- ### Summary
203
-
204
- Compared to the BF16 checkpoint, this 7.5 BPW quantization roughly halves peak memory usage (about 37 to 54 GB versus about 66 to 82 GB depending on context length) while matching or exceeding the BF16 model's token generation speed at every tested context length, and reduces time to first token at longer contexts. The 4-bit `Qwen3.6-35B-A3B-OptiQ-4bit` model used as the MTP draft is smaller and faster on its own, which is what allows it to accelerate this model's decoding through speculative decoding.
205
-
206
- ## Licenses
207
-
208
- - Ornith-1.0-35B (base model): MIT License
209
- - Qwen3.5-35B-A3B (base architecture): Apache 2.0
210
- - Qwen3.6-35B-A3B (MTP head source): Apache 2.0
211
- - This repository (quantized weights and MTP head): Apache 2.0
212
-
213
- Users should review the license terms of each underlying component before use or redistribution.
214
-
215
- ## Citation
216
-
217
- If you use this model, please cite the original Ornith-1.0-35B model and the mlx-optiq quantization tool.
218
-
219
- ```
220
- @misc{ornith-1.0-35b-oq7-mtp,
221
- title = {Ornith-1.0-35B-oQ7-mtp},
222
- author = {programmer-666},
223
- year = {2026},
224
- note = {MLX mixed precision quantization of deepreinforce-ai/Ornith-1.0-35B with grafted MTP head},
225
- howpublished = {\url{https://huggingface.co/programmer-666/Ornith-1.0-35B-oQ7-mtp}}
226
- }
227
- ```
228
-
229
- ## Model Card Contact
230
-
231
- For questions about this quantization, open a discussion on this repository's Community tab. For questions about the base model, refer to [deepreinforce-ai/Ornith-1.0-35B](https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B).
 
1
  ---
2
+ language: en
 
 
 
3
  pipeline_tag: text-generation
4
+ library_name: mlx
5
  tags:
6
  - mlx
 
 
 
 
 
 
 
 
 
7
  ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
chat_template.jinja ADDED
@@ -0,0 +1,150 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- set image_count = namespace(value=0) %}
2
+ {%- set video_count = namespace(value=0) %}
3
+ {%- macro render_content(content, do_vision_count, is_system_content=false) %}
4
+ {%- if content is string %}
5
+ {{- content }}
6
+ {%- elif content is iterable and content is not mapping %}
7
+ {%- for item in content %}
8
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
9
+ {%- if is_system_content %}
10
+ {{- raise_exception('System message cannot contain images.') }}
11
+ {%- endif %}
12
+ {%- if do_vision_count %}
13
+ {%- set image_count.value = image_count.value + 1 %}
14
+ {%- endif %}
15
+ {%- if add_vision_id %}
16
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
17
+ {%- endif %}
18
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
19
+ {%- elif 'video' in item or item.type == 'video' %}
20
+ {%- if is_system_content %}
21
+ {{- raise_exception('System message cannot contain videos.') }}
22
+ {%- endif %}
23
+ {%- if do_vision_count %}
24
+ {%- set video_count.value = video_count.value + 1 %}
25
+ {%- endif %}
26
+ {%- if add_vision_id %}
27
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
28
+ {%- endif %}
29
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
30
+ {%- elif 'text' in item %}
31
+ {{- item.text }}
32
+ {%- else %}
33
+ {{- raise_exception('Unexpected item type in content.') }}
34
+ {%- endif %}
35
+ {%- endfor %}
36
+ {%- elif content is none or content is undefined %}
37
+ {{- '' }}
38
+ {%- else %}
39
+ {{- raise_exception('Unexpected content type.') }}
40
+ {%- endif %}
41
+ {%- endmacro %}
42
+ {%- if not messages %}
43
+ {{- raise_exception('No messages provided.') }}
44
+ {%- endif %}
45
+ {%- if tools and tools is iterable and tools is not mapping %}
46
+ {{- '<|im_start|>system\n' }}
47
+ {{- "# Tools\n\nYou have access to the following functions:\n\n<tools>" }}
48
+ {%- for tool in tools %}
49
+ {{- "\n" }}
50
+ {{- tool | tojson }}
51
+ {%- endfor %}
52
+ {{- "\n</tools>" }}
53
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n<tool_call>\n<function=example_function_name>\n<parameter=example_parameter_1>\nvalue_1\n</parameter>\n<parameter=example_parameter_2>\nThis is the value for the second parameter\nthat can span\nmultiple lines\n</parameter>\n</function>\n</tool_call>\n\n<IMPORTANT>\nReminder:\n- Function calls MUST follow the specified format: an inner <function=...></function> block must be nested within <tool_call></tool_call> XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n</IMPORTANT>' }}
54
+ {%- if messages[0].role == 'system' %}
55
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
56
+ {%- if content %}
57
+ {{- '\n\n' + content }}
58
+ {%- endif %}
59
+ {%- endif %}
60
+ {{- '<|im_end|>\n' }}
61
+ {%- else %}
62
+ {%- if messages[0].role == 'system' %}
63
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
64
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
65
+ {%- endif %}
66
+ {%- endif %}
67
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
68
+ {%- for message in messages[::-1] %}
69
+ {%- set index = (messages|length - 1) - loop.index0 %}
70
+ {%- if ns.multi_step_tool and message.role == "user" %}
71
+ {%- set content = render_content(message.content, false)|trim %}
72
+ {%- if not(content.startswith('<tool_response>') and content.endswith('</tool_response>')) %}
73
+ {%- set ns.multi_step_tool = false %}
74
+ {%- set ns.last_query_index = index %}
75
+ {%- endif %}
76
+ {%- endif %}
77
+ {%- endfor %}
78
+ {%- if ns.multi_step_tool %}
79
+ {{- raise_exception('No user query found in messages.') }}
80
+ {%- endif %}
81
+ {%- for message in messages %}
82
+ {%- set content = render_content(message.content, true)|trim %}
83
+ {%- if message.role == "system" %}
84
+ {%- if not loop.first %}
85
+ {{- raise_exception('System message must be at the beginning.') }}
86
+ {%- endif %}
87
+ {%- elif message.role == "user" %}
88
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
89
+ {%- elif message.role == "assistant" %}
90
+ {%- set reasoning_content = '' %}
91
+ {%- if message.reasoning_content is string %}
92
+ {%- set reasoning_content = message.reasoning_content %}
93
+ {%- else %}
94
+ {%- if '</think>' in content %}
95
+ {%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
96
+ {%- set content = content.split('</think>')[-1].lstrip('\n') %}
97
+ {%- endif %}
98
+ {%- endif %}
99
+ {%- set reasoning_content = reasoning_content|trim %}
100
+ {{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content + '\n</think>\n\n' + content }}
101
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
102
+ {%- for tool_call in message.tool_calls %}
103
+ {%- if tool_call.function is defined %}
104
+ {%- set tool_call = tool_call.function %}
105
+ {%- endif %}
106
+ {%- if loop.first %}
107
+ {%- if content|trim %}
108
+ {{- '\n\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
109
+ {%- else %}
110
+ {{- '<tool_call>\n<function=' + tool_call.name + '>\n' }}
111
+ {%- endif %}
112
+ {%- else %}
113
+ {{- '\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
114
+ {%- endif %}
115
+ {%- if tool_call.arguments is defined %}
116
+ {%- for args_name, args_value in tool_call.arguments|items %}
117
+ {{- '<parameter=' + args_name + '>\n' }}
118
+ {%- set args_value = args_value | string if args_value is string else args_value | tojson | safe %}
119
+ {{- args_value }}
120
+ {{- '\n</parameter>\n' }}
121
+ {%- endfor %}
122
+ {%- endif %}
123
+ {{- '</function>\n</tool_call>' }}
124
+ {%- endfor %}
125
+ {%- endif %}
126
+ {{- '<|im_end|>\n' }}
127
+ {%- elif message.role == "tool" %}
128
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
129
+ {{- '<|im_start|>user' }}
130
+ {%- endif %}
131
+ {{- '\n<tool_response>\n' }}
132
+ {{- content }}
133
+ {{- '\n</tool_response>' }}
134
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
135
+ {{- '<|im_end|>\n' }}
136
+ {%- elif loop.last %}
137
+ {{- '<|im_end|>\n' }}
138
+ {%- endif %}
139
+ {%- else %}
140
+ {{- raise_exception('Unexpected message role.') }}
141
+ {%- endif %}
142
+ {%- endfor %}
143
+ {%- if add_generation_prompt %}
144
+ {{- '<|im_start|>assistant\n' }}
145
+ {%- if enable_thinking is defined and enable_thinking is false %}
146
+ {{- '<think>\n\n</think>\n\n' }}
147
+ {%- else %}
148
+ {{- '<think>\n' }}
149
+ {%- endif %}
150
+ {%- endif %}
config.json ADDED
The diff for this file is too large to render. See raw diff
 
generation_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 248044,
3
+ "do_sample": true,
4
+ "eos_token_id": [
5
+ 248046,
6
+ 248044
7
+ ],
8
+ "pad_token_id": 248044,
9
+ "temperature": 1.0,
10
+ "top_k": 20,
11
+ "top_p": 0.95,
12
+ "transformers_version": "5.8.1"
13
+ }
model-00001-of-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:344dc26e3839de9898ab3ca20c67d0224004dd8737dfd60f8a879ecba4f28405
3
+ size 5335398706
model-00002-of-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8643290d679d28b18496c32879d55d73fcb51646dffe5cbb9baa515852feb39a
3
+ size 5337074973
model-00003-of-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9b63a3a0a4ee283f8bddcc0f0ab27b4f6cda7f1e2741359b52c341381fd18fec
3
+ size 5363501976
model-00004-of-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d8a1446beb3a6dd9a38c908209d7002d851394128acee63e9a331b4f3cb17127
3
+ size 5368695667
model-00005-of-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3e981ba9a8b3cdd946e9d8c7d6d7d7a2670a11e68b78f36c0095c62a44818de7
3
+ size 5323230767
model-00006-of-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e3bbaf4160c84b79d013d82c288bca74b03769a4942607dc4e7ca66e972586cd
3
+ size 5366320059
model-00007-of-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9044631056d75846693b9bcfbeed8c099fff68d9fa61c7a115c66dffe8ebc1db
3
+ size 5359012678
model-00008-of-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:14cac094e8d7997255fa4a318969c4a4726246fc6ea9e658c9fcd1c63c7f309d
3
+ size 1481647677
model.safetensors.index.json ADDED
The diff for this file is too large to render. See raw diff
 
mtp.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ab850c643a37cd0c0b88530a5d6251f72a26c3b1dbf56707b307f5454942b49f
3
+ size 1644816498
optiq_metadata.json ADDED
@@ -0,0 +1,1576 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "method": "optiq_mixed_precision",
3
+ "base_model": "/Users/suhaarslan/.omlx/models/mlx-community/Ornith-1.0-35B-bf16",
4
+ "reference": "bf16",
5
+ "target_bpw": 7.5,
6
+ "achieved_bpw": 7.754236213817874,
7
+ "n_high_bits": 362,
8
+ "n_low_bits": 29,
9
+ "threshold": 0.0,
10
+ "per_layer": {
11
+ "language_model.lm_head": {
12
+ "bits": 8,
13
+ "group_size": 32
14
+ },
15
+ "language_model.model.layers.39.mlp.shared_expert_gate": {
16
+ "bits": 8,
17
+ "group_size": 32
18
+ },
19
+ "language_model.model.layers.39.mlp.shared_expert.up_proj": {
20
+ "bits": 8,
21
+ "group_size": 32
22
+ },
23
+ "language_model.model.layers.39.mlp.shared_expert.down_proj": {
24
+ "bits": 8,
25
+ "group_size": 32
26
+ },
27
+ "language_model.model.layers.39.mlp.shared_expert.gate_proj": {
28
+ "bits": 8,
29
+ "group_size": 32
30
+ },
31
+ "language_model.model.layers.39.mlp.gate": {
32
+ "bits": 8,
33
+ "group_size": 32
34
+ },
35
+ "language_model.model.layers.39.self_attn.o_proj": {
36
+ "bits": 8,
37
+ "group_size": 32
38
+ },
39
+ "language_model.model.layers.39.self_attn.v_proj": {
40
+ "bits": 8,
41
+ "group_size": 32
42
+ },
43
+ "language_model.model.layers.39.self_attn.k_proj": {
44
+ "bits": 8,
45
+ "group_size": 32
46
+ },
47
+ "language_model.model.layers.39.self_attn.q_proj": {
48
+ "bits": 8,
49
+ "group_size": 32
50
+ },
51
+ "language_model.model.layers.38.mlp.shared_expert_gate": {
52
+ "bits": 8,
53
+ "group_size": 32
54
+ },
55
+ "language_model.model.layers.38.mlp.shared_expert.up_proj": {
56
+ "bits": 8,
57
+ "group_size": 32
58
+ },
59
+ "language_model.model.layers.38.mlp.shared_expert.down_proj": {
60
+ "bits": 8,
61
+ "group_size": 32
62
+ },
63
+ "language_model.model.layers.38.mlp.shared_expert.gate_proj": {
64
+ "bits": 8,
65
+ "group_size": 32
66
+ },
67
+ "language_model.model.layers.38.mlp.gate": {
68
+ "bits": 8,
69
+ "group_size": 32
70
+ },
71
+ "language_model.model.layers.38.linear_attn.out_proj": {
72
+ "bits": 8,
73
+ "group_size": 32
74
+ },
75
+ "language_model.model.layers.38.linear_attn.in_proj_a": {
76
+ "bits": 6,
77
+ "group_size": 32
78
+ },
79
+ "language_model.model.layers.38.linear_attn.in_proj_b": {
80
+ "bits": 8,
81
+ "group_size": 32
82
+ },
83
+ "language_model.model.layers.38.linear_attn.in_proj_z": {
84
+ "bits": 6,
85
+ "group_size": 32
86
+ },
87
+ "language_model.model.layers.38.linear_attn.in_proj_qkv": {
88
+ "bits": 8,
89
+ "group_size": 32
90
+ },
91
+ "language_model.model.layers.37.mlp.shared_expert_gate": {
92
+ "bits": 8,
93
+ "group_size": 32
94
+ },
95
+ "language_model.model.layers.37.mlp.shared_expert.up_proj": {
96
+ "bits": 8,
97
+ "group_size": 32
98
+ },
99
+ "language_model.model.layers.37.mlp.shared_expert.down_proj": {
100
+ "bits": 8,
101
+ "group_size": 32
102
+ },
103
+ "language_model.model.layers.37.mlp.shared_expert.gate_proj": {
104
+ "bits": 8,
105
+ "group_size": 32
106
+ },
107
+ "language_model.model.layers.37.mlp.gate": {
108
+ "bits": 8,
109
+ "group_size": 32
110
+ },
111
+ "language_model.model.layers.37.linear_attn.out_proj": {
112
+ "bits": 8,
113
+ "group_size": 32
114
+ },
115
+ "language_model.model.layers.37.linear_attn.in_proj_a": {
116
+ "bits": 6,
117
+ "group_size": 32
118
+ },
119
+ "language_model.model.layers.37.linear_attn.in_proj_b": {
120
+ "bits": 8,
121
+ "group_size": 32
122
+ },
123
+ "language_model.model.layers.37.linear_attn.in_proj_z": {
124
+ "bits": 6,
125
+ "group_size": 32
126
+ },
127
+ "language_model.model.layers.37.linear_attn.in_proj_qkv": {
128
+ "bits": 8,
129
+ "group_size": 32
130
+ },
131
+ "language_model.model.layers.36.mlp.shared_expert_gate": {
132
+ "bits": 8,
133
+ "group_size": 32
134
+ },
135
+ "language_model.model.layers.36.mlp.shared_expert.up_proj": {
136
+ "bits": 8,
137
+ "group_size": 32
138
+ },
139
+ "language_model.model.layers.36.mlp.shared_expert.down_proj": {
140
+ "bits": 8,
141
+ "group_size": 32
142
+ },
143
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj": {
144
+ "bits": 8,
145
+ "group_size": 32
146
+ },
147
+ "language_model.model.layers.36.mlp.gate": {
148
+ "bits": 8,
149
+ "group_size": 32
150
+ },
151
+ "language_model.model.layers.36.linear_attn.out_proj": {
152
+ "bits": 8,
153
+ "group_size": 32
154
+ },
155
+ "language_model.model.layers.36.linear_attn.in_proj_a": {
156
+ "bits": 8,
157
+ "group_size": 32
158
+ },
159
+ "language_model.model.layers.36.linear_attn.in_proj_b": {
160
+ "bits": 8,
161
+ "group_size": 32
162
+ },
163
+ "language_model.model.layers.36.linear_attn.in_proj_z": {
164
+ "bits": 8,
165
+ "group_size": 32
166
+ },
167
+ "language_model.model.layers.36.linear_attn.in_proj_qkv": {
168
+ "bits": 6,
169
+ "group_size": 32
170
+ },
171
+ "language_model.model.layers.35.mlp.shared_expert_gate": {
172
+ "bits": 8,
173
+ "group_size": 32
174
+ },
175
+ "language_model.model.layers.35.mlp.shared_expert.up_proj": {
176
+ "bits": 8,
177
+ "group_size": 32
178
+ },
179
+ "language_model.model.layers.35.mlp.shared_expert.down_proj": {
180
+ "bits": 8,
181
+ "group_size": 32
182
+ },
183
+ "language_model.model.layers.35.mlp.shared_expert.gate_proj": {
184
+ "bits": 8,
185
+ "group_size": 32
186
+ },
187
+ "language_model.model.layers.35.mlp.gate": {
188
+ "bits": 8,
189
+ "group_size": 32
190
+ },
191
+ "language_model.model.layers.35.self_attn.o_proj": {
192
+ "bits": 8,
193
+ "group_size": 32
194
+ },
195
+ "language_model.model.layers.35.self_attn.v_proj": {
196
+ "bits": 8,
197
+ "group_size": 32
198
+ },
199
+ "language_model.model.layers.35.self_attn.k_proj": {
200
+ "bits": 6,
201
+ "group_size": 32
202
+ },
203
+ "language_model.model.layers.35.self_attn.q_proj": {
204
+ "bits": 8,
205
+ "group_size": 32
206
+ },
207
+ "language_model.model.layers.34.mlp.shared_expert_gate": {
208
+ "bits": 8,
209
+ "group_size": 32
210
+ },
211
+ "language_model.model.layers.34.mlp.shared_expert.up_proj": {
212
+ "bits": 8,
213
+ "group_size": 32
214
+ },
215
+ "language_model.model.layers.34.mlp.shared_expert.down_proj": {
216
+ "bits": 8,
217
+ "group_size": 32
218
+ },
219
+ "language_model.model.layers.34.mlp.shared_expert.gate_proj": {
220
+ "bits": 8,
221
+ "group_size": 32
222
+ },
223
+ "language_model.model.layers.34.mlp.gate": {
224
+ "bits": 8,
225
+ "group_size": 32
226
+ },
227
+ "language_model.model.layers.34.linear_attn.out_proj": {
228
+ "bits": 8,
229
+ "group_size": 32
230
+ },
231
+ "language_model.model.layers.34.linear_attn.in_proj_a": {
232
+ "bits": 8,
233
+ "group_size": 32
234
+ },
235
+ "language_model.model.layers.34.linear_attn.in_proj_b": {
236
+ "bits": 8,
237
+ "group_size": 32
238
+ },
239
+ "language_model.model.layers.34.linear_attn.in_proj_z": {
240
+ "bits": 8,
241
+ "group_size": 32
242
+ },
243
+ "language_model.model.layers.34.linear_attn.in_proj_qkv": {
244
+ "bits": 6,
245
+ "group_size": 32
246
+ },
247
+ "language_model.model.layers.33.mlp.shared_expert_gate": {
248
+ "bits": 8,
249
+ "group_size": 32
250
+ },
251
+ "language_model.model.layers.33.mlp.shared_expert.up_proj": {
252
+ "bits": 8,
253
+ "group_size": 32
254
+ },
255
+ "language_model.model.layers.33.mlp.shared_expert.down_proj": {
256
+ "bits": 8,
257
+ "group_size": 32
258
+ },
259
+ "language_model.model.layers.33.mlp.shared_expert.gate_proj": {
260
+ "bits": 8,
261
+ "group_size": 32
262
+ },
263
+ "language_model.model.layers.33.mlp.gate": {
264
+ "bits": 8,
265
+ "group_size": 32
266
+ },
267
+ "language_model.model.layers.33.linear_attn.out_proj": {
268
+ "bits": 8,
269
+ "group_size": 32
270
+ },
271
+ "language_model.model.layers.33.linear_attn.in_proj_a": {
272
+ "bits": 8,
273
+ "group_size": 32
274
+ },
275
+ "language_model.model.layers.33.linear_attn.in_proj_b": {
276
+ "bits": 8,
277
+ "group_size": 32
278
+ },
279
+ "language_model.model.layers.33.linear_attn.in_proj_z": {
280
+ "bits": 8,
281
+ "group_size": 32
282
+ },
283
+ "language_model.model.layers.33.linear_attn.in_proj_qkv": {
284
+ "bits": 6,
285
+ "group_size": 32
286
+ },
287
+ "language_model.model.layers.32.mlp.shared_expert_gate": {
288
+ "bits": 8,
289
+ "group_size": 32
290
+ },
291
+ "language_model.model.layers.32.mlp.shared_expert.up_proj": {
292
+ "bits": 8,
293
+ "group_size": 32
294
+ },
295
+ "language_model.model.layers.32.mlp.shared_expert.down_proj": {
296
+ "bits": 8,
297
+ "group_size": 32
298
+ },
299
+ "language_model.model.layers.32.mlp.shared_expert.gate_proj": {
300
+ "bits": 8,
301
+ "group_size": 32
302
+ },
303
+ "language_model.model.layers.32.mlp.gate": {
304
+ "bits": 8,
305
+ "group_size": 32
306
+ },
307
+ "language_model.model.layers.32.linear_attn.out_proj": {
308
+ "bits": 6,
309
+ "group_size": 32
310
+ },
311
+ "language_model.model.layers.32.linear_attn.in_proj_a": {
312
+ "bits": 8,
313
+ "group_size": 32
314
+ },
315
+ "language_model.model.layers.32.linear_attn.in_proj_b": {
316
+ "bits": 6,
317
+ "group_size": 32
318
+ },
319
+ "language_model.model.layers.32.linear_attn.in_proj_z": {
320
+ "bits": 8,
321
+ "group_size": 32
322
+ },
323
+ "language_model.model.layers.32.linear_attn.in_proj_qkv": {
324
+ "bits": 8,
325
+ "group_size": 32
326
+ },
327
+ "language_model.model.layers.31.mlp.shared_expert_gate": {
328
+ "bits": 8,
329
+ "group_size": 32
330
+ },
331
+ "language_model.model.layers.31.mlp.shared_expert.up_proj": {
332
+ "bits": 8,
333
+ "group_size": 32
334
+ },
335
+ "language_model.model.layers.31.mlp.shared_expert.down_proj": {
336
+ "bits": 8,
337
+ "group_size": 32
338
+ },
339
+ "language_model.model.layers.31.mlp.shared_expert.gate_proj": {
340
+ "bits": 8,
341
+ "group_size": 32
342
+ },
343
+ "language_model.model.layers.31.mlp.gate": {
344
+ "bits": 8,
345
+ "group_size": 32
346
+ },
347
+ "language_model.model.layers.31.self_attn.o_proj": {
348
+ "bits": 8,
349
+ "group_size": 32
350
+ },
351
+ "language_model.model.layers.31.self_attn.v_proj": {
352
+ "bits": 8,
353
+ "group_size": 32
354
+ },
355
+ "language_model.model.layers.31.self_attn.k_proj": {
356
+ "bits": 6,
357
+ "group_size": 32
358
+ },
359
+ "language_model.model.layers.31.self_attn.q_proj": {
360
+ "bits": 8,
361
+ "group_size": 32
362
+ },
363
+ "language_model.model.layers.30.mlp.shared_expert_gate": {
364
+ "bits": 8,
365
+ "group_size": 32
366
+ },
367
+ "language_model.model.layers.30.mlp.shared_expert.up_proj": {
368
+ "bits": 8,
369
+ "group_size": 32
370
+ },
371
+ "language_model.model.layers.30.mlp.shared_expert.down_proj": {
372
+ "bits": 8,
373
+ "group_size": 32
374
+ },
375
+ "language_model.model.layers.30.mlp.shared_expert.gate_proj": {
376
+ "bits": 8,
377
+ "group_size": 32
378
+ },
379
+ "language_model.model.layers.30.mlp.gate": {
380
+ "bits": 8,
381
+ "group_size": 32
382
+ },
383
+ "language_model.model.layers.30.linear_attn.out_proj": {
384
+ "bits": 8,
385
+ "group_size": 32
386
+ },
387
+ "language_model.model.layers.30.linear_attn.in_proj_a": {
388
+ "bits": 8,
389
+ "group_size": 32
390
+ },
391
+ "language_model.model.layers.30.linear_attn.in_proj_b": {
392
+ "bits": 8,
393
+ "group_size": 32
394
+ },
395
+ "language_model.model.layers.30.linear_attn.in_proj_z": {
396
+ "bits": 6,
397
+ "group_size": 32
398
+ },
399
+ "language_model.model.layers.30.linear_attn.in_proj_qkv": {
400
+ "bits": 8,
401
+ "group_size": 32
402
+ },
403
+ "language_model.model.layers.29.mlp.shared_expert_gate": {
404
+ "bits": 8,
405
+ "group_size": 32
406
+ },
407
+ "language_model.model.layers.29.mlp.shared_expert.up_proj": {
408
+ "bits": 8,
409
+ "group_size": 32
410
+ },
411
+ "language_model.model.layers.29.mlp.shared_expert.down_proj": {
412
+ "bits": 8,
413
+ "group_size": 32
414
+ },
415
+ "language_model.model.layers.29.mlp.shared_expert.gate_proj": {
416
+ "bits": 8,
417
+ "group_size": 32
418
+ },
419
+ "language_model.model.layers.29.mlp.gate": {
420
+ "bits": 8,
421
+ "group_size": 32
422
+ },
423
+ "language_model.model.layers.29.linear_attn.out_proj": {
424
+ "bits": 8,
425
+ "group_size": 32
426
+ },
427
+ "language_model.model.layers.29.linear_attn.in_proj_a": {
428
+ "bits": 8,
429
+ "group_size": 32
430
+ },
431
+ "language_model.model.layers.29.linear_attn.in_proj_b": {
432
+ "bits": 8,
433
+ "group_size": 32
434
+ },
435
+ "language_model.model.layers.29.linear_attn.in_proj_z": {
436
+ "bits": 6,
437
+ "group_size": 32
438
+ },
439
+ "language_model.model.layers.29.linear_attn.in_proj_qkv": {
440
+ "bits": 8,
441
+ "group_size": 32
442
+ },
443
+ "language_model.model.layers.28.mlp.shared_expert_gate": {
444
+ "bits": 8,
445
+ "group_size": 32
446
+ },
447
+ "language_model.model.layers.28.mlp.shared_expert.up_proj": {
448
+ "bits": 8,
449
+ "group_size": 32
450
+ },
451
+ "language_model.model.layers.28.mlp.shared_expert.down_proj": {
452
+ "bits": 8,
453
+ "group_size": 32
454
+ },
455
+ "language_model.model.layers.28.mlp.shared_expert.gate_proj": {
456
+ "bits": 8,
457
+ "group_size": 32
458
+ },
459
+ "language_model.model.layers.28.mlp.gate": {
460
+ "bits": 8,
461
+ "group_size": 32
462
+ },
463
+ "language_model.model.layers.28.linear_attn.out_proj": {
464
+ "bits": 8,
465
+ "group_size": 32
466
+ },
467
+ "language_model.model.layers.28.linear_attn.in_proj_a": {
468
+ "bits": 8,
469
+ "group_size": 32
470
+ },
471
+ "language_model.model.layers.28.linear_attn.in_proj_b": {
472
+ "bits": 8,
473
+ "group_size": 32
474
+ },
475
+ "language_model.model.layers.28.linear_attn.in_proj_z": {
476
+ "bits": 6,
477
+ "group_size": 32
478
+ },
479
+ "language_model.model.layers.28.linear_attn.in_proj_qkv": {
480
+ "bits": 8,
481
+ "group_size": 32
482
+ },
483
+ "language_model.model.layers.27.mlp.shared_expert_gate": {
484
+ "bits": 8,
485
+ "group_size": 32
486
+ },
487
+ "language_model.model.layers.27.mlp.shared_expert.up_proj": {
488
+ "bits": 8,
489
+ "group_size": 32
490
+ },
491
+ "language_model.model.layers.27.mlp.shared_expert.down_proj": {
492
+ "bits": 8,
493
+ "group_size": 32
494
+ },
495
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj": {
496
+ "bits": 8,
497
+ "group_size": 32
498
+ },
499
+ "language_model.model.layers.27.mlp.gate": {
500
+ "bits": 8,
501
+ "group_size": 32
502
+ },
503
+ "language_model.model.layers.27.self_attn.o_proj": {
504
+ "bits": 8,
505
+ "group_size": 32
506
+ },
507
+ "language_model.model.layers.27.self_attn.v_proj": {
508
+ "bits": 8,
509
+ "group_size": 32
510
+ },
511
+ "language_model.model.layers.27.self_attn.k_proj": {
512
+ "bits": 8,
513
+ "group_size": 32
514
+ },
515
+ "language_model.model.layers.27.self_attn.q_proj": {
516
+ "bits": 8,
517
+ "group_size": 32
518
+ },
519
+ "language_model.model.layers.26.mlp.shared_expert_gate": {
520
+ "bits": 8,
521
+ "group_size": 32
522
+ },
523
+ "language_model.model.layers.26.mlp.shared_expert.up_proj": {
524
+ "bits": 8,
525
+ "group_size": 32
526
+ },
527
+ "language_model.model.layers.26.mlp.shared_expert.down_proj": {
528
+ "bits": 8,
529
+ "group_size": 32
530
+ },
531
+ "language_model.model.layers.26.mlp.shared_expert.gate_proj": {
532
+ "bits": 8,
533
+ "group_size": 32
534
+ },
535
+ "language_model.model.layers.26.mlp.gate": {
536
+ "bits": 8,
537
+ "group_size": 32
538
+ },
539
+ "language_model.model.layers.26.linear_attn.out_proj": {
540
+ "bits": 8,
541
+ "group_size": 32
542
+ },
543
+ "language_model.model.layers.26.linear_attn.in_proj_a": {
544
+ "bits": 8,
545
+ "group_size": 32
546
+ },
547
+ "language_model.model.layers.26.linear_attn.in_proj_b": {
548
+ "bits": 8,
549
+ "group_size": 32
550
+ },
551
+ "language_model.model.layers.26.linear_attn.in_proj_z": {
552
+ "bits": 6,
553
+ "group_size": 32
554
+ },
555
+ "language_model.model.layers.26.linear_attn.in_proj_qkv": {
556
+ "bits": 8,
557
+ "group_size": 32
558
+ },
559
+ "language_model.model.layers.25.mlp.shared_expert_gate": {
560
+ "bits": 8,
561
+ "group_size": 32
562
+ },
563
+ "language_model.model.layers.25.mlp.shared_expert.up_proj": {
564
+ "bits": 8,
565
+ "group_size": 32
566
+ },
567
+ "language_model.model.layers.25.mlp.shared_expert.down_proj": {
568
+ "bits": 8,
569
+ "group_size": 32
570
+ },
571
+ "language_model.model.layers.25.mlp.shared_expert.gate_proj": {
572
+ "bits": 8,
573
+ "group_size": 32
574
+ },
575
+ "language_model.model.layers.25.mlp.gate": {
576
+ "bits": 8,
577
+ "group_size": 32
578
+ },
579
+ "language_model.model.layers.25.linear_attn.out_proj": {
580
+ "bits": 8,
581
+ "group_size": 32
582
+ },
583
+ "language_model.model.layers.25.linear_attn.in_proj_a": {
584
+ "bits": 8,
585
+ "group_size": 32
586
+ },
587
+ "language_model.model.layers.25.linear_attn.in_proj_b": {
588
+ "bits": 8,
589
+ "group_size": 32
590
+ },
591
+ "language_model.model.layers.25.linear_attn.in_proj_z": {
592
+ "bits": 6,
593
+ "group_size": 32
594
+ },
595
+ "language_model.model.layers.25.linear_attn.in_proj_qkv": {
596
+ "bits": 8,
597
+ "group_size": 32
598
+ },
599
+ "language_model.model.layers.24.mlp.shared_expert_gate": {
600
+ "bits": 8,
601
+ "group_size": 32
602
+ },
603
+ "language_model.model.layers.24.mlp.shared_expert.up_proj": {
604
+ "bits": 8,
605
+ "group_size": 32
606
+ },
607
+ "language_model.model.layers.24.mlp.shared_expert.down_proj": {
608
+ "bits": 8,
609
+ "group_size": 32
610
+ },
611
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj": {
612
+ "bits": 8,
613
+ "group_size": 32
614
+ },
615
+ "language_model.model.layers.24.mlp.gate": {
616
+ "bits": 8,
617
+ "group_size": 32
618
+ },
619
+ "language_model.model.layers.24.linear_attn.out_proj": {
620
+ "bits": 8,
621
+ "group_size": 32
622
+ },
623
+ "language_model.model.layers.24.linear_attn.in_proj_a": {
624
+ "bits": 8,
625
+ "group_size": 32
626
+ },
627
+ "language_model.model.layers.24.linear_attn.in_proj_b": {
628
+ "bits": 8,
629
+ "group_size": 32
630
+ },
631
+ "language_model.model.layers.24.linear_attn.in_proj_z": {
632
+ "bits": 6,
633
+ "group_size": 32
634
+ },
635
+ "language_model.model.layers.24.linear_attn.in_proj_qkv": {
636
+ "bits": 8,
637
+ "group_size": 32
638
+ },
639
+ "language_model.model.layers.23.mlp.shared_expert_gate": {
640
+ "bits": 8,
641
+ "group_size": 32
642
+ },
643
+ "language_model.model.layers.23.mlp.shared_expert.up_proj": {
644
+ "bits": 8,
645
+ "group_size": 32
646
+ },
647
+ "language_model.model.layers.23.mlp.shared_expert.down_proj": {
648
+ "bits": 8,
649
+ "group_size": 32
650
+ },
651
+ "language_model.model.layers.23.mlp.shared_expert.gate_proj": {
652
+ "bits": 8,
653
+ "group_size": 32
654
+ },
655
+ "language_model.model.layers.23.mlp.gate": {
656
+ "bits": 8,
657
+ "group_size": 32
658
+ },
659
+ "language_model.model.layers.23.self_attn.o_proj": {
660
+ "bits": 8,
661
+ "group_size": 32
662
+ },
663
+ "language_model.model.layers.23.self_attn.v_proj": {
664
+ "bits": 8,
665
+ "group_size": 32
666
+ },
667
+ "language_model.model.layers.23.self_attn.k_proj": {
668
+ "bits": 6,
669
+ "group_size": 32
670
+ },
671
+ "language_model.model.layers.23.self_attn.q_proj": {
672
+ "bits": 8,
673
+ "group_size": 32
674
+ },
675
+ "language_model.model.layers.22.mlp.shared_expert_gate": {
676
+ "bits": 8,
677
+ "group_size": 32
678
+ },
679
+ "language_model.model.layers.22.mlp.shared_expert.up_proj": {
680
+ "bits": 8,
681
+ "group_size": 32
682
+ },
683
+ "language_model.model.layers.22.mlp.shared_expert.down_proj": {
684
+ "bits": 8,
685
+ "group_size": 32
686
+ },
687
+ "language_model.model.layers.22.mlp.shared_expert.gate_proj": {
688
+ "bits": 8,
689
+ "group_size": 32
690
+ },
691
+ "language_model.model.layers.22.mlp.gate": {
692
+ "bits": 8,
693
+ "group_size": 32
694
+ },
695
+ "language_model.model.layers.22.linear_attn.out_proj": {
696
+ "bits": 8,
697
+ "group_size": 32
698
+ },
699
+ "language_model.model.layers.22.linear_attn.in_proj_a": {
700
+ "bits": 8,
701
+ "group_size": 32
702
+ },
703
+ "language_model.model.layers.22.linear_attn.in_proj_b": {
704
+ "bits": 8,
705
+ "group_size": 32
706
+ },
707
+ "language_model.model.layers.22.linear_attn.in_proj_z": {
708
+ "bits": 6,
709
+ "group_size": 32
710
+ },
711
+ "language_model.model.layers.22.linear_attn.in_proj_qkv": {
712
+ "bits": 8,
713
+ "group_size": 32
714
+ },
715
+ "language_model.model.layers.21.mlp.shared_expert_gate": {
716
+ "bits": 8,
717
+ "group_size": 32
718
+ },
719
+ "language_model.model.layers.21.mlp.shared_expert.up_proj": {
720
+ "bits": 8,
721
+ "group_size": 32
722
+ },
723
+ "language_model.model.layers.21.mlp.shared_expert.down_proj": {
724
+ "bits": 8,
725
+ "group_size": 32
726
+ },
727
+ "language_model.model.layers.21.mlp.shared_expert.gate_proj": {
728
+ "bits": 8,
729
+ "group_size": 32
730
+ },
731
+ "language_model.model.layers.21.mlp.gate": {
732
+ "bits": 8,
733
+ "group_size": 32
734
+ },
735
+ "language_model.model.layers.21.linear_attn.out_proj": {
736
+ "bits": 6,
737
+ "group_size": 32
738
+ },
739
+ "language_model.model.layers.21.linear_attn.in_proj_a": {
740
+ "bits": 8,
741
+ "group_size": 32
742
+ },
743
+ "language_model.model.layers.21.linear_attn.in_proj_b": {
744
+ "bits": 8,
745
+ "group_size": 32
746
+ },
747
+ "language_model.model.layers.21.linear_attn.in_proj_z": {
748
+ "bits": 8,
749
+ "group_size": 32
750
+ },
751
+ "language_model.model.layers.21.linear_attn.in_proj_qkv": {
752
+ "bits": 8,
753
+ "group_size": 32
754
+ },
755
+ "language_model.model.layers.20.mlp.shared_expert_gate": {
756
+ "bits": 8,
757
+ "group_size": 32
758
+ },
759
+ "language_model.model.layers.20.mlp.shared_expert.up_proj": {
760
+ "bits": 8,
761
+ "group_size": 32
762
+ },
763
+ "language_model.model.layers.20.mlp.shared_expert.down_proj": {
764
+ "bits": 8,
765
+ "group_size": 32
766
+ },
767
+ "language_model.model.layers.20.mlp.shared_expert.gate_proj": {
768
+ "bits": 8,
769
+ "group_size": 32
770
+ },
771
+ "language_model.model.layers.20.mlp.gate": {
772
+ "bits": 8,
773
+ "group_size": 32
774
+ },
775
+ "language_model.model.layers.20.linear_attn.out_proj": {
776
+ "bits": 6,
777
+ "group_size": 32
778
+ },
779
+ "language_model.model.layers.20.linear_attn.in_proj_a": {
780
+ "bits": 8,
781
+ "group_size": 32
782
+ },
783
+ "language_model.model.layers.20.linear_attn.in_proj_b": {
784
+ "bits": 8,
785
+ "group_size": 32
786
+ },
787
+ "language_model.model.layers.20.linear_attn.in_proj_z": {
788
+ "bits": 8,
789
+ "group_size": 32
790
+ },
791
+ "language_model.model.layers.20.linear_attn.in_proj_qkv": {
792
+ "bits": 8,
793
+ "group_size": 32
794
+ },
795
+ "language_model.model.layers.19.mlp.shared_expert_gate": {
796
+ "bits": 8,
797
+ "group_size": 32
798
+ },
799
+ "language_model.model.layers.19.mlp.shared_expert.up_proj": {
800
+ "bits": 8,
801
+ "group_size": 32
802
+ },
803
+ "language_model.model.layers.19.mlp.shared_expert.down_proj": {
804
+ "bits": 8,
805
+ "group_size": 32
806
+ },
807
+ "language_model.model.layers.19.mlp.shared_expert.gate_proj": {
808
+ "bits": 8,
809
+ "group_size": 32
810
+ },
811
+ "language_model.model.layers.19.mlp.gate": {
812
+ "bits": 8,
813
+ "group_size": 32
814
+ },
815
+ "language_model.model.layers.19.self_attn.o_proj": {
816
+ "bits": 8,
817
+ "group_size": 32
818
+ },
819
+ "language_model.model.layers.19.self_attn.v_proj": {
820
+ "bits": 8,
821
+ "group_size": 32
822
+ },
823
+ "language_model.model.layers.19.self_attn.k_proj": {
824
+ "bits": 8,
825
+ "group_size": 32
826
+ },
827
+ "language_model.model.layers.19.self_attn.q_proj": {
828
+ "bits": 8,
829
+ "group_size": 32
830
+ },
831
+ "language_model.model.layers.18.mlp.shared_expert_gate": {
832
+ "bits": 8,
833
+ "group_size": 32
834
+ },
835
+ "language_model.model.layers.18.mlp.shared_expert.up_proj": {
836
+ "bits": 8,
837
+ "group_size": 32
838
+ },
839
+ "language_model.model.layers.18.mlp.shared_expert.down_proj": {
840
+ "bits": 8,
841
+ "group_size": 32
842
+ },
843
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj": {
844
+ "bits": 8,
845
+ "group_size": 32
846
+ },
847
+ "language_model.model.layers.18.mlp.gate": {
848
+ "bits": 8,
849
+ "group_size": 32
850
+ },
851
+ "language_model.model.layers.18.linear_attn.out_proj": {
852
+ "bits": 8,
853
+ "group_size": 32
854
+ },
855
+ "language_model.model.layers.18.linear_attn.in_proj_a": {
856
+ "bits": 8,
857
+ "group_size": 32
858
+ },
859
+ "language_model.model.layers.18.linear_attn.in_proj_b": {
860
+ "bits": 8,
861
+ "group_size": 32
862
+ },
863
+ "language_model.model.layers.18.linear_attn.in_proj_z": {
864
+ "bits": 6,
865
+ "group_size": 32
866
+ },
867
+ "language_model.model.layers.18.linear_attn.in_proj_qkv": {
868
+ "bits": 8,
869
+ "group_size": 32
870
+ },
871
+ "language_model.model.layers.17.mlp.shared_expert_gate": {
872
+ "bits": 8,
873
+ "group_size": 32
874
+ },
875
+ "language_model.model.layers.17.mlp.shared_expert.up_proj": {
876
+ "bits": 8,
877
+ "group_size": 32
878
+ },
879
+ "language_model.model.layers.17.mlp.shared_expert.down_proj": {
880
+ "bits": 8,
881
+ "group_size": 32
882
+ },
883
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj": {
884
+ "bits": 8,
885
+ "group_size": 32
886
+ },
887
+ "language_model.model.layers.17.mlp.gate": {
888
+ "bits": 8,
889
+ "group_size": 32
890
+ },
891
+ "language_model.model.layers.17.linear_attn.out_proj": {
892
+ "bits": 6,
893
+ "group_size": 32
894
+ },
895
+ "language_model.model.layers.17.linear_attn.in_proj_a": {
896
+ "bits": 8,
897
+ "group_size": 32
898
+ },
899
+ "language_model.model.layers.17.linear_attn.in_proj_b": {
900
+ "bits": 8,
901
+ "group_size": 32
902
+ },
903
+ "language_model.model.layers.17.linear_attn.in_proj_z": {
904
+ "bits": 8,
905
+ "group_size": 32
906
+ },
907
+ "language_model.model.layers.17.linear_attn.in_proj_qkv": {
908
+ "bits": 8,
909
+ "group_size": 32
910
+ },
911
+ "language_model.model.layers.16.mlp.shared_expert_gate": {
912
+ "bits": 8,
913
+ "group_size": 32
914
+ },
915
+ "language_model.model.layers.16.mlp.shared_expert.up_proj": {
916
+ "bits": 8,
917
+ "group_size": 32
918
+ },
919
+ "language_model.model.layers.16.mlp.shared_expert.down_proj": {
920
+ "bits": 8,
921
+ "group_size": 32
922
+ },
923
+ "language_model.model.layers.16.mlp.shared_expert.gate_proj": {
924
+ "bits": 8,
925
+ "group_size": 32
926
+ },
927
+ "language_model.model.layers.16.mlp.gate": {
928
+ "bits": 8,
929
+ "group_size": 32
930
+ },
931
+ "language_model.model.layers.16.linear_attn.out_proj": {
932
+ "bits": 6,
933
+ "group_size": 32
934
+ },
935
+ "language_model.model.layers.16.linear_attn.in_proj_a": {
936
+ "bits": 8,
937
+ "group_size": 32
938
+ },
939
+ "language_model.model.layers.16.linear_attn.in_proj_b": {
940
+ "bits": 8,
941
+ "group_size": 32
942
+ },
943
+ "language_model.model.layers.16.linear_attn.in_proj_z": {
944
+ "bits": 8,
945
+ "group_size": 32
946
+ },
947
+ "language_model.model.layers.16.linear_attn.in_proj_qkv": {
948
+ "bits": 8,
949
+ "group_size": 32
950
+ },
951
+ "language_model.model.layers.15.mlp.shared_expert_gate": {
952
+ "bits": 8,
953
+ "group_size": 32
954
+ },
955
+ "language_model.model.layers.15.mlp.shared_expert.up_proj": {
956
+ "bits": 8,
957
+ "group_size": 32
958
+ },
959
+ "language_model.model.layers.15.mlp.shared_expert.down_proj": {
960
+ "bits": 8,
961
+ "group_size": 32
962
+ },
963
+ "language_model.model.layers.15.mlp.shared_expert.gate_proj": {
964
+ "bits": 8,
965
+ "group_size": 32
966
+ },
967
+ "language_model.model.layers.15.mlp.gate": {
968
+ "bits": 8,
969
+ "group_size": 32
970
+ },
971
+ "language_model.model.layers.15.self_attn.o_proj": {
972
+ "bits": 8,
973
+ "group_size": 32
974
+ },
975
+ "language_model.model.layers.15.self_attn.v_proj": {
976
+ "bits": 8,
977
+ "group_size": 32
978
+ },
979
+ "language_model.model.layers.15.self_attn.k_proj": {
980
+ "bits": 8,
981
+ "group_size": 32
982
+ },
983
+ "language_model.model.layers.15.self_attn.q_proj": {
984
+ "bits": 8,
985
+ "group_size": 32
986
+ },
987
+ "language_model.model.layers.14.mlp.shared_expert_gate": {
988
+ "bits": 8,
989
+ "group_size": 32
990
+ },
991
+ "language_model.model.layers.14.mlp.shared_expert.up_proj": {
992
+ "bits": 8,
993
+ "group_size": 32
994
+ },
995
+ "language_model.model.layers.14.mlp.shared_expert.down_proj": {
996
+ "bits": 8,
997
+ "group_size": 32
998
+ },
999
+ "language_model.model.layers.14.mlp.shared_expert.gate_proj": {
1000
+ "bits": 8,
1001
+ "group_size": 32
1002
+ },
1003
+ "language_model.model.layers.14.mlp.gate": {
1004
+ "bits": 8,
1005
+ "group_size": 32
1006
+ },
1007
+ "language_model.model.layers.14.linear_attn.out_proj": {
1008
+ "bits": 8,
1009
+ "group_size": 32
1010
+ },
1011
+ "language_model.model.layers.14.linear_attn.in_proj_a": {
1012
+ "bits": 8,
1013
+ "group_size": 32
1014
+ },
1015
+ "language_model.model.layers.14.linear_attn.in_proj_b": {
1016
+ "bits": 8,
1017
+ "group_size": 32
1018
+ },
1019
+ "language_model.model.layers.14.linear_attn.in_proj_z": {
1020
+ "bits": 8,
1021
+ "group_size": 32
1022
+ },
1023
+ "language_model.model.layers.14.linear_attn.in_proj_qkv": {
1024
+ "bits": 8,
1025
+ "group_size": 32
1026
+ },
1027
+ "language_model.model.layers.13.mlp.shared_expert_gate": {
1028
+ "bits": 8,
1029
+ "group_size": 32
1030
+ },
1031
+ "language_model.model.layers.13.mlp.shared_expert.up_proj": {
1032
+ "bits": 8,
1033
+ "group_size": 32
1034
+ },
1035
+ "language_model.model.layers.13.mlp.shared_expert.down_proj": {
1036
+ "bits": 8,
1037
+ "group_size": 32
1038
+ },
1039
+ "language_model.model.layers.13.mlp.shared_expert.gate_proj": {
1040
+ "bits": 8,
1041
+ "group_size": 32
1042
+ },
1043
+ "language_model.model.layers.13.mlp.gate": {
1044
+ "bits": 8,
1045
+ "group_size": 32
1046
+ },
1047
+ "language_model.model.layers.13.linear_attn.out_proj": {
1048
+ "bits": 8,
1049
+ "group_size": 32
1050
+ },
1051
+ "language_model.model.layers.13.linear_attn.in_proj_a": {
1052
+ "bits": 8,
1053
+ "group_size": 32
1054
+ },
1055
+ "language_model.model.layers.13.linear_attn.in_proj_b": {
1056
+ "bits": 8,
1057
+ "group_size": 32
1058
+ },
1059
+ "language_model.model.layers.13.linear_attn.in_proj_z": {
1060
+ "bits": 8,
1061
+ "group_size": 32
1062
+ },
1063
+ "language_model.model.layers.13.linear_attn.in_proj_qkv": {
1064
+ "bits": 6,
1065
+ "group_size": 32
1066
+ },
1067
+ "language_model.model.layers.12.mlp.shared_expert_gate": {
1068
+ "bits": 8,
1069
+ "group_size": 32
1070
+ },
1071
+ "language_model.model.layers.12.mlp.shared_expert.up_proj": {
1072
+ "bits": 8,
1073
+ "group_size": 32
1074
+ },
1075
+ "language_model.model.layers.12.mlp.shared_expert.down_proj": {
1076
+ "bits": 8,
1077
+ "group_size": 32
1078
+ },
1079
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj": {
1080
+ "bits": 8,
1081
+ "group_size": 32
1082
+ },
1083
+ "language_model.model.layers.12.mlp.gate": {
1084
+ "bits": 8,
1085
+ "group_size": 32
1086
+ },
1087
+ "language_model.model.layers.12.linear_attn.out_proj": {
1088
+ "bits": 8,
1089
+ "group_size": 32
1090
+ },
1091
+ "language_model.model.layers.12.linear_attn.in_proj_a": {
1092
+ "bits": 8,
1093
+ "group_size": 32
1094
+ },
1095
+ "language_model.model.layers.12.linear_attn.in_proj_b": {
1096
+ "bits": 8,
1097
+ "group_size": 32
1098
+ },
1099
+ "language_model.model.layers.12.linear_attn.in_proj_z": {
1100
+ "bits": 8,
1101
+ "group_size": 32
1102
+ },
1103
+ "language_model.model.layers.12.linear_attn.in_proj_qkv": {
1104
+ "bits": 8,
1105
+ "group_size": 32
1106
+ },
1107
+ "language_model.model.layers.11.mlp.shared_expert_gate": {
1108
+ "bits": 8,
1109
+ "group_size": 32
1110
+ },
1111
+ "language_model.model.layers.11.mlp.shared_expert.up_proj": {
1112
+ "bits": 8,
1113
+ "group_size": 32
1114
+ },
1115
+ "language_model.model.layers.11.mlp.shared_expert.down_proj": {
1116
+ "bits": 8,
1117
+ "group_size": 32
1118
+ },
1119
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj": {
1120
+ "bits": 8,
1121
+ "group_size": 32
1122
+ },
1123
+ "language_model.model.layers.11.mlp.gate": {
1124
+ "bits": 8,
1125
+ "group_size": 32
1126
+ },
1127
+ "language_model.model.layers.11.self_attn.o_proj": {
1128
+ "bits": 6,
1129
+ "group_size": 32
1130
+ },
1131
+ "language_model.model.layers.11.self_attn.v_proj": {
1132
+ "bits": 8,
1133
+ "group_size": 32
1134
+ },
1135
+ "language_model.model.layers.11.self_attn.k_proj": {
1136
+ "bits": 8,
1137
+ "group_size": 32
1138
+ },
1139
+ "language_model.model.layers.11.self_attn.q_proj": {
1140
+ "bits": 8,
1141
+ "group_size": 32
1142
+ },
1143
+ "language_model.model.layers.10.mlp.shared_expert_gate": {
1144
+ "bits": 8,
1145
+ "group_size": 32
1146
+ },
1147
+ "language_model.model.layers.10.mlp.shared_expert.up_proj": {
1148
+ "bits": 8,
1149
+ "group_size": 32
1150
+ },
1151
+ "language_model.model.layers.10.mlp.shared_expert.down_proj": {
1152
+ "bits": 8,
1153
+ "group_size": 32
1154
+ },
1155
+ "language_model.model.layers.10.mlp.shared_expert.gate_proj": {
1156
+ "bits": 8,
1157
+ "group_size": 32
1158
+ },
1159
+ "language_model.model.layers.10.mlp.gate": {
1160
+ "bits": 8,
1161
+ "group_size": 32
1162
+ },
1163
+ "language_model.model.layers.10.linear_attn.out_proj": {
1164
+ "bits": 8,
1165
+ "group_size": 32
1166
+ },
1167
+ "language_model.model.layers.10.linear_attn.in_proj_a": {
1168
+ "bits": 8,
1169
+ "group_size": 32
1170
+ },
1171
+ "language_model.model.layers.10.linear_attn.in_proj_b": {
1172
+ "bits": 8,
1173
+ "group_size": 32
1174
+ },
1175
+ "language_model.model.layers.10.linear_attn.in_proj_z": {
1176
+ "bits": 8,
1177
+ "group_size": 32
1178
+ },
1179
+ "language_model.model.layers.10.linear_attn.in_proj_qkv": {
1180
+ "bits": 8,
1181
+ "group_size": 32
1182
+ },
1183
+ "language_model.model.layers.9.mlp.shared_expert_gate": {
1184
+ "bits": 8,
1185
+ "group_size": 32
1186
+ },
1187
+ "language_model.model.layers.9.mlp.shared_expert.up_proj": {
1188
+ "bits": 8,
1189
+ "group_size": 32
1190
+ },
1191
+ "language_model.model.layers.9.mlp.shared_expert.down_proj": {
1192
+ "bits": 8,
1193
+ "group_size": 32
1194
+ },
1195
+ "language_model.model.layers.9.mlp.shared_expert.gate_proj": {
1196
+ "bits": 8,
1197
+ "group_size": 32
1198
+ },
1199
+ "language_model.model.layers.9.mlp.gate": {
1200
+ "bits": 8,
1201
+ "group_size": 32
1202
+ },
1203
+ "language_model.model.layers.9.linear_attn.out_proj": {
1204
+ "bits": 8,
1205
+ "group_size": 32
1206
+ },
1207
+ "language_model.model.layers.9.linear_attn.in_proj_a": {
1208
+ "bits": 8,
1209
+ "group_size": 32
1210
+ },
1211
+ "language_model.model.layers.9.linear_attn.in_proj_b": {
1212
+ "bits": 8,
1213
+ "group_size": 32
1214
+ },
1215
+ "language_model.model.layers.9.linear_attn.in_proj_z": {
1216
+ "bits": 8,
1217
+ "group_size": 32
1218
+ },
1219
+ "language_model.model.layers.9.linear_attn.in_proj_qkv": {
1220
+ "bits": 8,
1221
+ "group_size": 32
1222
+ },
1223
+ "language_model.model.layers.8.mlp.shared_expert_gate": {
1224
+ "bits": 8,
1225
+ "group_size": 32
1226
+ },
1227
+ "language_model.model.layers.8.mlp.shared_expert.up_proj": {
1228
+ "bits": 8,
1229
+ "group_size": 32
1230
+ },
1231
+ "language_model.model.layers.8.mlp.shared_expert.down_proj": {
1232
+ "bits": 8,
1233
+ "group_size": 32
1234
+ },
1235
+ "language_model.model.layers.8.mlp.shared_expert.gate_proj": {
1236
+ "bits": 8,
1237
+ "group_size": 32
1238
+ },
1239
+ "language_model.model.layers.8.mlp.gate": {
1240
+ "bits": 8,
1241
+ "group_size": 32
1242
+ },
1243
+ "language_model.model.layers.8.linear_attn.out_proj": {
1244
+ "bits": 8,
1245
+ "group_size": 32
1246
+ },
1247
+ "language_model.model.layers.8.linear_attn.in_proj_a": {
1248
+ "bits": 8,
1249
+ "group_size": 32
1250
+ },
1251
+ "language_model.model.layers.8.linear_attn.in_proj_b": {
1252
+ "bits": 8,
1253
+ "group_size": 32
1254
+ },
1255
+ "language_model.model.layers.8.linear_attn.in_proj_z": {
1256
+ "bits": 8,
1257
+ "group_size": 32
1258
+ },
1259
+ "language_model.model.layers.8.linear_attn.in_proj_qkv": {
1260
+ "bits": 8,
1261
+ "group_size": 32
1262
+ },
1263
+ "language_model.model.layers.7.mlp.shared_expert_gate": {
1264
+ "bits": 8,
1265
+ "group_size": 32
1266
+ },
1267
+ "language_model.model.layers.7.mlp.shared_expert.up_proj": {
1268
+ "bits": 8,
1269
+ "group_size": 32
1270
+ },
1271
+ "language_model.model.layers.7.mlp.shared_expert.down_proj": {
1272
+ "bits": 8,
1273
+ "group_size": 32
1274
+ },
1275
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj": {
1276
+ "bits": 8,
1277
+ "group_size": 32
1278
+ },
1279
+ "language_model.model.layers.7.mlp.gate": {
1280
+ "bits": 8,
1281
+ "group_size": 32
1282
+ },
1283
+ "language_model.model.layers.7.self_attn.o_proj": {
1284
+ "bits": 8,
1285
+ "group_size": 32
1286
+ },
1287
+ "language_model.model.layers.7.self_attn.v_proj": {
1288
+ "bits": 8,
1289
+ "group_size": 32
1290
+ },
1291
+ "language_model.model.layers.7.self_attn.k_proj": {
1292
+ "bits": 8,
1293
+ "group_size": 32
1294
+ },
1295
+ "language_model.model.layers.7.self_attn.q_proj": {
1296
+ "bits": 8,
1297
+ "group_size": 32
1298
+ },
1299
+ "language_model.model.layers.6.mlp.shared_expert_gate": {
1300
+ "bits": 8,
1301
+ "group_size": 32
1302
+ },
1303
+ "language_model.model.layers.6.mlp.shared_expert.up_proj": {
1304
+ "bits": 8,
1305
+ "group_size": 32
1306
+ },
1307
+ "language_model.model.layers.6.mlp.shared_expert.down_proj": {
1308
+ "bits": 8,
1309
+ "group_size": 32
1310
+ },
1311
+ "language_model.model.layers.6.mlp.shared_expert.gate_proj": {
1312
+ "bits": 8,
1313
+ "group_size": 32
1314
+ },
1315
+ "language_model.model.layers.6.mlp.gate": {
1316
+ "bits": 8,
1317
+ "group_size": 32
1318
+ },
1319
+ "language_model.model.layers.6.linear_attn.out_proj": {
1320
+ "bits": 8,
1321
+ "group_size": 32
1322
+ },
1323
+ "language_model.model.layers.6.linear_attn.in_proj_a": {
1324
+ "bits": 8,
1325
+ "group_size": 32
1326
+ },
1327
+ "language_model.model.layers.6.linear_attn.in_proj_b": {
1328
+ "bits": 8,
1329
+ "group_size": 32
1330
+ },
1331
+ "language_model.model.layers.6.linear_attn.in_proj_z": {
1332
+ "bits": 8,
1333
+ "group_size": 32
1334
+ },
1335
+ "language_model.model.layers.6.linear_attn.in_proj_qkv": {
1336
+ "bits": 8,
1337
+ "group_size": 32
1338
+ },
1339
+ "language_model.model.layers.5.mlp.shared_expert_gate": {
1340
+ "bits": 8,
1341
+ "group_size": 32
1342
+ },
1343
+ "language_model.model.layers.5.mlp.shared_expert.up_proj": {
1344
+ "bits": 8,
1345
+ "group_size": 32
1346
+ },
1347
+ "language_model.model.layers.5.mlp.shared_expert.down_proj": {
1348
+ "bits": 8,
1349
+ "group_size": 32
1350
+ },
1351
+ "language_model.model.layers.5.mlp.shared_expert.gate_proj": {
1352
+ "bits": 8,
1353
+ "group_size": 32
1354
+ },
1355
+ "language_model.model.layers.5.mlp.gate": {
1356
+ "bits": 8,
1357
+ "group_size": 32
1358
+ },
1359
+ "language_model.model.layers.5.linear_attn.out_proj": {
1360
+ "bits": 8,
1361
+ "group_size": 32
1362
+ },
1363
+ "language_model.model.layers.5.linear_attn.in_proj_a": {
1364
+ "bits": 8,
1365
+ "group_size": 32
1366
+ },
1367
+ "language_model.model.layers.5.linear_attn.in_proj_b": {
1368
+ "bits": 8,
1369
+ "group_size": 32
1370
+ },
1371
+ "language_model.model.layers.5.linear_attn.in_proj_z": {
1372
+ "bits": 8,
1373
+ "group_size": 32
1374
+ },
1375
+ "language_model.model.layers.5.linear_attn.in_proj_qkv": {
1376
+ "bits": 8,
1377
+ "group_size": 32
1378
+ },
1379
+ "language_model.model.layers.4.mlp.shared_expert_gate": {
1380
+ "bits": 8,
1381
+ "group_size": 32
1382
+ },
1383
+ "language_model.model.layers.4.mlp.shared_expert.up_proj": {
1384
+ "bits": 8,
1385
+ "group_size": 32
1386
+ },
1387
+ "language_model.model.layers.4.mlp.shared_expert.down_proj": {
1388
+ "bits": 8,
1389
+ "group_size": 32
1390
+ },
1391
+ "language_model.model.layers.4.mlp.shared_expert.gate_proj": {
1392
+ "bits": 8,
1393
+ "group_size": 32
1394
+ },
1395
+ "language_model.model.layers.4.mlp.gate": {
1396
+ "bits": 8,
1397
+ "group_size": 32
1398
+ },
1399
+ "language_model.model.layers.4.linear_attn.out_proj": {
1400
+ "bits": 8,
1401
+ "group_size": 32
1402
+ },
1403
+ "language_model.model.layers.4.linear_attn.in_proj_a": {
1404
+ "bits": 8,
1405
+ "group_size": 32
1406
+ },
1407
+ "language_model.model.layers.4.linear_attn.in_proj_b": {
1408
+ "bits": 8,
1409
+ "group_size": 32
1410
+ },
1411
+ "language_model.model.layers.4.linear_attn.in_proj_z": {
1412
+ "bits": 8,
1413
+ "group_size": 32
1414
+ },
1415
+ "language_model.model.layers.4.linear_attn.in_proj_qkv": {
1416
+ "bits": 6,
1417
+ "group_size": 32
1418
+ },
1419
+ "language_model.model.layers.3.mlp.shared_expert_gate": {
1420
+ "bits": 8,
1421
+ "group_size": 32
1422
+ },
1423
+ "language_model.model.layers.3.mlp.shared_expert.up_proj": {
1424
+ "bits": 8,
1425
+ "group_size": 32
1426
+ },
1427
+ "language_model.model.layers.3.mlp.shared_expert.down_proj": {
1428
+ "bits": 8,
1429
+ "group_size": 32
1430
+ },
1431
+ "language_model.model.layers.3.mlp.shared_expert.gate_proj": {
1432
+ "bits": 8,
1433
+ "group_size": 32
1434
+ },
1435
+ "language_model.model.layers.3.mlp.gate": {
1436
+ "bits": 8,
1437
+ "group_size": 32
1438
+ },
1439
+ "language_model.model.layers.3.self_attn.o_proj": {
1440
+ "bits": 8,
1441
+ "group_size": 32
1442
+ },
1443
+ "language_model.model.layers.3.self_attn.v_proj": {
1444
+ "bits": 8,
1445
+ "group_size": 32
1446
+ },
1447
+ "language_model.model.layers.3.self_attn.k_proj": {
1448
+ "bits": 8,
1449
+ "group_size": 32
1450
+ },
1451
+ "language_model.model.layers.3.self_attn.q_proj": {
1452
+ "bits": 8,
1453
+ "group_size": 32
1454
+ },
1455
+ "language_model.model.layers.2.mlp.shared_expert_gate": {
1456
+ "bits": 8,
1457
+ "group_size": 32
1458
+ },
1459
+ "language_model.model.layers.2.mlp.shared_expert.up_proj": {
1460
+ "bits": 8,
1461
+ "group_size": 32
1462
+ },
1463
+ "language_model.model.layers.2.mlp.shared_expert.down_proj": {
1464
+ "bits": 8,
1465
+ "group_size": 32
1466
+ },
1467
+ "language_model.model.layers.2.mlp.shared_expert.gate_proj": {
1468
+ "bits": 8,
1469
+ "group_size": 32
1470
+ },
1471
+ "language_model.model.layers.2.mlp.gate": {
1472
+ "bits": 8,
1473
+ "group_size": 32
1474
+ },
1475
+ "language_model.model.layers.2.linear_attn.out_proj": {
1476
+ "bits": 8,
1477
+ "group_size": 32
1478
+ },
1479
+ "language_model.model.layers.2.linear_attn.in_proj_a": {
1480
+ "bits": 8,
1481
+ "group_size": 32
1482
+ },
1483
+ "language_model.model.layers.2.linear_attn.in_proj_b": {
1484
+ "bits": 8,
1485
+ "group_size": 32
1486
+ },
1487
+ "language_model.model.layers.2.linear_attn.in_proj_z": {
1488
+ "bits": 6,
1489
+ "group_size": 32
1490
+ },
1491
+ "language_model.model.layers.2.linear_attn.in_proj_qkv": {
1492
+ "bits": 8,
1493
+ "group_size": 32
1494
+ },
1495
+ "language_model.model.layers.1.mlp.shared_expert_gate": {
1496
+ "bits": 8,
1497
+ "group_size": 32
1498
+ },
1499
+ "language_model.model.layers.1.mlp.shared_expert.up_proj": {
1500
+ "bits": 8,
1501
+ "group_size": 32
1502
+ },
1503
+ "language_model.model.layers.1.mlp.shared_expert.down_proj": {
1504
+ "bits": 8,
1505
+ "group_size": 32
1506
+ },
1507
+ "language_model.model.layers.1.mlp.shared_expert.gate_proj": {
1508
+ "bits": 8,
1509
+ "group_size": 32
1510
+ },
1511
+ "language_model.model.layers.1.mlp.gate": {
1512
+ "bits": 8,
1513
+ "group_size": 32
1514
+ },
1515
+ "language_model.model.layers.1.linear_attn.out_proj": {
1516
+ "bits": 8,
1517
+ "group_size": 32
1518
+ },
1519
+ "language_model.model.layers.1.linear_attn.in_proj_a": {
1520
+ "bits": 8,
1521
+ "group_size": 32
1522
+ },
1523
+ "language_model.model.layers.1.linear_attn.in_proj_b": {
1524
+ "bits": 8,
1525
+ "group_size": 32
1526
+ },
1527
+ "language_model.model.layers.1.linear_attn.in_proj_z": {
1528
+ "bits": 6,
1529
+ "group_size": 32
1530
+ },
1531
+ "language_model.model.layers.1.linear_attn.in_proj_qkv": {
1532
+ "bits": 8,
1533
+ "group_size": 32
1534
+ },
1535
+ "language_model.model.layers.0.mlp.shared_expert_gate": {
1536
+ "bits": 8,
1537
+ "group_size": 32
1538
+ },
1539
+ "language_model.model.layers.0.mlp.shared_expert.up_proj": {
1540
+ "bits": 8,
1541
+ "group_size": 32
1542
+ },
1543
+ "language_model.model.layers.0.mlp.shared_expert.down_proj": {
1544
+ "bits": 8,
1545
+ "group_size": 32
1546
+ },
1547
+ "language_model.model.layers.0.mlp.shared_expert.gate_proj": {
1548
+ "bits": 8,
1549
+ "group_size": 32
1550
+ },
1551
+ "language_model.model.layers.0.mlp.gate": {
1552
+ "bits": 8,
1553
+ "group_size": 32
1554
+ },
1555
+ "language_model.model.layers.0.linear_attn.out_proj": {
1556
+ "bits": 8,
1557
+ "group_size": 32
1558
+ },
1559
+ "language_model.model.layers.0.linear_attn.in_proj_a": {
1560
+ "bits": 8,
1561
+ "group_size": 32
1562
+ },
1563
+ "language_model.model.layers.0.linear_attn.in_proj_b": {
1564
+ "bits": 8,
1565
+ "group_size": 32
1566
+ },
1567
+ "language_model.model.layers.0.linear_attn.in_proj_z": {
1568
+ "bits": 8,
1569
+ "group_size": 32
1570
+ },
1571
+ "language_model.model.layers.0.linear_attn.in_proj_qkv": {
1572
+ "bits": 8,
1573
+ "group_size": 32
1574
+ }
1575
+ }
1576
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:06b9509352d2af50381ab2247e083b80d32d5c0aba91c272ca9ff729b6a0e523
3
+ size 19989325
tokenizer_config.json ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "audio_bos_token": "<|audio_start|>",
4
+ "audio_eos_token": "<|audio_end|>",
5
+ "audio_token": "<|audio_pad|>",
6
+ "backend": "tokenizers",
7
+ "bos_token": null,
8
+ "clean_up_tokenization_spaces": false,
9
+ "eos_token": "<|im_end|>",
10
+ "errors": "replace",
11
+ "image_token": "<|image_pad|>",
12
+ "is_local": true,
13
+ "local_files_only": false,
14
+ "model_max_length": 262144,
15
+ "model_specific_special_tokens": {
16
+ "audio_bos_token": "<|audio_start|>",
17
+ "audio_eos_token": "<|audio_end|>",
18
+ "audio_token": "<|audio_pad|>",
19
+ "image_token": "<|image_pad|>",
20
+ "video_token": "<|video_pad|>",
21
+ "vision_bos_token": "<|vision_start|>",
22
+ "vision_eos_token": "<|vision_end|>"
23
+ },
24
+ "pad_token": "<|endoftext|>",
25
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
26
+ "processor_class": "Qwen3VLProcessor",
27
+ "split_special_tokens": false,
28
+ "tokenizer_class": "Qwen2Tokenizer",
29
+ "tool_parser_type": "qwen3_coder",
30
+ "unk_token": null,
31
+ "video_token": "<|video_pad|>",
32
+ "vision_bos_token": "<|vision_start|>",
33
+ "vision_eos_token": "<|vision_end|>"
34
+ }