provsalt commited on
Commit
48d9819
·
verified ·
1 Parent(s): f9c9193

Upload Qwen3.8 NVFP4 model with NVFP4 PLE

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. .gitattributes +2 -0
  2. LICENSE +16 -0
  3. README.md +133 -0
  4. chat_template.jinja +170 -0
  5. config.json +1470 -0
  6. generation_config.json +12 -0
  7. merges.txt +0 -0
  8. model-00002-of-00004.safetensors +3 -0
  9. model-00003-of-00004.safetensors +3 -0
  10. model-00004-of-00004.safetensors +3 -0
  11. model.safetensors.index.json +3 -0
  12. nvfp4_experts-00001-of-00016.safetensors +3 -0
  13. nvfp4_experts-00002-of-00016.safetensors +3 -0
  14. nvfp4_experts-00003-of-00016.safetensors +3 -0
  15. nvfp4_experts-00004-of-00016.safetensors +3 -0
  16. nvfp4_experts-00005-of-00016.safetensors +3 -0
  17. nvfp4_experts-00006-of-00016.safetensors +3 -0
  18. nvfp4_experts-00007-of-00016.safetensors +3 -0
  19. nvfp4_experts-00008-of-00016.safetensors +3 -0
  20. nvfp4_experts-00009-of-00016.safetensors +3 -0
  21. nvfp4_experts-00010-of-00016.safetensors +3 -0
  22. nvfp4_experts-00011-of-00016.safetensors +3 -0
  23. nvfp4_experts-00012-of-00016.safetensors +3 -0
  24. nvfp4_experts-00013-of-00016.safetensors +3 -0
  25. nvfp4_experts-00014-of-00016.safetensors +3 -0
  26. nvfp4_experts-00015-of-00016.safetensors +3 -0
  27. nvfp4_experts-00016-of-00016.safetensors +3 -0
  28. nvfp4_experts_mtp.safetensors +3 -0
  29. ple-nvfp4-00001-of-00128.safetensors +3 -0
  30. ple-nvfp4-00002-of-00128.safetensors +3 -0
  31. ple-nvfp4-00003-of-00128.safetensors +3 -0
  32. ple-nvfp4-00004-of-00128.safetensors +3 -0
  33. ple-nvfp4-00005-of-00128.safetensors +3 -0
  34. ple-nvfp4-00006-of-00128.safetensors +3 -0
  35. ple-nvfp4-00007-of-00128.safetensors +3 -0
  36. ple-nvfp4-00008-of-00128.safetensors +3 -0
  37. ple-nvfp4-00009-of-00128.safetensors +3 -0
  38. ple-nvfp4-00010-of-00128.safetensors +3 -0
  39. ple-nvfp4-00011-of-00128.safetensors +3 -0
  40. ple-nvfp4-00012-of-00128.safetensors +3 -0
  41. ple-nvfp4-00013-of-00128.safetensors +3 -0
  42. ple-nvfp4-00014-of-00128.safetensors +3 -0
  43. ple-nvfp4-00015-of-00128.safetensors +3 -0
  44. ple-nvfp4-00016-of-00128.safetensors +3 -0
  45. ple-nvfp4-00017-of-00128.safetensors +3 -0
  46. ple-nvfp4-00018-of-00128.safetensors +3 -0
  47. ple-nvfp4-00019-of-00128.safetensors +3 -0
  48. ple-nvfp4-00020-of-00128.safetensors +3 -0
  49. ple-nvfp4-00021-of-00128.safetensors +3 -0
  50. ple-nvfp4-00022-of-00128.safetensors +3 -0
.gitattributes CHANGED
@@ -33,3 +33,5 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ model.safetensors.index.json filter=lfs diff=lfs merge=lfs -text
37
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
LICENSE ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Qwen Community License 1.0
2
+
3
+ Copyright (c) 2026 Qwen
4
+
5
+ Permission is hereby granted, free of charge, to any person obtaining a copy of this software, including the model weights, parameters, configuration files, inference code and associated documentation files (collectively, the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, sell, deploy, host, fine-tune, and create derivative works from (collectively, "Use" or "Using") copies of the Software; and to permit persons to whom the Software is furnished to do so, subject to the following conditions:
6
+
7
+ 1. The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software. If the Software (or any derivative works thereof) is Used for any of the licensee's commercial products or services that have more than 100,000,000 monthly active users or US$ 20,000,000 (or equivalent in other currencies) monthly revenue, respective model name must be prominently displayed on the user interface of such product or service; and,
8
+
9
+ 2. If the licensee or any of its affiliates conducts a Model as a Service or AI Work Assistant business, the licensee shall obtain a separate license from Qwen before Using the Software or its derivative works for any commercial purpose. The foregoing requirement shall not apply to the licensee's internal Use of the Software, provided that such Use does not make the Software, its outputs, or its underlying model capabilities available to any third party.
10
+
11
+ "Model as a Service" means giving a third party access to language model inference or fine-tuning (e.g., via API or a hosted endpoint) in a manner that allows such third parties to exercise meaningful control over the inputs, parameters, or training data. This does not include the mere relaying of requests to models hosted by other third parties.
12
+ “AI Work Assistant” means an independent AI-powered product primarily designed for AI-assisted coding or office productivity (e.g., Qoder and QwenWork). It does not include: (a) a single-purpose AI tool (such as an AI translation tool); (b) an AI assistant primarily designed for a domain other than coding or office productivity (such as Taobao AI Shopping Assistant or AMap AI Chat); or (c) an AI assistant that is a feature of a product whose primary purpose is not AI-assisted coding or office productivity.
13
+
14
+ THE SOFTWARE AND ANY OUTPUT AND RESULTS THEREFROM ARE PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL QWEN, ITS AFFILIATES OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE. THE USE OF THE SOFTWARE MUST COMPLY WITH APPLICABLE LAWS AND REGULATIONS, AND MUST NOT INFRINGE THE INTELLECTUAL PROPERTY RIGHTS OF ANY THIRD PARTY.
15
+
16
+ For any questions regarding this license, please contact model-business@notice.qwencloud.com.
README.md ADDED
@@ -0,0 +1,133 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: vllm
3
+ license: other
4
+ license_name: qwen-community-1.0
5
+ license_link: LICENSE
6
+ base_model: Inferact/Qwen3.8-Flash-Next-NVFP4
7
+ base_model_relation: quantized
8
+ pipeline_tag: image-text-to-text
9
+ inference: false
10
+ tags:
11
+ - qwen
12
+ - qwen3.8
13
+ - qwen4
14
+ - modelopt
15
+ - nvfp4
16
+ - vllm
17
+ - custom-code
18
+ ---
19
+
20
+ # Qwen3.8-Flash-Next NVFP4 with NVFP4 PLE
21
+
22
+ This repository is a serving derivative of
23
+ [`Inferact/Qwen3.8-Flash-Next-NVFP4`](https://huggingface.co/Inferact/Qwen3.8-Flash-Next-NVFP4).
24
+ It keeps the ModelOpt NVFP4 backbone unchanged and converts only the BF16
25
+ position-learning enhancement (PLE) n-gram table to NVFP4.
26
+
27
+ This repository contains model weights and Hugging Face metadata only. It does
28
+ not include runtime code, shell scripts, Docker files, or result artifacts.
29
+
30
+ The packed PLE format requires an external `qwen38-nvfp4-ple` runtime plugin.
31
+ Stock vLLM and Transformers cannot load it. The checkpoint retains the original
32
+ vision tower.
33
+
34
+ ## Storage
35
+
36
+ | Artifact | Exact bytes | GiB |
37
+ |---|---:|---:|
38
+ | Source checkpoint payload | 182,738,792,440 | 170.189 |
39
+ | Source BF16 PLE table | 102,400,491,520 | 95.368 |
40
+ | Converted NVFP4 PLE table | 28,800,138,752 | 26.822 |
41
+ | Complete converted checkpoint | 109,138,439,672 | 101.643 |
42
+
43
+ The conversion saves 73,600,352,768 bytes, or 68.546 GiB. It does not use
44
+ REAP or remove experts.
45
+
46
+ ## Why this fits on one DGX Spark
47
+
48
+ This release targets one NVIDIA DGX Spark because its GB10 CPU and GPU share
49
+ 128 GB of LPDDR5x unified system memory. [NVIDIA documents the hardware and
50
+ memory layout](https://docs.nvidia.com/dgx/dgx-spark/hardware.html). The GPU
51
+ executes the NVFP4 backbone. The plugin keeps the 26.822 GiB packed PLE table
52
+ CPU-offloaded and decodes only requested rows to BF16. Both allocations draw
53
+ from the same physical memory pool.
54
+
55
+ In a measured full multimodal TP1 run, vLLM reported 73.97 GiB during model
56
+ loading and reserved a 2 GiB KV cache. The vision tower added 0.85 GiB over
57
+ text-only serving. The PLE worker has been tested only with vLLM's `mp`
58
+ executor at TP1.
59
+
60
+ API startup took about 639 seconds. After image and text requests, the host had
61
+ 19.8 GiB available with 14.0 GiB of system-wide swap in use. The default
62
+ 4,096-token context, single sequence, and 2 GiB KV cache are conservative.
63
+ This demonstrates fit; it is not a throughput claim.
64
+
65
+ ## External runtime contract
66
+
67
+ | Component | Required or tested value |
68
+ |---|---|
69
+ | vLLM image | `vllm/vllm-openai:qwen38-flash-next@sha256:fc120ece0a388cc0aa1caad4a9f1cd92113484ab7ec2fd0efadd62585be05bf8` |
70
+ | vLLM version | `0.1.dev20073+g8e685d198` |
71
+ | PLE mode | CPU offload with BF16 lookup output |
72
+ | Serving model | Full `Qwen4ExpForConditionalGeneration` wrapper |
73
+ | Multimodal limits | One image, no video, 65,536-to-262,144-pixel budget |
74
+ | Executor | `mp`, including at TP1 |
75
+ | Validated GPU | NVIDIA GB10, compute capability 12.1 |
76
+
77
+ The pinned vLLM `uni` executor does not spawn the PLE CPU worker. The external
78
+ plugin must select `mp` and register itself inside vLLM's special PLE
79
+ subprocess.
80
+
81
+ ## PLE format
82
+
83
+ Format `qwen38-nvfp4-ple-v1` stores each group of 16 values as packed E2M1
84
+ values, one E4M3 block scale, and one FP32 global decode scale per source PLE
85
+ shard. The runtime gathers only requested rows and decodes those rows to BF16.
86
+ It never expands the complete table.
87
+
88
+ ## Evaluation
89
+
90
+ A controlled teacher-forced study used 32 calibration prompts and eight held-
91
+ out prompts, covering 236 next-token positions. The executable reference was
92
+ the official FP8 backbone with normal PLE behavior.
93
+
94
+ These measurements isolate changes to the PLE representation. They do not
95
+ measure the separate quality difference between the Inferact NVFP4 backbone
96
+ and the original model. This uploaded checkpoint uses the first row below;
97
+ the REAP rows are comparison experiments only.
98
+
99
+ | Perturbation | Top-1 agreement | Reference top-1 in candidate top-5 | KL, nats | NLL delta, nats | Logit cosine |
100
+ |---|---:|---:|---:|---:|---:|
101
+ | NVFP4 PLE only | 91.525% | 100.000% | 0.015591 | +0.019442 | 0.995399 |
102
+ | REAP only, 25% experts removed | 87.712% | 100.000% | 0.042569 | +0.043668 | 0.991027 |
103
+ | REAP and NVFP4 PLE | 91.102% | 99.576% | 0.040298 | +0.040545 | 0.990824 |
104
+
105
+ The converted checkpoint passed text-only and full multimodal vLLM smoke
106
+ tests. The multimodal run loaded the vision tower and served PNG inputs. With a
107
+ neutral prompt, it correctly identified a generated Moon scene, Earth, casual
108
+ clothing, and the absence of a spacesuit.
109
+
110
+
111
+ ## Limits
112
+
113
+ - The alignment study is not a task-quality benchmark.
114
+ - The runtime checks are smoke tests, not throughput or vision benchmarks.
115
+ - Long-context, concurrent-request, tensor-parallel, and expert-parallel paths
116
+ have not been validated.
117
+ - The validated image path accepts one image within the default pixel budget.
118
+ Video is disabled by default and has not been validated.
119
+ - The source MTP weights remain in the checkpoint, but the validated runtime
120
+ did not enable MTP.
121
+ - The tested host had system-wide swap in use after inference.
122
+ - The PLE decoder uses ordinary PyTorch CPU operations. A fused decoder could
123
+ reduce lookup latency.
124
+
125
+ ## Provenance and license
126
+
127
+ The backbone comes from
128
+ [`Inferact/Qwen3.8-Flash-Next-NVFP4`](https://huggingface.co/Inferact/Qwen3.8-Flash-Next-NVFP4),
129
+ which derives from
130
+ [`Qwen/Qwen3.8-Flash-Next`](https://huggingface.co/Qwen/Qwen3.8-Flash-Next).
131
+ Only the PLE representation changed here.
132
+
133
+ The model weights remain under the Qwen Community License 1.0 in `LICENSE`.
chat_template.jinja ADDED
@@ -0,0 +1,170 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- set image_count = namespace(value=0) %}
2
+ {%- set video_count = namespace(value=0) %}
3
+ {%- macro render_content(content, do_vision_count, is_system_content=false) %}
4
+ {%- if content is string %}
5
+ {{- content }}
6
+ {%- elif content is iterable and content is not mapping %}
7
+ {%- for item in content %}
8
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
9
+ {%- if is_system_content %}
10
+ {{- raise_exception('System message cannot contain images.') }}
11
+ {%- endif %}
12
+ {%- if do_vision_count %}
13
+ {%- set image_count.value = image_count.value + 1 %}
14
+ {%- endif %}
15
+ {%- if add_vision_id %}
16
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
17
+ {%- endif %}
18
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
19
+ {%- elif 'video' in item or item.type == 'video' %}
20
+ {%- if is_system_content %}
21
+ {{- raise_exception('System message cannot contain videos.') }}
22
+ {%- endif %}
23
+ {%- if do_vision_count %}
24
+ {%- set video_count.value = video_count.value + 1 %}
25
+ {%- endif %}
26
+ {%- if add_vision_id %}
27
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
28
+ {%- endif %}
29
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
30
+ {%- elif 'text' in item %}
31
+ {{- item.text }}
32
+ {%- else %}
33
+ {{- raise_exception('Unexpected item type in content.') }}
34
+ {%- endif %}
35
+ {%- endfor %}
36
+ {%- elif content is none or content is undefined %}
37
+ {{- '' }}
38
+ {%- else %}
39
+ {{- raise_exception('Unexpected content type.') }}
40
+ {%- endif %}
41
+ {%- endmacro %}
42
+ {%- if not messages %}
43
+ {{- raise_exception('No messages provided.') }}
44
+ {%- endif %}
45
+ {%- set reasoning_instructions = '' %}
46
+ {%- if enable_thinking is undefined or enable_thinking is true %}
47
+ {%- set resolved_reasoning_effort = reasoning_effort|default('xhigh') %}
48
+ {%- if resolved_reasoning_effort not in ('xhigh', 'medium', 'low') %}
49
+ {{- raise_exception('Unexpected reasoning effort ' ~ reasoning_effort ~ '. Supported types are xhigh (default), medium, and low.') }}
50
+ {%- endif %}
51
+ {%- if resolved_reasoning_effort == 'xhigh' %}
52
+ {%- set reasoning_instructions = 'Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.' %}
53
+ {%- elif resolved_reasoning_effort == 'low' %}
54
+ {%- set reasoning_instructions = 'Reasoning effort is set to low. Keep your thinking brief and focused, moving directly to the conclusion without unnecessary elaboration.' %}
55
+ {%- endif %}
56
+ {%- endif %}
57
+ {%- if tools and tools is iterable and tools is not mapping %}
58
+ {{- '<|im_start|>system\n' }}
59
+ {%- if reasoning_instructions %}
60
+ {{- reasoning_instructions + '\n\n' }}
61
+ {%- endif %}
62
+ {{- "# Tools\n\nYou have access to the following functions:\n\n<tools>" }}
63
+ {%- for tool in tools %}
64
+ {{- "\n" }}
65
+ {{- tool | tojson }}
66
+ {%- endfor %}
67
+ {{- "\n</tools>" }}
68
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n<tool_call>\n<function=example_function_name>\n<parameter=example_parameter_1>\nvalue_1\n</parameter>\n<parameter=example_parameter_2>\nThis is the value for the second parameter\nthat can span\nmultiple lines\n</parameter>\n</function>\n</tool_call>\n\n<IMPORTANT>\nReminder:\n- Function calls MUST follow the specified format: an inner <function=...></function> block must be nested within <tool_call></tool_call> XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n</IMPORTANT>' }}
69
+ {%- if messages[0].role == 'system' %}
70
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
71
+ {%- if content %}
72
+ {{- '\n\n' + content }}
73
+ {%- endif %}
74
+ {%- endif %}
75
+ {{- '<|im_end|>\n' }}
76
+ {%- else %}
77
+ {%- if messages[0].role == 'system' %}
78
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
79
+ {%- if content %}
80
+ {{- '<|im_start|>system\n' + (reasoning_instructions + '\n\n' if reasoning_instructions else '') + content + '<|im_end|>\n' }}
81
+ {%- elif reasoning_instructions %}
82
+ {{- '<|im_start|>system\n' + reasoning_instructions + '<|im_end|>\n' }}
83
+ {%- endif %}
84
+ {%- elif reasoning_instructions %}
85
+ {{- '<|im_start|>system\n' + reasoning_instructions + '<|im_end|>\n' }}
86
+ {%- endif %}
87
+ {%- endif %}
88
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
89
+ {%- for message in messages[::-1] %}
90
+ {%- set index = (messages|length - 1) - loop.index0 %}
91
+ {%- if ns.multi_step_tool and message.role == "user" %}
92
+ {%- set content = render_content(message.content, false)|trim %}
93
+ {%- if not(content.startswith('<tool_response>') and content.endswith('</tool_response>')) %}
94
+ {%- set ns.multi_step_tool = false %}
95
+ {%- set ns.last_query_index = index %}
96
+ {%- endif %}
97
+ {%- endif %}
98
+ {%- endfor %}
99
+ {%- if ns.multi_step_tool %}
100
+ {{- raise_exception('No user query found in messages.') }}
101
+ {%- endif %}
102
+ {%- for message in messages %}
103
+ {%- set content = render_content(message.content, true)|trim %}
104
+ {%- if message.role == "system" %}
105
+ {%- if not loop.first %}
106
+ {{- raise_exception('System message must be at the beginning.') }}
107
+ {%- endif %}
108
+ {%- elif message.role == "user" %}
109
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
110
+ {%- elif message.role == "assistant" %}
111
+ {%- set reasoning_content = '' %}
112
+ {%- if message.reasoning_content is string %}
113
+ {%- set reasoning_content = message.reasoning_content %}
114
+ {%- endif %}
115
+ {%- set reasoning_content = reasoning_content|trim %}
116
+ {%- if preserve_thinking is undefined or preserve_thinking is true or loop.index0 > ns.last_query_index %}
117
+ {{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content + '\n</think>\n\n' + content }}
118
+ {%- else %}
119
+ {{- '<|im_start|>' + message.role + '\n' + content }}
120
+ {%- endif %}
121
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
122
+ {%- for tool_call in message.tool_calls %}
123
+ {%- if tool_call.function is defined %}
124
+ {%- set tool_call = tool_call.function %}
125
+ {%- endif %}
126
+ {%- if loop.first %}
127
+ {%- if content|trim %}
128
+ {{- '\n\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
129
+ {%- else %}
130
+ {{- '<tool_call>\n<function=' + tool_call.name + '>\n' }}
131
+ {%- endif %}
132
+ {%- else %}
133
+ {{- '\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
134
+ {%- endif %}
135
+ {%- if tool_call.arguments is defined and tool_call.arguments != '' %}
136
+ {%- for args_name, args_value in tool_call.arguments|items %}
137
+ {{- '<parameter=' + args_name + '>\n' }}
138
+ {%- set args_value = args_value | string if args_value is string else args_value | tojson | safe %}
139
+ {{- args_value }}
140
+ {{- '\n</parameter>\n' }}
141
+ {%- endfor %}
142
+ {%- endif %}
143
+ {{- '</function>\n</tool_call>' }}
144
+ {%- endfor %}
145
+ {%- endif %}
146
+ {{- '<|im_end|>\n' }}
147
+ {%- elif message.role == "tool" %}
148
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
149
+ {{- '<|im_start|>user' }}
150
+ {%- endif %}
151
+ {{- '\n<tool_response>\n' }}
152
+ {{- content }}
153
+ {{- '\n</tool_response>' }}
154
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
155
+ {{- '<|im_end|>\n' }}
156
+ {%- elif loop.last %}
157
+ {{- '<|im_end|>\n' }}
158
+ {%- endif %}
159
+ {%- else %}
160
+ {{- raise_exception('Unexpected message role.') }}
161
+ {%- endif %}
162
+ {%- endfor %}
163
+ {%- if add_generation_prompt %}
164
+ {{- '<|im_start|>assistant\n' }}
165
+ {%- if enable_thinking is defined and enable_thinking is false %}
166
+ {{- '<think>\n\n</think>\n\n' }}
167
+ {%- else %}
168
+ {{- '<think>\n' }}
169
+ {%- endif %}
170
+ {%- endif %}
config.json ADDED
@@ -0,0 +1,1470 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen4ExpForConditionalGeneration"
4
+ ],
5
+ "image_token_id": 248056,
6
+ "language_model_only": false,
7
+ "model_type": "qwen4_exp",
8
+ "quantization_config": {
9
+ "activation_scale_search": false,
10
+ "actorder": false,
11
+ "batch_size": 1,
12
+ "calibration_applied": true,
13
+ "cold_expert_hessian_shrinkage": false,
14
+ "damp": 0.01,
15
+ "expert_block_reorder": false,
16
+ "gptq_applied": false,
17
+ "gptq_block_size": 128,
18
+ "gptq_reconstruction_rounds": 0,
19
+ "gptq_reconstruction_scope": null,
20
+ "group_size": 16,
21
+ "hessian_aware_codec_search": false,
22
+ "ignore": [
23
+ "lm_head",
24
+ "model.language_model.embed_tokens",
25
+ "model.language_model.hyper_connection_mixer.hc_norm",
26
+ "model.language_model.hyper_connection_mixer.input_mix_weight_down",
27
+ "model.language_model.hyper_connection_mixer.input_mix_weight_up",
28
+ "model.language_model.layers.0.attn_hyper_connection.block_inject_weight",
29
+ "model.language_model.layers.0.attn_hyper_connection.hc_norm",
30
+ "model.language_model.layers.0.attn_hyper_connection.input_mix_weight_down",
31
+ "model.language_model.layers.0.attn_hyper_connection.input_mix_weight_up",
32
+ "model.language_model.layers.0.linear_attn.A_log",
33
+ "model.language_model.layers.0.linear_attn.conv1d",
34
+ "model.language_model.layers.0.linear_attn.dt_bias",
35
+ "model.language_model.layers.0.linear_attn.in_proj_a",
36
+ "model.language_model.layers.0.linear_attn.in_proj_b",
37
+ "model.language_model.layers.0.linear_attn.in_proj_qkv",
38
+ "model.language_model.layers.0.linear_attn.in_proj_z",
39
+ "model.language_model.layers.0.linear_attn.norm",
40
+ "model.language_model.layers.0.linear_attn.out_proj",
41
+ "model.language_model.layers.0.mlp.gate",
42
+ "model.language_model.layers.0.mlp.shared_expert.down_proj",
43
+ "model.language_model.layers.0.mlp.shared_expert.gate_proj",
44
+ "model.language_model.layers.0.mlp.shared_expert.up_proj",
45
+ "model.language_model.layers.0.mlp.shared_expert_gate",
46
+ "model.language_model.layers.0.mlp_hyper_connection.block_inject_weight",
47
+ "model.language_model.layers.0.mlp_hyper_connection.hc_norm",
48
+ "model.language_model.layers.0.mlp_hyper_connection.input_mix_weight_down",
49
+ "model.language_model.layers.0.mlp_hyper_connection.input_mix_weight_up",
50
+ "model.language_model.layers.1.attn_hyper_connection.block_inject_weight",
51
+ "model.language_model.layers.1.attn_hyper_connection.hc_norm",
52
+ "model.language_model.layers.1.attn_hyper_connection.input_mix_weight_down",
53
+ "model.language_model.layers.1.attn_hyper_connection.input_mix_weight_up",
54
+ "model.language_model.layers.1.linear_attn.A_log",
55
+ "model.language_model.layers.1.linear_attn.conv1d",
56
+ "model.language_model.layers.1.linear_attn.dt_bias",
57
+ "model.language_model.layers.1.linear_attn.in_proj_a",
58
+ "model.language_model.layers.1.linear_attn.in_proj_b",
59
+ "model.language_model.layers.1.linear_attn.in_proj_qkv",
60
+ "model.language_model.layers.1.linear_attn.in_proj_z",
61
+ "model.language_model.layers.1.linear_attn.norm",
62
+ "model.language_model.layers.1.linear_attn.out_proj",
63
+ "model.language_model.layers.1.mlp.gate",
64
+ "model.language_model.layers.1.mlp.shared_expert.down_proj",
65
+ "model.language_model.layers.1.mlp.shared_expert.gate_proj",
66
+ "model.language_model.layers.1.mlp.shared_expert.up_proj",
67
+ "model.language_model.layers.1.mlp.shared_expert_gate",
68
+ "model.language_model.layers.1.mlp_hyper_connection.block_inject_weight",
69
+ "model.language_model.layers.1.mlp_hyper_connection.hc_norm",
70
+ "model.language_model.layers.1.mlp_hyper_connection.input_mix_weight_down",
71
+ "model.language_model.layers.1.mlp_hyper_connection.input_mix_weight_up",
72
+ "model.language_model.layers.1.ple.conv1d",
73
+ "model.language_model.layers.1.ple.key_proj",
74
+ "model.language_model.layers.1.ple.norm_conv",
75
+ "model.language_model.layers.1.ple.norm_key",
76
+ "model.language_model.layers.1.ple.norm_query",
77
+ "model.language_model.layers.1.ple.ple_embedding.layer_multipliers",
78
+ "model.language_model.layers.1.ple.ple_embedding.ngram_embedding",
79
+ "model.language_model.layers.1.ple.ple_embedding.ngram_heads_offsets",
80
+ "model.language_model.layers.1.ple.ple_embedding.ngram_heads_vocab_sizes",
81
+ "model.language_model.layers.1.ple.value_proj",
82
+ "model.language_model.layers.10.attn_hyper_connection.block_inject_weight",
83
+ "model.language_model.layers.10.attn_hyper_connection.hc_norm",
84
+ "model.language_model.layers.10.attn_hyper_connection.input_mix_weight_down",
85
+ "model.language_model.layers.10.attn_hyper_connection.input_mix_weight_up",
86
+ "model.language_model.layers.10.linear_attn.A_log",
87
+ "model.language_model.layers.10.linear_attn.conv1d",
88
+ "model.language_model.layers.10.linear_attn.dt_bias",
89
+ "model.language_model.layers.10.linear_attn.in_proj_a",
90
+ "model.language_model.layers.10.linear_attn.in_proj_b",
91
+ "model.language_model.layers.10.linear_attn.in_proj_qkv",
92
+ "model.language_model.layers.10.linear_attn.in_proj_z",
93
+ "model.language_model.layers.10.linear_attn.norm",
94
+ "model.language_model.layers.10.linear_attn.out_proj",
95
+ "model.language_model.layers.10.mlp.gate",
96
+ "model.language_model.layers.10.mlp.shared_expert.down_proj",
97
+ "model.language_model.layers.10.mlp.shared_expert.gate_proj",
98
+ "model.language_model.layers.10.mlp.shared_expert.up_proj",
99
+ "model.language_model.layers.10.mlp.shared_expert_gate",
100
+ "model.language_model.layers.10.mlp_hyper_connection.block_inject_weight",
101
+ "model.language_model.layers.10.mlp_hyper_connection.hc_norm",
102
+ "model.language_model.layers.10.mlp_hyper_connection.input_mix_weight_down",
103
+ "model.language_model.layers.10.mlp_hyper_connection.input_mix_weight_up",
104
+ "model.language_model.layers.11.attn_hyper_connection.block_inject_weight",
105
+ "model.language_model.layers.11.attn_hyper_connection.hc_norm",
106
+ "model.language_model.layers.11.attn_hyper_connection.input_mix_weight_down",
107
+ "model.language_model.layers.11.attn_hyper_connection.input_mix_weight_up",
108
+ "model.language_model.layers.11.mlp.gate",
109
+ "model.language_model.layers.11.mlp.shared_expert.down_proj",
110
+ "model.language_model.layers.11.mlp.shared_expert.gate_proj",
111
+ "model.language_model.layers.11.mlp.shared_expert.up_proj",
112
+ "model.language_model.layers.11.mlp.shared_expert_gate",
113
+ "model.language_model.layers.11.mlp_hyper_connection.block_inject_weight",
114
+ "model.language_model.layers.11.mlp_hyper_connection.hc_norm",
115
+ "model.language_model.layers.11.mlp_hyper_connection.input_mix_weight_down",
116
+ "model.language_model.layers.11.mlp_hyper_connection.input_mix_weight_up",
117
+ "model.language_model.layers.11.self_attn.indexer.index_qk_proj",
118
+ "model.language_model.layers.11.self_attn.indexer.k_layernorm",
119
+ "model.language_model.layers.11.self_attn.indexer.q_layernorm",
120
+ "model.language_model.layers.11.self_attn.k_norm",
121
+ "model.language_model.layers.11.self_attn.k_proj",
122
+ "model.language_model.layers.11.self_attn.o_proj",
123
+ "model.language_model.layers.11.self_attn.q_norm",
124
+ "model.language_model.layers.11.self_attn.q_proj",
125
+ "model.language_model.layers.11.self_attn.v_proj",
126
+ "model.language_model.layers.12.attn_hyper_connection.block_inject_weight",
127
+ "model.language_model.layers.12.attn_hyper_connection.hc_norm",
128
+ "model.language_model.layers.12.attn_hyper_connection.input_mix_weight_down",
129
+ "model.language_model.layers.12.attn_hyper_connection.input_mix_weight_up",
130
+ "model.language_model.layers.12.linear_attn.A_log",
131
+ "model.language_model.layers.12.linear_attn.conv1d",
132
+ "model.language_model.layers.12.linear_attn.dt_bias",
133
+ "model.language_model.layers.12.linear_attn.in_proj_a",
134
+ "model.language_model.layers.12.linear_attn.in_proj_b",
135
+ "model.language_model.layers.12.linear_attn.in_proj_qkv",
136
+ "model.language_model.layers.12.linear_attn.in_proj_z",
137
+ "model.language_model.layers.12.linear_attn.norm",
138
+ "model.language_model.layers.12.linear_attn.out_proj",
139
+ "model.language_model.layers.12.mlp.gate",
140
+ "model.language_model.layers.12.mlp.shared_expert.down_proj",
141
+ "model.language_model.layers.12.mlp.shared_expert.gate_proj",
142
+ "model.language_model.layers.12.mlp.shared_expert.up_proj",
143
+ "model.language_model.layers.12.mlp.shared_expert_gate",
144
+ "model.language_model.layers.12.mlp_hyper_connection.block_inject_weight",
145
+ "model.language_model.layers.12.mlp_hyper_connection.hc_norm",
146
+ "model.language_model.layers.12.mlp_hyper_connection.input_mix_weight_down",
147
+ "model.language_model.layers.12.mlp_hyper_connection.input_mix_weight_up",
148
+ "model.language_model.layers.13.attn_hyper_connection.block_inject_weight",
149
+ "model.language_model.layers.13.attn_hyper_connection.hc_norm",
150
+ "model.language_model.layers.13.attn_hyper_connection.input_mix_weight_down",
151
+ "model.language_model.layers.13.attn_hyper_connection.input_mix_weight_up",
152
+ "model.language_model.layers.13.linear_attn.A_log",
153
+ "model.language_model.layers.13.linear_attn.conv1d",
154
+ "model.language_model.layers.13.linear_attn.dt_bias",
155
+ "model.language_model.layers.13.linear_attn.in_proj_a",
156
+ "model.language_model.layers.13.linear_attn.in_proj_b",
157
+ "model.language_model.layers.13.linear_attn.in_proj_qkv",
158
+ "model.language_model.layers.13.linear_attn.in_proj_z",
159
+ "model.language_model.layers.13.linear_attn.norm",
160
+ "model.language_model.layers.13.linear_attn.out_proj",
161
+ "model.language_model.layers.13.mlp.gate",
162
+ "model.language_model.layers.13.mlp.shared_expert.down_proj",
163
+ "model.language_model.layers.13.mlp.shared_expert.gate_proj",
164
+ "model.language_model.layers.13.mlp.shared_expert.up_proj",
165
+ "model.language_model.layers.13.mlp.shared_expert_gate",
166
+ "model.language_model.layers.13.mlp_hyper_connection.block_inject_weight",
167
+ "model.language_model.layers.13.mlp_hyper_connection.hc_norm",
168
+ "model.language_model.layers.13.mlp_hyper_connection.input_mix_weight_down",
169
+ "model.language_model.layers.13.mlp_hyper_connection.input_mix_weight_up",
170
+ "model.language_model.layers.14.attn_hyper_connection.block_inject_weight",
171
+ "model.language_model.layers.14.attn_hyper_connection.hc_norm",
172
+ "model.language_model.layers.14.attn_hyper_connection.input_mix_weight_down",
173
+ "model.language_model.layers.14.attn_hyper_connection.input_mix_weight_up",
174
+ "model.language_model.layers.14.linear_attn.A_log",
175
+ "model.language_model.layers.14.linear_attn.conv1d",
176
+ "model.language_model.layers.14.linear_attn.dt_bias",
177
+ "model.language_model.layers.14.linear_attn.in_proj_a",
178
+ "model.language_model.layers.14.linear_attn.in_proj_b",
179
+ "model.language_model.layers.14.linear_attn.in_proj_qkv",
180
+ "model.language_model.layers.14.linear_attn.in_proj_z",
181
+ "model.language_model.layers.14.linear_attn.norm",
182
+ "model.language_model.layers.14.linear_attn.out_proj",
183
+ "model.language_model.layers.14.mlp.gate",
184
+ "model.language_model.layers.14.mlp.shared_expert.down_proj",
185
+ "model.language_model.layers.14.mlp.shared_expert.gate_proj",
186
+ "model.language_model.layers.14.mlp.shared_expert.up_proj",
187
+ "model.language_model.layers.14.mlp.shared_expert_gate",
188
+ "model.language_model.layers.14.mlp_hyper_connection.block_inject_weight",
189
+ "model.language_model.layers.14.mlp_hyper_connection.hc_norm",
190
+ "model.language_model.layers.14.mlp_hyper_connection.input_mix_weight_down",
191
+ "model.language_model.layers.14.mlp_hyper_connection.input_mix_weight_up",
192
+ "model.language_model.layers.15.attn_hyper_connection.block_inject_weight",
193
+ "model.language_model.layers.15.attn_hyper_connection.hc_norm",
194
+ "model.language_model.layers.15.attn_hyper_connection.input_mix_weight_down",
195
+ "model.language_model.layers.15.attn_hyper_connection.input_mix_weight_up",
196
+ "model.language_model.layers.15.mlp.gate",
197
+ "model.language_model.layers.15.mlp.shared_expert.down_proj",
198
+ "model.language_model.layers.15.mlp.shared_expert.gate_proj",
199
+ "model.language_model.layers.15.mlp.shared_expert.up_proj",
200
+ "model.language_model.layers.15.mlp.shared_expert_gate",
201
+ "model.language_model.layers.15.mlp_hyper_connection.block_inject_weight",
202
+ "model.language_model.layers.15.mlp_hyper_connection.hc_norm",
203
+ "model.language_model.layers.15.mlp_hyper_connection.input_mix_weight_down",
204
+ "model.language_model.layers.15.mlp_hyper_connection.input_mix_weight_up",
205
+ "model.language_model.layers.15.self_attn.indexer.index_qk_proj",
206
+ "model.language_model.layers.15.self_attn.indexer.k_layernorm",
207
+ "model.language_model.layers.15.self_attn.indexer.q_layernorm",
208
+ "model.language_model.layers.15.self_attn.k_norm",
209
+ "model.language_model.layers.15.self_attn.k_proj",
210
+ "model.language_model.layers.15.self_attn.o_proj",
211
+ "model.language_model.layers.15.self_attn.q_norm",
212
+ "model.language_model.layers.15.self_attn.q_proj",
213
+ "model.language_model.layers.15.self_attn.v_proj",
214
+ "model.language_model.layers.16.attn_hyper_connection.block_inject_weight",
215
+ "model.language_model.layers.16.attn_hyper_connection.hc_norm",
216
+ "model.language_model.layers.16.attn_hyper_connection.input_mix_weight_down",
217
+ "model.language_model.layers.16.attn_hyper_connection.input_mix_weight_up",
218
+ "model.language_model.layers.16.linear_attn.A_log",
219
+ "model.language_model.layers.16.linear_attn.conv1d",
220
+ "model.language_model.layers.16.linear_attn.dt_bias",
221
+ "model.language_model.layers.16.linear_attn.in_proj_a",
222
+ "model.language_model.layers.16.linear_attn.in_proj_b",
223
+ "model.language_model.layers.16.linear_attn.in_proj_qkv",
224
+ "model.language_model.layers.16.linear_attn.in_proj_z",
225
+ "model.language_model.layers.16.linear_attn.norm",
226
+ "model.language_model.layers.16.linear_attn.out_proj",
227
+ "model.language_model.layers.16.mlp.gate",
228
+ "model.language_model.layers.16.mlp.shared_expert.down_proj",
229
+ "model.language_model.layers.16.mlp.shared_expert.gate_proj",
230
+ "model.language_model.layers.16.mlp.shared_expert.up_proj",
231
+ "model.language_model.layers.16.mlp.shared_expert_gate",
232
+ "model.language_model.layers.16.mlp_hyper_connection.block_inject_weight",
233
+ "model.language_model.layers.16.mlp_hyper_connection.hc_norm",
234
+ "model.language_model.layers.16.mlp_hyper_connection.input_mix_weight_down",
235
+ "model.language_model.layers.16.mlp_hyper_connection.input_mix_weight_up",
236
+ "model.language_model.layers.17.attn_hyper_connection.block_inject_weight",
237
+ "model.language_model.layers.17.attn_hyper_connection.hc_norm",
238
+ "model.language_model.layers.17.attn_hyper_connection.input_mix_weight_down",
239
+ "model.language_model.layers.17.attn_hyper_connection.input_mix_weight_up",
240
+ "model.language_model.layers.17.linear_attn.A_log",
241
+ "model.language_model.layers.17.linear_attn.conv1d",
242
+ "model.language_model.layers.17.linear_attn.dt_bias",
243
+ "model.language_model.layers.17.linear_attn.in_proj_a",
244
+ "model.language_model.layers.17.linear_attn.in_proj_b",
245
+ "model.language_model.layers.17.linear_attn.in_proj_qkv",
246
+ "model.language_model.layers.17.linear_attn.in_proj_z",
247
+ "model.language_model.layers.17.linear_attn.norm",
248
+ "model.language_model.layers.17.linear_attn.out_proj",
249
+ "model.language_model.layers.17.mlp.gate",
250
+ "model.language_model.layers.17.mlp.shared_expert.down_proj",
251
+ "model.language_model.layers.17.mlp.shared_expert.gate_proj",
252
+ "model.language_model.layers.17.mlp.shared_expert.up_proj",
253
+ "model.language_model.layers.17.mlp.shared_expert_gate",
254
+ "model.language_model.layers.17.mlp_hyper_connection.block_inject_weight",
255
+ "model.language_model.layers.17.mlp_hyper_connection.hc_norm",
256
+ "model.language_model.layers.17.mlp_hyper_connection.input_mix_weight_down",
257
+ "model.language_model.layers.17.mlp_hyper_connection.input_mix_weight_up",
258
+ "model.language_model.layers.18.attn_hyper_connection.block_inject_weight",
259
+ "model.language_model.layers.18.attn_hyper_connection.hc_norm",
260
+ "model.language_model.layers.18.attn_hyper_connection.input_mix_weight_down",
261
+ "model.language_model.layers.18.attn_hyper_connection.input_mix_weight_up",
262
+ "model.language_model.layers.18.linear_attn.A_log",
263
+ "model.language_model.layers.18.linear_attn.conv1d",
264
+ "model.language_model.layers.18.linear_attn.dt_bias",
265
+ "model.language_model.layers.18.linear_attn.in_proj_a",
266
+ "model.language_model.layers.18.linear_attn.in_proj_b",
267
+ "model.language_model.layers.18.linear_attn.in_proj_qkv",
268
+ "model.language_model.layers.18.linear_attn.in_proj_z",
269
+ "model.language_model.layers.18.linear_attn.norm",
270
+ "model.language_model.layers.18.linear_attn.out_proj",
271
+ "model.language_model.layers.18.mlp.gate",
272
+ "model.language_model.layers.18.mlp.shared_expert.down_proj",
273
+ "model.language_model.layers.18.mlp.shared_expert.gate_proj",
274
+ "model.language_model.layers.18.mlp.shared_expert.up_proj",
275
+ "model.language_model.layers.18.mlp.shared_expert_gate",
276
+ "model.language_model.layers.18.mlp_hyper_connection.block_inject_weight",
277
+ "model.language_model.layers.18.mlp_hyper_connection.hc_norm",
278
+ "model.language_model.layers.18.mlp_hyper_connection.input_mix_weight_down",
279
+ "model.language_model.layers.18.mlp_hyper_connection.input_mix_weight_up",
280
+ "model.language_model.layers.19.attn_hyper_connection.block_inject_weight",
281
+ "model.language_model.layers.19.attn_hyper_connection.hc_norm",
282
+ "model.language_model.layers.19.attn_hyper_connection.input_mix_weight_down",
283
+ "model.language_model.layers.19.attn_hyper_connection.input_mix_weight_up",
284
+ "model.language_model.layers.19.mlp.gate",
285
+ "model.language_model.layers.19.mlp.shared_expert.down_proj",
286
+ "model.language_model.layers.19.mlp.shared_expert.gate_proj",
287
+ "model.language_model.layers.19.mlp.shared_expert.up_proj",
288
+ "model.language_model.layers.19.mlp.shared_expert_gate",
289
+ "model.language_model.layers.19.mlp_hyper_connection.block_inject_weight",
290
+ "model.language_model.layers.19.mlp_hyper_connection.hc_norm",
291
+ "model.language_model.layers.19.mlp_hyper_connection.input_mix_weight_down",
292
+ "model.language_model.layers.19.mlp_hyper_connection.input_mix_weight_up",
293
+ "model.language_model.layers.19.self_attn.indexer.index_qk_proj",
294
+ "model.language_model.layers.19.self_attn.indexer.k_layernorm",
295
+ "model.language_model.layers.19.self_attn.indexer.q_layernorm",
296
+ "model.language_model.layers.19.self_attn.k_norm",
297
+ "model.language_model.layers.19.self_attn.k_proj",
298
+ "model.language_model.layers.19.self_attn.o_proj",
299
+ "model.language_model.layers.19.self_attn.q_norm",
300
+ "model.language_model.layers.19.self_attn.q_proj",
301
+ "model.language_model.layers.19.self_attn.v_proj",
302
+ "model.language_model.layers.2.attn_hyper_connection.block_inject_weight",
303
+ "model.language_model.layers.2.attn_hyper_connection.hc_norm",
304
+ "model.language_model.layers.2.attn_hyper_connection.input_mix_weight_down",
305
+ "model.language_model.layers.2.attn_hyper_connection.input_mix_weight_up",
306
+ "model.language_model.layers.2.linear_attn.A_log",
307
+ "model.language_model.layers.2.linear_attn.conv1d",
308
+ "model.language_model.layers.2.linear_attn.dt_bias",
309
+ "model.language_model.layers.2.linear_attn.in_proj_a",
310
+ "model.language_model.layers.2.linear_attn.in_proj_b",
311
+ "model.language_model.layers.2.linear_attn.in_proj_qkv",
312
+ "model.language_model.layers.2.linear_attn.in_proj_z",
313
+ "model.language_model.layers.2.linear_attn.norm",
314
+ "model.language_model.layers.2.linear_attn.out_proj",
315
+ "model.language_model.layers.2.mlp.gate",
316
+ "model.language_model.layers.2.mlp.shared_expert.down_proj",
317
+ "model.language_model.layers.2.mlp.shared_expert.gate_proj",
318
+ "model.language_model.layers.2.mlp.shared_expert.up_proj",
319
+ "model.language_model.layers.2.mlp.shared_expert_gate",
320
+ "model.language_model.layers.2.mlp_hyper_connection.block_inject_weight",
321
+ "model.language_model.layers.2.mlp_hyper_connection.hc_norm",
322
+ "model.language_model.layers.2.mlp_hyper_connection.input_mix_weight_down",
323
+ "model.language_model.layers.2.mlp_hyper_connection.input_mix_weight_up",
324
+ "model.language_model.layers.20.attn_hyper_connection.block_inject_weight",
325
+ "model.language_model.layers.20.attn_hyper_connection.hc_norm",
326
+ "model.language_model.layers.20.attn_hyper_connection.input_mix_weight_down",
327
+ "model.language_model.layers.20.attn_hyper_connection.input_mix_weight_up",
328
+ "model.language_model.layers.20.linear_attn.A_log",
329
+ "model.language_model.layers.20.linear_attn.conv1d",
330
+ "model.language_model.layers.20.linear_attn.dt_bias",
331
+ "model.language_model.layers.20.linear_attn.in_proj_a",
332
+ "model.language_model.layers.20.linear_attn.in_proj_b",
333
+ "model.language_model.layers.20.linear_attn.in_proj_qkv",
334
+ "model.language_model.layers.20.linear_attn.in_proj_z",
335
+ "model.language_model.layers.20.linear_attn.norm",
336
+ "model.language_model.layers.20.linear_attn.out_proj",
337
+ "model.language_model.layers.20.mlp.gate",
338
+ "model.language_model.layers.20.mlp.shared_expert.down_proj",
339
+ "model.language_model.layers.20.mlp.shared_expert.gate_proj",
340
+ "model.language_model.layers.20.mlp.shared_expert.up_proj",
341
+ "model.language_model.layers.20.mlp.shared_expert_gate",
342
+ "model.language_model.layers.20.mlp_hyper_connection.block_inject_weight",
343
+ "model.language_model.layers.20.mlp_hyper_connection.hc_norm",
344
+ "model.language_model.layers.20.mlp_hyper_connection.input_mix_weight_down",
345
+ "model.language_model.layers.20.mlp_hyper_connection.input_mix_weight_up",
346
+ "model.language_model.layers.21.attn_hyper_connection.block_inject_weight",
347
+ "model.language_model.layers.21.attn_hyper_connection.hc_norm",
348
+ "model.language_model.layers.21.attn_hyper_connection.input_mix_weight_down",
349
+ "model.language_model.layers.21.attn_hyper_connection.input_mix_weight_up",
350
+ "model.language_model.layers.21.linear_attn.A_log",
351
+ "model.language_model.layers.21.linear_attn.conv1d",
352
+ "model.language_model.layers.21.linear_attn.dt_bias",
353
+ "model.language_model.layers.21.linear_attn.in_proj_a",
354
+ "model.language_model.layers.21.linear_attn.in_proj_b",
355
+ "model.language_model.layers.21.linear_attn.in_proj_qkv",
356
+ "model.language_model.layers.21.linear_attn.in_proj_z",
357
+ "model.language_model.layers.21.linear_attn.norm",
358
+ "model.language_model.layers.21.linear_attn.out_proj",
359
+ "model.language_model.layers.21.mlp.gate",
360
+ "model.language_model.layers.21.mlp.shared_expert.down_proj",
361
+ "model.language_model.layers.21.mlp.shared_expert.gate_proj",
362
+ "model.language_model.layers.21.mlp.shared_expert.up_proj",
363
+ "model.language_model.layers.21.mlp.shared_expert_gate",
364
+ "model.language_model.layers.21.mlp_hyper_connection.block_inject_weight",
365
+ "model.language_model.layers.21.mlp_hyper_connection.hc_norm",
366
+ "model.language_model.layers.21.mlp_hyper_connection.input_mix_weight_down",
367
+ "model.language_model.layers.21.mlp_hyper_connection.input_mix_weight_up",
368
+ "model.language_model.layers.22.attn_hyper_connection.block_inject_weight",
369
+ "model.language_model.layers.22.attn_hyper_connection.hc_norm",
370
+ "model.language_model.layers.22.attn_hyper_connection.input_mix_weight_down",
371
+ "model.language_model.layers.22.attn_hyper_connection.input_mix_weight_up",
372
+ "model.language_model.layers.22.linear_attn.A_log",
373
+ "model.language_model.layers.22.linear_attn.conv1d",
374
+ "model.language_model.layers.22.linear_attn.dt_bias",
375
+ "model.language_model.layers.22.linear_attn.in_proj_a",
376
+ "model.language_model.layers.22.linear_attn.in_proj_b",
377
+ "model.language_model.layers.22.linear_attn.in_proj_qkv",
378
+ "model.language_model.layers.22.linear_attn.in_proj_z",
379
+ "model.language_model.layers.22.linear_attn.norm",
380
+ "model.language_model.layers.22.linear_attn.out_proj",
381
+ "model.language_model.layers.22.mlp.gate",
382
+ "model.language_model.layers.22.mlp.shared_expert.down_proj",
383
+ "model.language_model.layers.22.mlp.shared_expert.gate_proj",
384
+ "model.language_model.layers.22.mlp.shared_expert.up_proj",
385
+ "model.language_model.layers.22.mlp.shared_expert_gate",
386
+ "model.language_model.layers.22.mlp_hyper_connection.block_inject_weight",
387
+ "model.language_model.layers.22.mlp_hyper_connection.hc_norm",
388
+ "model.language_model.layers.22.mlp_hyper_connection.input_mix_weight_down",
389
+ "model.language_model.layers.22.mlp_hyper_connection.input_mix_weight_up",
390
+ "model.language_model.layers.23.attn_hyper_connection.block_inject_weight",
391
+ "model.language_model.layers.23.attn_hyper_connection.hc_norm",
392
+ "model.language_model.layers.23.attn_hyper_connection.input_mix_weight_down",
393
+ "model.language_model.layers.23.attn_hyper_connection.input_mix_weight_up",
394
+ "model.language_model.layers.23.mlp.gate",
395
+ "model.language_model.layers.23.mlp.shared_expert.down_proj",
396
+ "model.language_model.layers.23.mlp.shared_expert.gate_proj",
397
+ "model.language_model.layers.23.mlp.shared_expert.up_proj",
398
+ "model.language_model.layers.23.mlp.shared_expert_gate",
399
+ "model.language_model.layers.23.mlp_hyper_connection.block_inject_weight",
400
+ "model.language_model.layers.23.mlp_hyper_connection.hc_norm",
401
+ "model.language_model.layers.23.mlp_hyper_connection.input_mix_weight_down",
402
+ "model.language_model.layers.23.mlp_hyper_connection.input_mix_weight_up",
403
+ "model.language_model.layers.23.self_attn.indexer.index_qk_proj",
404
+ "model.language_model.layers.23.self_attn.indexer.k_layernorm",
405
+ "model.language_model.layers.23.self_attn.indexer.q_layernorm",
406
+ "model.language_model.layers.23.self_attn.k_norm",
407
+ "model.language_model.layers.23.self_attn.k_proj",
408
+ "model.language_model.layers.23.self_attn.o_proj",
409
+ "model.language_model.layers.23.self_attn.q_norm",
410
+ "model.language_model.layers.23.self_attn.q_proj",
411
+ "model.language_model.layers.23.self_attn.v_proj",
412
+ "model.language_model.layers.24.attn_hyper_connection.block_inject_weight",
413
+ "model.language_model.layers.24.attn_hyper_connection.hc_norm",
414
+ "model.language_model.layers.24.attn_hyper_connection.input_mix_weight_down",
415
+ "model.language_model.layers.24.attn_hyper_connection.input_mix_weight_up",
416
+ "model.language_model.layers.24.linear_attn.A_log",
417
+ "model.language_model.layers.24.linear_attn.conv1d",
418
+ "model.language_model.layers.24.linear_attn.dt_bias",
419
+ "model.language_model.layers.24.linear_attn.in_proj_a",
420
+ "model.language_model.layers.24.linear_attn.in_proj_b",
421
+ "model.language_model.layers.24.linear_attn.in_proj_qkv",
422
+ "model.language_model.layers.24.linear_attn.in_proj_z",
423
+ "model.language_model.layers.24.linear_attn.norm",
424
+ "model.language_model.layers.24.linear_attn.out_proj",
425
+ "model.language_model.layers.24.mlp.gate",
426
+ "model.language_model.layers.24.mlp.shared_expert.down_proj",
427
+ "model.language_model.layers.24.mlp.shared_expert.gate_proj",
428
+ "model.language_model.layers.24.mlp.shared_expert.up_proj",
429
+ "model.language_model.layers.24.mlp.shared_expert_gate",
430
+ "model.language_model.layers.24.mlp_hyper_connection.block_inject_weight",
431
+ "model.language_model.layers.24.mlp_hyper_connection.hc_norm",
432
+ "model.language_model.layers.24.mlp_hyper_connection.input_mix_weight_down",
433
+ "model.language_model.layers.24.mlp_hyper_connection.input_mix_weight_up",
434
+ "model.language_model.layers.25.attn_hyper_connection.block_inject_weight",
435
+ "model.language_model.layers.25.attn_hyper_connection.hc_norm",
436
+ "model.language_model.layers.25.attn_hyper_connection.input_mix_weight_down",
437
+ "model.language_model.layers.25.attn_hyper_connection.input_mix_weight_up",
438
+ "model.language_model.layers.25.linear_attn.A_log",
439
+ "model.language_model.layers.25.linear_attn.conv1d",
440
+ "model.language_model.layers.25.linear_attn.dt_bias",
441
+ "model.language_model.layers.25.linear_attn.in_proj_a",
442
+ "model.language_model.layers.25.linear_attn.in_proj_b",
443
+ "model.language_model.layers.25.linear_attn.in_proj_qkv",
444
+ "model.language_model.layers.25.linear_attn.in_proj_z",
445
+ "model.language_model.layers.25.linear_attn.norm",
446
+ "model.language_model.layers.25.linear_attn.out_proj",
447
+ "model.language_model.layers.25.mlp.gate",
448
+ "model.language_model.layers.25.mlp.shared_expert.down_proj",
449
+ "model.language_model.layers.25.mlp.shared_expert.gate_proj",
450
+ "model.language_model.layers.25.mlp.shared_expert.up_proj",
451
+ "model.language_model.layers.25.mlp.shared_expert_gate",
452
+ "model.language_model.layers.25.mlp_hyper_connection.block_inject_weight",
453
+ "model.language_model.layers.25.mlp_hyper_connection.hc_norm",
454
+ "model.language_model.layers.25.mlp_hyper_connection.input_mix_weight_down",
455
+ "model.language_model.layers.25.mlp_hyper_connection.input_mix_weight_up",
456
+ "model.language_model.layers.26.attn_hyper_connection.block_inject_weight",
457
+ "model.language_model.layers.26.attn_hyper_connection.hc_norm",
458
+ "model.language_model.layers.26.attn_hyper_connection.input_mix_weight_down",
459
+ "model.language_model.layers.26.attn_hyper_connection.input_mix_weight_up",
460
+ "model.language_model.layers.26.linear_attn.A_log",
461
+ "model.language_model.layers.26.linear_attn.conv1d",
462
+ "model.language_model.layers.26.linear_attn.dt_bias",
463
+ "model.language_model.layers.26.linear_attn.in_proj_a",
464
+ "model.language_model.layers.26.linear_attn.in_proj_b",
465
+ "model.language_model.layers.26.linear_attn.in_proj_qkv",
466
+ "model.language_model.layers.26.linear_attn.in_proj_z",
467
+ "model.language_model.layers.26.linear_attn.norm",
468
+ "model.language_model.layers.26.linear_attn.out_proj",
469
+ "model.language_model.layers.26.mlp.gate",
470
+ "model.language_model.layers.26.mlp.shared_expert.down_proj",
471
+ "model.language_model.layers.26.mlp.shared_expert.gate_proj",
472
+ "model.language_model.layers.26.mlp.shared_expert.up_proj",
473
+ "model.language_model.layers.26.mlp.shared_expert_gate",
474
+ "model.language_model.layers.26.mlp_hyper_connection.block_inject_weight",
475
+ "model.language_model.layers.26.mlp_hyper_connection.hc_norm",
476
+ "model.language_model.layers.26.mlp_hyper_connection.input_mix_weight_down",
477
+ "model.language_model.layers.26.mlp_hyper_connection.input_mix_weight_up",
478
+ "model.language_model.layers.27.attn_hyper_connection.block_inject_weight",
479
+ "model.language_model.layers.27.attn_hyper_connection.hc_norm",
480
+ "model.language_model.layers.27.attn_hyper_connection.input_mix_weight_down",
481
+ "model.language_model.layers.27.attn_hyper_connection.input_mix_weight_up",
482
+ "model.language_model.layers.27.mlp.gate",
483
+ "model.language_model.layers.27.mlp.shared_expert.down_proj",
484
+ "model.language_model.layers.27.mlp.shared_expert.gate_proj",
485
+ "model.language_model.layers.27.mlp.shared_expert.up_proj",
486
+ "model.language_model.layers.27.mlp.shared_expert_gate",
487
+ "model.language_model.layers.27.mlp_hyper_connection.block_inject_weight",
488
+ "model.language_model.layers.27.mlp_hyper_connection.hc_norm",
489
+ "model.language_model.layers.27.mlp_hyper_connection.input_mix_weight_down",
490
+ "model.language_model.layers.27.mlp_hyper_connection.input_mix_weight_up",
491
+ "model.language_model.layers.27.self_attn.indexer.index_qk_proj",
492
+ "model.language_model.layers.27.self_attn.indexer.k_layernorm",
493
+ "model.language_model.layers.27.self_attn.indexer.q_layernorm",
494
+ "model.language_model.layers.27.self_attn.k_norm",
495
+ "model.language_model.layers.27.self_attn.k_proj",
496
+ "model.language_model.layers.27.self_attn.o_proj",
497
+ "model.language_model.layers.27.self_attn.q_norm",
498
+ "model.language_model.layers.27.self_attn.q_proj",
499
+ "model.language_model.layers.27.self_attn.v_proj",
500
+ "model.language_model.layers.28.attn_hyper_connection.block_inject_weight",
501
+ "model.language_model.layers.28.attn_hyper_connection.hc_norm",
502
+ "model.language_model.layers.28.attn_hyper_connection.input_mix_weight_down",
503
+ "model.language_model.layers.28.attn_hyper_connection.input_mix_weight_up",
504
+ "model.language_model.layers.28.linear_attn.A_log",
505
+ "model.language_model.layers.28.linear_attn.conv1d",
506
+ "model.language_model.layers.28.linear_attn.dt_bias",
507
+ "model.language_model.layers.28.linear_attn.in_proj_a",
508
+ "model.language_model.layers.28.linear_attn.in_proj_b",
509
+ "model.language_model.layers.28.linear_attn.in_proj_qkv",
510
+ "model.language_model.layers.28.linear_attn.in_proj_z",
511
+ "model.language_model.layers.28.linear_attn.norm",
512
+ "model.language_model.layers.28.linear_attn.out_proj",
513
+ "model.language_model.layers.28.mlp.gate",
514
+ "model.language_model.layers.28.mlp.shared_expert.down_proj",
515
+ "model.language_model.layers.28.mlp.shared_expert.gate_proj",
516
+ "model.language_model.layers.28.mlp.shared_expert.up_proj",
517
+ "model.language_model.layers.28.mlp.shared_expert_gate",
518
+ "model.language_model.layers.28.mlp_hyper_connection.block_inject_weight",
519
+ "model.language_model.layers.28.mlp_hyper_connection.hc_norm",
520
+ "model.language_model.layers.28.mlp_hyper_connection.input_mix_weight_down",
521
+ "model.language_model.layers.28.mlp_hyper_connection.input_mix_weight_up",
522
+ "model.language_model.layers.29.attn_hyper_connection.block_inject_weight",
523
+ "model.language_model.layers.29.attn_hyper_connection.hc_norm",
524
+ "model.language_model.layers.29.attn_hyper_connection.input_mix_weight_down",
525
+ "model.language_model.layers.29.attn_hyper_connection.input_mix_weight_up",
526
+ "model.language_model.layers.29.linear_attn.A_log",
527
+ "model.language_model.layers.29.linear_attn.conv1d",
528
+ "model.language_model.layers.29.linear_attn.dt_bias",
529
+ "model.language_model.layers.29.linear_attn.in_proj_a",
530
+ "model.language_model.layers.29.linear_attn.in_proj_b",
531
+ "model.language_model.layers.29.linear_attn.in_proj_qkv",
532
+ "model.language_model.layers.29.linear_attn.in_proj_z",
533
+ "model.language_model.layers.29.linear_attn.norm",
534
+ "model.language_model.layers.29.linear_attn.out_proj",
535
+ "model.language_model.layers.29.mlp.gate",
536
+ "model.language_model.layers.29.mlp.shared_expert.down_proj",
537
+ "model.language_model.layers.29.mlp.shared_expert.gate_proj",
538
+ "model.language_model.layers.29.mlp.shared_expert.up_proj",
539
+ "model.language_model.layers.29.mlp.shared_expert_gate",
540
+ "model.language_model.layers.29.mlp_hyper_connection.block_inject_weight",
541
+ "model.language_model.layers.29.mlp_hyper_connection.hc_norm",
542
+ "model.language_model.layers.29.mlp_hyper_connection.input_mix_weight_down",
543
+ "model.language_model.layers.29.mlp_hyper_connection.input_mix_weight_up",
544
+ "model.language_model.layers.3.attn_hyper_connection.block_inject_weight",
545
+ "model.language_model.layers.3.attn_hyper_connection.hc_norm",
546
+ "model.language_model.layers.3.attn_hyper_connection.input_mix_weight_down",
547
+ "model.language_model.layers.3.attn_hyper_connection.input_mix_weight_up",
548
+ "model.language_model.layers.3.mlp.gate",
549
+ "model.language_model.layers.3.mlp.shared_expert.down_proj",
550
+ "model.language_model.layers.3.mlp.shared_expert.gate_proj",
551
+ "model.language_model.layers.3.mlp.shared_expert.up_proj",
552
+ "model.language_model.layers.3.mlp.shared_expert_gate",
553
+ "model.language_model.layers.3.mlp_hyper_connection.block_inject_weight",
554
+ "model.language_model.layers.3.mlp_hyper_connection.hc_norm",
555
+ "model.language_model.layers.3.mlp_hyper_connection.input_mix_weight_down",
556
+ "model.language_model.layers.3.mlp_hyper_connection.input_mix_weight_up",
557
+ "model.language_model.layers.3.self_attn.indexer.index_qk_proj",
558
+ "model.language_model.layers.3.self_attn.indexer.k_layernorm",
559
+ "model.language_model.layers.3.self_attn.indexer.q_layernorm",
560
+ "model.language_model.layers.3.self_attn.k_norm",
561
+ "model.language_model.layers.3.self_attn.k_proj",
562
+ "model.language_model.layers.3.self_attn.o_proj",
563
+ "model.language_model.layers.3.self_attn.q_norm",
564
+ "model.language_model.layers.3.self_attn.q_proj",
565
+ "model.language_model.layers.3.self_attn.v_proj",
566
+ "model.language_model.layers.30.attn_hyper_connection.block_inject_weight",
567
+ "model.language_model.layers.30.attn_hyper_connection.hc_norm",
568
+ "model.language_model.layers.30.attn_hyper_connection.input_mix_weight_down",
569
+ "model.language_model.layers.30.attn_hyper_connection.input_mix_weight_up",
570
+ "model.language_model.layers.30.linear_attn.A_log",
571
+ "model.language_model.layers.30.linear_attn.conv1d",
572
+ "model.language_model.layers.30.linear_attn.dt_bias",
573
+ "model.language_model.layers.30.linear_attn.in_proj_a",
574
+ "model.language_model.layers.30.linear_attn.in_proj_b",
575
+ "model.language_model.layers.30.linear_attn.in_proj_qkv",
576
+ "model.language_model.layers.30.linear_attn.in_proj_z",
577
+ "model.language_model.layers.30.linear_attn.norm",
578
+ "model.language_model.layers.30.linear_attn.out_proj",
579
+ "model.language_model.layers.30.mlp.gate",
580
+ "model.language_model.layers.30.mlp.shared_expert.down_proj",
581
+ "model.language_model.layers.30.mlp.shared_expert.gate_proj",
582
+ "model.language_model.layers.30.mlp.shared_expert.up_proj",
583
+ "model.language_model.layers.30.mlp.shared_expert_gate",
584
+ "model.language_model.layers.30.mlp_hyper_connection.block_inject_weight",
585
+ "model.language_model.layers.30.mlp_hyper_connection.hc_norm",
586
+ "model.language_model.layers.30.mlp_hyper_connection.input_mix_weight_down",
587
+ "model.language_model.layers.30.mlp_hyper_connection.input_mix_weight_up",
588
+ "model.language_model.layers.31.attn_hyper_connection.block_inject_weight",
589
+ "model.language_model.layers.31.attn_hyper_connection.hc_norm",
590
+ "model.language_model.layers.31.attn_hyper_connection.input_mix_weight_down",
591
+ "model.language_model.layers.31.attn_hyper_connection.input_mix_weight_up",
592
+ "model.language_model.layers.31.mlp.gate",
593
+ "model.language_model.layers.31.mlp.shared_expert.down_proj",
594
+ "model.language_model.layers.31.mlp.shared_expert.gate_proj",
595
+ "model.language_model.layers.31.mlp.shared_expert.up_proj",
596
+ "model.language_model.layers.31.mlp.shared_expert_gate",
597
+ "model.language_model.layers.31.mlp_hyper_connection.block_inject_weight",
598
+ "model.language_model.layers.31.mlp_hyper_connection.hc_norm",
599
+ "model.language_model.layers.31.mlp_hyper_connection.input_mix_weight_down",
600
+ "model.language_model.layers.31.mlp_hyper_connection.input_mix_weight_up",
601
+ "model.language_model.layers.31.self_attn.indexer.index_qk_proj",
602
+ "model.language_model.layers.31.self_attn.indexer.k_layernorm",
603
+ "model.language_model.layers.31.self_attn.indexer.q_layernorm",
604
+ "model.language_model.layers.31.self_attn.k_norm",
605
+ "model.language_model.layers.31.self_attn.k_proj",
606
+ "model.language_model.layers.31.self_attn.o_proj",
607
+ "model.language_model.layers.31.self_attn.q_norm",
608
+ "model.language_model.layers.31.self_attn.q_proj",
609
+ "model.language_model.layers.31.self_attn.v_proj",
610
+ "model.language_model.layers.32.attn_hyper_connection.block_inject_weight",
611
+ "model.language_model.layers.32.attn_hyper_connection.hc_norm",
612
+ "model.language_model.layers.32.attn_hyper_connection.input_mix_weight_down",
613
+ "model.language_model.layers.32.attn_hyper_connection.input_mix_weight_up",
614
+ "model.language_model.layers.32.linear_attn.A_log",
615
+ "model.language_model.layers.32.linear_attn.conv1d",
616
+ "model.language_model.layers.32.linear_attn.dt_bias",
617
+ "model.language_model.layers.32.linear_attn.in_proj_a",
618
+ "model.language_model.layers.32.linear_attn.in_proj_b",
619
+ "model.language_model.layers.32.linear_attn.in_proj_qkv",
620
+ "model.language_model.layers.32.linear_attn.in_proj_z",
621
+ "model.language_model.layers.32.linear_attn.norm",
622
+ "model.language_model.layers.32.linear_attn.out_proj",
623
+ "model.language_model.layers.32.mlp.gate",
624
+ "model.language_model.layers.32.mlp.shared_expert.down_proj",
625
+ "model.language_model.layers.32.mlp.shared_expert.gate_proj",
626
+ "model.language_model.layers.32.mlp.shared_expert.up_proj",
627
+ "model.language_model.layers.32.mlp.shared_expert_gate",
628
+ "model.language_model.layers.32.mlp_hyper_connection.block_inject_weight",
629
+ "model.language_model.layers.32.mlp_hyper_connection.hc_norm",
630
+ "model.language_model.layers.32.mlp_hyper_connection.input_mix_weight_down",
631
+ "model.language_model.layers.32.mlp_hyper_connection.input_mix_weight_up",
632
+ "model.language_model.layers.33.attn_hyper_connection.block_inject_weight",
633
+ "model.language_model.layers.33.attn_hyper_connection.hc_norm",
634
+ "model.language_model.layers.33.attn_hyper_connection.input_mix_weight_down",
635
+ "model.language_model.layers.33.attn_hyper_connection.input_mix_weight_up",
636
+ "model.language_model.layers.33.linear_attn.A_log",
637
+ "model.language_model.layers.33.linear_attn.conv1d",
638
+ "model.language_model.layers.33.linear_attn.dt_bias",
639
+ "model.language_model.layers.33.linear_attn.in_proj_a",
640
+ "model.language_model.layers.33.linear_attn.in_proj_b",
641
+ "model.language_model.layers.33.linear_attn.in_proj_qkv",
642
+ "model.language_model.layers.33.linear_attn.in_proj_z",
643
+ "model.language_model.layers.33.linear_attn.norm",
644
+ "model.language_model.layers.33.linear_attn.out_proj",
645
+ "model.language_model.layers.33.mlp.gate",
646
+ "model.language_model.layers.33.mlp.shared_expert.down_proj",
647
+ "model.language_model.layers.33.mlp.shared_expert.gate_proj",
648
+ "model.language_model.layers.33.mlp.shared_expert.up_proj",
649
+ "model.language_model.layers.33.mlp.shared_expert_gate",
650
+ "model.language_model.layers.33.mlp_hyper_connection.block_inject_weight",
651
+ "model.language_model.layers.33.mlp_hyper_connection.hc_norm",
652
+ "model.language_model.layers.33.mlp_hyper_connection.input_mix_weight_down",
653
+ "model.language_model.layers.33.mlp_hyper_connection.input_mix_weight_up",
654
+ "model.language_model.layers.34.attn_hyper_connection.block_inject_weight",
655
+ "model.language_model.layers.34.attn_hyper_connection.hc_norm",
656
+ "model.language_model.layers.34.attn_hyper_connection.input_mix_weight_down",
657
+ "model.language_model.layers.34.attn_hyper_connection.input_mix_weight_up",
658
+ "model.language_model.layers.34.linear_attn.A_log",
659
+ "model.language_model.layers.34.linear_attn.conv1d",
660
+ "model.language_model.layers.34.linear_attn.dt_bias",
661
+ "model.language_model.layers.34.linear_attn.in_proj_a",
662
+ "model.language_model.layers.34.linear_attn.in_proj_b",
663
+ "model.language_model.layers.34.linear_attn.in_proj_qkv",
664
+ "model.language_model.layers.34.linear_attn.in_proj_z",
665
+ "model.language_model.layers.34.linear_attn.norm",
666
+ "model.language_model.layers.34.linear_attn.out_proj",
667
+ "model.language_model.layers.34.mlp.gate",
668
+ "model.language_model.layers.34.mlp.shared_expert.down_proj",
669
+ "model.language_model.layers.34.mlp.shared_expert.gate_proj",
670
+ "model.language_model.layers.34.mlp.shared_expert.up_proj",
671
+ "model.language_model.layers.34.mlp.shared_expert_gate",
672
+ "model.language_model.layers.34.mlp_hyper_connection.block_inject_weight",
673
+ "model.language_model.layers.34.mlp_hyper_connection.hc_norm",
674
+ "model.language_model.layers.34.mlp_hyper_connection.input_mix_weight_down",
675
+ "model.language_model.layers.34.mlp_hyper_connection.input_mix_weight_up",
676
+ "model.language_model.layers.35.attn_hyper_connection.block_inject_weight",
677
+ "model.language_model.layers.35.attn_hyper_connection.hc_norm",
678
+ "model.language_model.layers.35.attn_hyper_connection.input_mix_weight_down",
679
+ "model.language_model.layers.35.attn_hyper_connection.input_mix_weight_up",
680
+ "model.language_model.layers.35.mlp.gate",
681
+ "model.language_model.layers.35.mlp.shared_expert.down_proj",
682
+ "model.language_model.layers.35.mlp.shared_expert.gate_proj",
683
+ "model.language_model.layers.35.mlp.shared_expert.up_proj",
684
+ "model.language_model.layers.35.mlp.shared_expert_gate",
685
+ "model.language_model.layers.35.mlp_hyper_connection.block_inject_weight",
686
+ "model.language_model.layers.35.mlp_hyper_connection.hc_norm",
687
+ "model.language_model.layers.35.mlp_hyper_connection.input_mix_weight_down",
688
+ "model.language_model.layers.35.mlp_hyper_connection.input_mix_weight_up",
689
+ "model.language_model.layers.35.self_attn.indexer.index_qk_proj",
690
+ "model.language_model.layers.35.self_attn.indexer.k_layernorm",
691
+ "model.language_model.layers.35.self_attn.indexer.q_layernorm",
692
+ "model.language_model.layers.35.self_attn.k_norm",
693
+ "model.language_model.layers.35.self_attn.k_proj",
694
+ "model.language_model.layers.35.self_attn.o_proj",
695
+ "model.language_model.layers.35.self_attn.q_norm",
696
+ "model.language_model.layers.35.self_attn.q_proj",
697
+ "model.language_model.layers.35.self_attn.v_proj",
698
+ "model.language_model.layers.36.attn_hyper_connection.block_inject_weight",
699
+ "model.language_model.layers.36.attn_hyper_connection.hc_norm",
700
+ "model.language_model.layers.36.attn_hyper_connection.input_mix_weight_down",
701
+ "model.language_model.layers.36.attn_hyper_connection.input_mix_weight_up",
702
+ "model.language_model.layers.36.linear_attn.A_log",
703
+ "model.language_model.layers.36.linear_attn.conv1d",
704
+ "model.language_model.layers.36.linear_attn.dt_bias",
705
+ "model.language_model.layers.36.linear_attn.in_proj_a",
706
+ "model.language_model.layers.36.linear_attn.in_proj_b",
707
+ "model.language_model.layers.36.linear_attn.in_proj_qkv",
708
+ "model.language_model.layers.36.linear_attn.in_proj_z",
709
+ "model.language_model.layers.36.linear_attn.norm",
710
+ "model.language_model.layers.36.linear_attn.out_proj",
711
+ "model.language_model.layers.36.mlp.gate",
712
+ "model.language_model.layers.36.mlp.shared_expert.down_proj",
713
+ "model.language_model.layers.36.mlp.shared_expert.gate_proj",
714
+ "model.language_model.layers.36.mlp.shared_expert.up_proj",
715
+ "model.language_model.layers.36.mlp.shared_expert_gate",
716
+ "model.language_model.layers.36.mlp_hyper_connection.block_inject_weight",
717
+ "model.language_model.layers.36.mlp_hyper_connection.hc_norm",
718
+ "model.language_model.layers.36.mlp_hyper_connection.input_mix_weight_down",
719
+ "model.language_model.layers.36.mlp_hyper_connection.input_mix_weight_up",
720
+ "model.language_model.layers.37.attn_hyper_connection.block_inject_weight",
721
+ "model.language_model.layers.37.attn_hyper_connection.hc_norm",
722
+ "model.language_model.layers.37.attn_hyper_connection.input_mix_weight_down",
723
+ "model.language_model.layers.37.attn_hyper_connection.input_mix_weight_up",
724
+ "model.language_model.layers.37.linear_attn.A_log",
725
+ "model.language_model.layers.37.linear_attn.conv1d",
726
+ "model.language_model.layers.37.linear_attn.dt_bias",
727
+ "model.language_model.layers.37.linear_attn.in_proj_a",
728
+ "model.language_model.layers.37.linear_attn.in_proj_b",
729
+ "model.language_model.layers.37.linear_attn.in_proj_qkv",
730
+ "model.language_model.layers.37.linear_attn.in_proj_z",
731
+ "model.language_model.layers.37.linear_attn.norm",
732
+ "model.language_model.layers.37.linear_attn.out_proj",
733
+ "model.language_model.layers.37.mlp.gate",
734
+ "model.language_model.layers.37.mlp.shared_expert.down_proj",
735
+ "model.language_model.layers.37.mlp.shared_expert.gate_proj",
736
+ "model.language_model.layers.37.mlp.shared_expert.up_proj",
737
+ "model.language_model.layers.37.mlp.shared_expert_gate",
738
+ "model.language_model.layers.37.mlp_hyper_connection.block_inject_weight",
739
+ "model.language_model.layers.37.mlp_hyper_connection.hc_norm",
740
+ "model.language_model.layers.37.mlp_hyper_connection.input_mix_weight_down",
741
+ "model.language_model.layers.37.mlp_hyper_connection.input_mix_weight_up",
742
+ "model.language_model.layers.38.attn_hyper_connection.block_inject_weight",
743
+ "model.language_model.layers.38.attn_hyper_connection.hc_norm",
744
+ "model.language_model.layers.38.attn_hyper_connection.input_mix_weight_down",
745
+ "model.language_model.layers.38.attn_hyper_connection.input_mix_weight_up",
746
+ "model.language_model.layers.38.linear_attn.A_log",
747
+ "model.language_model.layers.38.linear_attn.conv1d",
748
+ "model.language_model.layers.38.linear_attn.dt_bias",
749
+ "model.language_model.layers.38.linear_attn.in_proj_a",
750
+ "model.language_model.layers.38.linear_attn.in_proj_b",
751
+ "model.language_model.layers.38.linear_attn.in_proj_qkv",
752
+ "model.language_model.layers.38.linear_attn.in_proj_z",
753
+ "model.language_model.layers.38.linear_attn.norm",
754
+ "model.language_model.layers.38.linear_attn.out_proj",
755
+ "model.language_model.layers.38.mlp.gate",
756
+ "model.language_model.layers.38.mlp.shared_expert.down_proj",
757
+ "model.language_model.layers.38.mlp.shared_expert.gate_proj",
758
+ "model.language_model.layers.38.mlp.shared_expert.up_proj",
759
+ "model.language_model.layers.38.mlp.shared_expert_gate",
760
+ "model.language_model.layers.38.mlp_hyper_connection.block_inject_weight",
761
+ "model.language_model.layers.38.mlp_hyper_connection.hc_norm",
762
+ "model.language_model.layers.38.mlp_hyper_connection.input_mix_weight_down",
763
+ "model.language_model.layers.38.mlp_hyper_connection.input_mix_weight_up",
764
+ "model.language_model.layers.39.attn_hyper_connection.block_inject_weight",
765
+ "model.language_model.layers.39.attn_hyper_connection.hc_norm",
766
+ "model.language_model.layers.39.attn_hyper_connection.input_mix_weight_down",
767
+ "model.language_model.layers.39.attn_hyper_connection.input_mix_weight_up",
768
+ "model.language_model.layers.39.mlp.gate",
769
+ "model.language_model.layers.39.mlp.shared_expert.down_proj",
770
+ "model.language_model.layers.39.mlp.shared_expert.gate_proj",
771
+ "model.language_model.layers.39.mlp.shared_expert.up_proj",
772
+ "model.language_model.layers.39.mlp.shared_expert_gate",
773
+ "model.language_model.layers.39.mlp_hyper_connection.block_inject_weight",
774
+ "model.language_model.layers.39.mlp_hyper_connection.hc_norm",
775
+ "model.language_model.layers.39.mlp_hyper_connection.input_mix_weight_down",
776
+ "model.language_model.layers.39.mlp_hyper_connection.input_mix_weight_up",
777
+ "model.language_model.layers.39.self_attn.indexer.index_qk_proj",
778
+ "model.language_model.layers.39.self_attn.indexer.k_layernorm",
779
+ "model.language_model.layers.39.self_attn.indexer.q_layernorm",
780
+ "model.language_model.layers.39.self_attn.k_norm",
781
+ "model.language_model.layers.39.self_attn.k_proj",
782
+ "model.language_model.layers.39.self_attn.o_proj",
783
+ "model.language_model.layers.39.self_attn.q_norm",
784
+ "model.language_model.layers.39.self_attn.q_proj",
785
+ "model.language_model.layers.39.self_attn.v_proj",
786
+ "model.language_model.layers.4.attn_hyper_connection.block_inject_weight",
787
+ "model.language_model.layers.4.attn_hyper_connection.hc_norm",
788
+ "model.language_model.layers.4.attn_hyper_connection.input_mix_weight_down",
789
+ "model.language_model.layers.4.attn_hyper_connection.input_mix_weight_up",
790
+ "model.language_model.layers.4.linear_attn.A_log",
791
+ "model.language_model.layers.4.linear_attn.conv1d",
792
+ "model.language_model.layers.4.linear_attn.dt_bias",
793
+ "model.language_model.layers.4.linear_attn.in_proj_a",
794
+ "model.language_model.layers.4.linear_attn.in_proj_b",
795
+ "model.language_model.layers.4.linear_attn.in_proj_qkv",
796
+ "model.language_model.layers.4.linear_attn.in_proj_z",
797
+ "model.language_model.layers.4.linear_attn.norm",
798
+ "model.language_model.layers.4.linear_attn.out_proj",
799
+ "model.language_model.layers.4.mlp.gate",
800
+ "model.language_model.layers.4.mlp.shared_expert.down_proj",
801
+ "model.language_model.layers.4.mlp.shared_expert.gate_proj",
802
+ "model.language_model.layers.4.mlp.shared_expert.up_proj",
803
+ "model.language_model.layers.4.mlp.shared_expert_gate",
804
+ "model.language_model.layers.4.mlp_hyper_connection.block_inject_weight",
805
+ "model.language_model.layers.4.mlp_hyper_connection.hc_norm",
806
+ "model.language_model.layers.4.mlp_hyper_connection.input_mix_weight_down",
807
+ "model.language_model.layers.4.mlp_hyper_connection.input_mix_weight_up",
808
+ "model.language_model.layers.40.attn_hyper_connection.block_inject_weight",
809
+ "model.language_model.layers.40.attn_hyper_connection.hc_norm",
810
+ "model.language_model.layers.40.attn_hyper_connection.input_mix_weight_down",
811
+ "model.language_model.layers.40.attn_hyper_connection.input_mix_weight_up",
812
+ "model.language_model.layers.40.linear_attn.A_log",
813
+ "model.language_model.layers.40.linear_attn.conv1d",
814
+ "model.language_model.layers.40.linear_attn.dt_bias",
815
+ "model.language_model.layers.40.linear_attn.in_proj_a",
816
+ "model.language_model.layers.40.linear_attn.in_proj_b",
817
+ "model.language_model.layers.40.linear_attn.in_proj_qkv",
818
+ "model.language_model.layers.40.linear_attn.in_proj_z",
819
+ "model.language_model.layers.40.linear_attn.norm",
820
+ "model.language_model.layers.40.linear_attn.out_proj",
821
+ "model.language_model.layers.40.mlp.gate",
822
+ "model.language_model.layers.40.mlp.shared_expert.down_proj",
823
+ "model.language_model.layers.40.mlp.shared_expert.gate_proj",
824
+ "model.language_model.layers.40.mlp.shared_expert.up_proj",
825
+ "model.language_model.layers.40.mlp.shared_expert_gate",
826
+ "model.language_model.layers.40.mlp_hyper_connection.block_inject_weight",
827
+ "model.language_model.layers.40.mlp_hyper_connection.hc_norm",
828
+ "model.language_model.layers.40.mlp_hyper_connection.input_mix_weight_down",
829
+ "model.language_model.layers.40.mlp_hyper_connection.input_mix_weight_up",
830
+ "model.language_model.layers.41.attn_hyper_connection.block_inject_weight",
831
+ "model.language_model.layers.41.attn_hyper_connection.hc_norm",
832
+ "model.language_model.layers.41.attn_hyper_connection.input_mix_weight_down",
833
+ "model.language_model.layers.41.attn_hyper_connection.input_mix_weight_up",
834
+ "model.language_model.layers.41.linear_attn.A_log",
835
+ "model.language_model.layers.41.linear_attn.conv1d",
836
+ "model.language_model.layers.41.linear_attn.dt_bias",
837
+ "model.language_model.layers.41.linear_attn.in_proj_a",
838
+ "model.language_model.layers.41.linear_attn.in_proj_b",
839
+ "model.language_model.layers.41.linear_attn.in_proj_qkv",
840
+ "model.language_model.layers.41.linear_attn.in_proj_z",
841
+ "model.language_model.layers.41.linear_attn.norm",
842
+ "model.language_model.layers.41.linear_attn.out_proj",
843
+ "model.language_model.layers.41.mlp.gate",
844
+ "model.language_model.layers.41.mlp.shared_expert.down_proj",
845
+ "model.language_model.layers.41.mlp.shared_expert.gate_proj",
846
+ "model.language_model.layers.41.mlp.shared_expert.up_proj",
847
+ "model.language_model.layers.41.mlp.shared_expert_gate",
848
+ "model.language_model.layers.41.mlp_hyper_connection.block_inject_weight",
849
+ "model.language_model.layers.41.mlp_hyper_connection.hc_norm",
850
+ "model.language_model.layers.41.mlp_hyper_connection.input_mix_weight_down",
851
+ "model.language_model.layers.41.mlp_hyper_connection.input_mix_weight_up",
852
+ "model.language_model.layers.42.attn_hyper_connection.block_inject_weight",
853
+ "model.language_model.layers.42.attn_hyper_connection.hc_norm",
854
+ "model.language_model.layers.42.attn_hyper_connection.input_mix_weight_down",
855
+ "model.language_model.layers.42.attn_hyper_connection.input_mix_weight_up",
856
+ "model.language_model.layers.42.linear_attn.A_log",
857
+ "model.language_model.layers.42.linear_attn.conv1d",
858
+ "model.language_model.layers.42.linear_attn.dt_bias",
859
+ "model.language_model.layers.42.linear_attn.in_proj_a",
860
+ "model.language_model.layers.42.linear_attn.in_proj_b",
861
+ "model.language_model.layers.42.linear_attn.in_proj_qkv",
862
+ "model.language_model.layers.42.linear_attn.in_proj_z",
863
+ "model.language_model.layers.42.linear_attn.norm",
864
+ "model.language_model.layers.42.linear_attn.out_proj",
865
+ "model.language_model.layers.42.mlp.gate",
866
+ "model.language_model.layers.42.mlp.shared_expert.down_proj",
867
+ "model.language_model.layers.42.mlp.shared_expert.gate_proj",
868
+ "model.language_model.layers.42.mlp.shared_expert.up_proj",
869
+ "model.language_model.layers.42.mlp.shared_expert_gate",
870
+ "model.language_model.layers.42.mlp_hyper_connection.block_inject_weight",
871
+ "model.language_model.layers.42.mlp_hyper_connection.hc_norm",
872
+ "model.language_model.layers.42.mlp_hyper_connection.input_mix_weight_down",
873
+ "model.language_model.layers.42.mlp_hyper_connection.input_mix_weight_up",
874
+ "model.language_model.layers.43.attn_hyper_connection.block_inject_weight",
875
+ "model.language_model.layers.43.attn_hyper_connection.hc_norm",
876
+ "model.language_model.layers.43.attn_hyper_connection.input_mix_weight_down",
877
+ "model.language_model.layers.43.attn_hyper_connection.input_mix_weight_up",
878
+ "model.language_model.layers.43.mlp.gate",
879
+ "model.language_model.layers.43.mlp.shared_expert.down_proj",
880
+ "model.language_model.layers.43.mlp.shared_expert.gate_proj",
881
+ "model.language_model.layers.43.mlp.shared_expert.up_proj",
882
+ "model.language_model.layers.43.mlp.shared_expert_gate",
883
+ "model.language_model.layers.43.mlp_hyper_connection.block_inject_weight",
884
+ "model.language_model.layers.43.mlp_hyper_connection.hc_norm",
885
+ "model.language_model.layers.43.mlp_hyper_connection.input_mix_weight_down",
886
+ "model.language_model.layers.43.mlp_hyper_connection.input_mix_weight_up",
887
+ "model.language_model.layers.43.self_attn.indexer.index_qk_proj",
888
+ "model.language_model.layers.43.self_attn.indexer.k_layernorm",
889
+ "model.language_model.layers.43.self_attn.indexer.q_layernorm",
890
+ "model.language_model.layers.43.self_attn.k_norm",
891
+ "model.language_model.layers.43.self_attn.k_proj",
892
+ "model.language_model.layers.43.self_attn.o_proj",
893
+ "model.language_model.layers.43.self_attn.q_norm",
894
+ "model.language_model.layers.43.self_attn.q_proj",
895
+ "model.language_model.layers.43.self_attn.v_proj",
896
+ "model.language_model.layers.44.attn_hyper_connection.block_inject_weight",
897
+ "model.language_model.layers.44.attn_hyper_connection.hc_norm",
898
+ "model.language_model.layers.44.attn_hyper_connection.input_mix_weight_down",
899
+ "model.language_model.layers.44.attn_hyper_connection.input_mix_weight_up",
900
+ "model.language_model.layers.44.linear_attn.A_log",
901
+ "model.language_model.layers.44.linear_attn.conv1d",
902
+ "model.language_model.layers.44.linear_attn.dt_bias",
903
+ "model.language_model.layers.44.linear_attn.in_proj_a",
904
+ "model.language_model.layers.44.linear_attn.in_proj_b",
905
+ "model.language_model.layers.44.linear_attn.in_proj_qkv",
906
+ "model.language_model.layers.44.linear_attn.in_proj_z",
907
+ "model.language_model.layers.44.linear_attn.norm",
908
+ "model.language_model.layers.44.linear_attn.out_proj",
909
+ "model.language_model.layers.44.mlp.gate",
910
+ "model.language_model.layers.44.mlp.shared_expert.down_proj",
911
+ "model.language_model.layers.44.mlp.shared_expert.gate_proj",
912
+ "model.language_model.layers.44.mlp.shared_expert.up_proj",
913
+ "model.language_model.layers.44.mlp.shared_expert_gate",
914
+ "model.language_model.layers.44.mlp_hyper_connection.block_inject_weight",
915
+ "model.language_model.layers.44.mlp_hyper_connection.hc_norm",
916
+ "model.language_model.layers.44.mlp_hyper_connection.input_mix_weight_down",
917
+ "model.language_model.layers.44.mlp_hyper_connection.input_mix_weight_up",
918
+ "model.language_model.layers.45.attn_hyper_connection.block_inject_weight",
919
+ "model.language_model.layers.45.attn_hyper_connection.hc_norm",
920
+ "model.language_model.layers.45.attn_hyper_connection.input_mix_weight_down",
921
+ "model.language_model.layers.45.attn_hyper_connection.input_mix_weight_up",
922
+ "model.language_model.layers.45.linear_attn.A_log",
923
+ "model.language_model.layers.45.linear_attn.conv1d",
924
+ "model.language_model.layers.45.linear_attn.dt_bias",
925
+ "model.language_model.layers.45.linear_attn.in_proj_a",
926
+ "model.language_model.layers.45.linear_attn.in_proj_b",
927
+ "model.language_model.layers.45.linear_attn.in_proj_qkv",
928
+ "model.language_model.layers.45.linear_attn.in_proj_z",
929
+ "model.language_model.layers.45.linear_attn.norm",
930
+ "model.language_model.layers.45.linear_attn.out_proj",
931
+ "model.language_model.layers.45.mlp.gate",
932
+ "model.language_model.layers.45.mlp.shared_expert.down_proj",
933
+ "model.language_model.layers.45.mlp.shared_expert.gate_proj",
934
+ "model.language_model.layers.45.mlp.shared_expert.up_proj",
935
+ "model.language_model.layers.45.mlp.shared_expert_gate",
936
+ "model.language_model.layers.45.mlp_hyper_connection.block_inject_weight",
937
+ "model.language_model.layers.45.mlp_hyper_connection.hc_norm",
938
+ "model.language_model.layers.45.mlp_hyper_connection.input_mix_weight_down",
939
+ "model.language_model.layers.45.mlp_hyper_connection.input_mix_weight_up",
940
+ "model.language_model.layers.46.attn_hyper_connection.block_inject_weight",
941
+ "model.language_model.layers.46.attn_hyper_connection.hc_norm",
942
+ "model.language_model.layers.46.attn_hyper_connection.input_mix_weight_down",
943
+ "model.language_model.layers.46.attn_hyper_connection.input_mix_weight_up",
944
+ "model.language_model.layers.46.linear_attn.A_log",
945
+ "model.language_model.layers.46.linear_attn.conv1d",
946
+ "model.language_model.layers.46.linear_attn.dt_bias",
947
+ "model.language_model.layers.46.linear_attn.in_proj_a",
948
+ "model.language_model.layers.46.linear_attn.in_proj_b",
949
+ "model.language_model.layers.46.linear_attn.in_proj_qkv",
950
+ "model.language_model.layers.46.linear_attn.in_proj_z",
951
+ "model.language_model.layers.46.linear_attn.norm",
952
+ "model.language_model.layers.46.linear_attn.out_proj",
953
+ "model.language_model.layers.46.mlp.gate",
954
+ "model.language_model.layers.46.mlp.shared_expert.down_proj",
955
+ "model.language_model.layers.46.mlp.shared_expert.gate_proj",
956
+ "model.language_model.layers.46.mlp.shared_expert.up_proj",
957
+ "model.language_model.layers.46.mlp.shared_expert_gate",
958
+ "model.language_model.layers.46.mlp_hyper_connection.block_inject_weight",
959
+ "model.language_model.layers.46.mlp_hyper_connection.hc_norm",
960
+ "model.language_model.layers.46.mlp_hyper_connection.input_mix_weight_down",
961
+ "model.language_model.layers.46.mlp_hyper_connection.input_mix_weight_up",
962
+ "model.language_model.layers.47.attn_hyper_connection.block_inject_weight",
963
+ "model.language_model.layers.47.attn_hyper_connection.hc_norm",
964
+ "model.language_model.layers.47.attn_hyper_connection.input_mix_weight_down",
965
+ "model.language_model.layers.47.attn_hyper_connection.input_mix_weight_up",
966
+ "model.language_model.layers.47.mlp.gate",
967
+ "model.language_model.layers.47.mlp.shared_expert.down_proj",
968
+ "model.language_model.layers.47.mlp.shared_expert.gate_proj",
969
+ "model.language_model.layers.47.mlp.shared_expert.up_proj",
970
+ "model.language_model.layers.47.mlp.shared_expert_gate",
971
+ "model.language_model.layers.47.mlp_hyper_connection.block_inject_weight",
972
+ "model.language_model.layers.47.mlp_hyper_connection.hc_norm",
973
+ "model.language_model.layers.47.mlp_hyper_connection.input_mix_weight_down",
974
+ "model.language_model.layers.47.mlp_hyper_connection.input_mix_weight_up",
975
+ "model.language_model.layers.47.self_attn.indexer.index_qk_proj",
976
+ "model.language_model.layers.47.self_attn.indexer.k_layernorm",
977
+ "model.language_model.layers.47.self_attn.indexer.q_layernorm",
978
+ "model.language_model.layers.47.self_attn.k_norm",
979
+ "model.language_model.layers.47.self_attn.k_proj",
980
+ "model.language_model.layers.47.self_attn.o_proj",
981
+ "model.language_model.layers.47.self_attn.q_norm",
982
+ "model.language_model.layers.47.self_attn.q_proj",
983
+ "model.language_model.layers.47.self_attn.v_proj",
984
+ "model.language_model.layers.5.attn_hyper_connection.block_inject_weight",
985
+ "model.language_model.layers.5.attn_hyper_connection.hc_norm",
986
+ "model.language_model.layers.5.attn_hyper_connection.input_mix_weight_down",
987
+ "model.language_model.layers.5.attn_hyper_connection.input_mix_weight_up",
988
+ "model.language_model.layers.5.linear_attn.A_log",
989
+ "model.language_model.layers.5.linear_attn.conv1d",
990
+ "model.language_model.layers.5.linear_attn.dt_bias",
991
+ "model.language_model.layers.5.linear_attn.in_proj_a",
992
+ "model.language_model.layers.5.linear_attn.in_proj_b",
993
+ "model.language_model.layers.5.linear_attn.in_proj_qkv",
994
+ "model.language_model.layers.5.linear_attn.in_proj_z",
995
+ "model.language_model.layers.5.linear_attn.norm",
996
+ "model.language_model.layers.5.linear_attn.out_proj",
997
+ "model.language_model.layers.5.mlp.gate",
998
+ "model.language_model.layers.5.mlp.shared_expert.down_proj",
999
+ "model.language_model.layers.5.mlp.shared_expert.gate_proj",
1000
+ "model.language_model.layers.5.mlp.shared_expert.up_proj",
1001
+ "model.language_model.layers.5.mlp.shared_expert_gate",
1002
+ "model.language_model.layers.5.mlp_hyper_connection.block_inject_weight",
1003
+ "model.language_model.layers.5.mlp_hyper_connection.hc_norm",
1004
+ "model.language_model.layers.5.mlp_hyper_connection.input_mix_weight_down",
1005
+ "model.language_model.layers.5.mlp_hyper_connection.input_mix_weight_up",
1006
+ "model.language_model.layers.6.attn_hyper_connection.block_inject_weight",
1007
+ "model.language_model.layers.6.attn_hyper_connection.hc_norm",
1008
+ "model.language_model.layers.6.attn_hyper_connection.input_mix_weight_down",
1009
+ "model.language_model.layers.6.attn_hyper_connection.input_mix_weight_up",
1010
+ "model.language_model.layers.6.linear_attn.A_log",
1011
+ "model.language_model.layers.6.linear_attn.conv1d",
1012
+ "model.language_model.layers.6.linear_attn.dt_bias",
1013
+ "model.language_model.layers.6.linear_attn.in_proj_a",
1014
+ "model.language_model.layers.6.linear_attn.in_proj_b",
1015
+ "model.language_model.layers.6.linear_attn.in_proj_qkv",
1016
+ "model.language_model.layers.6.linear_attn.in_proj_z",
1017
+ "model.language_model.layers.6.linear_attn.norm",
1018
+ "model.language_model.layers.6.linear_attn.out_proj",
1019
+ "model.language_model.layers.6.mlp.gate",
1020
+ "model.language_model.layers.6.mlp.shared_expert.down_proj",
1021
+ "model.language_model.layers.6.mlp.shared_expert.gate_proj",
1022
+ "model.language_model.layers.6.mlp.shared_expert.up_proj",
1023
+ "model.language_model.layers.6.mlp.shared_expert_gate",
1024
+ "model.language_model.layers.6.mlp_hyper_connection.block_inject_weight",
1025
+ "model.language_model.layers.6.mlp_hyper_connection.hc_norm",
1026
+ "model.language_model.layers.6.mlp_hyper_connection.input_mix_weight_down",
1027
+ "model.language_model.layers.6.mlp_hyper_connection.input_mix_weight_up",
1028
+ "model.language_model.layers.7.attn_hyper_connection.block_inject_weight",
1029
+ "model.language_model.layers.7.attn_hyper_connection.hc_norm",
1030
+ "model.language_model.layers.7.attn_hyper_connection.input_mix_weight_down",
1031
+ "model.language_model.layers.7.attn_hyper_connection.input_mix_weight_up",
1032
+ "model.language_model.layers.7.mlp.gate",
1033
+ "model.language_model.layers.7.mlp.shared_expert.down_proj",
1034
+ "model.language_model.layers.7.mlp.shared_expert.gate_proj",
1035
+ "model.language_model.layers.7.mlp.shared_expert.up_proj",
1036
+ "model.language_model.layers.7.mlp.shared_expert_gate",
1037
+ "model.language_model.layers.7.mlp_hyper_connection.block_inject_weight",
1038
+ "model.language_model.layers.7.mlp_hyper_connection.hc_norm",
1039
+ "model.language_model.layers.7.mlp_hyper_connection.input_mix_weight_down",
1040
+ "model.language_model.layers.7.mlp_hyper_connection.input_mix_weight_up",
1041
+ "model.language_model.layers.7.self_attn.indexer.index_qk_proj",
1042
+ "model.language_model.layers.7.self_attn.indexer.k_layernorm",
1043
+ "model.language_model.layers.7.self_attn.indexer.q_layernorm",
1044
+ "model.language_model.layers.7.self_attn.k_norm",
1045
+ "model.language_model.layers.7.self_attn.k_proj",
1046
+ "model.language_model.layers.7.self_attn.o_proj",
1047
+ "model.language_model.layers.7.self_attn.q_norm",
1048
+ "model.language_model.layers.7.self_attn.q_proj",
1049
+ "model.language_model.layers.7.self_attn.v_proj",
1050
+ "model.language_model.layers.8.attn_hyper_connection.block_inject_weight",
1051
+ "model.language_model.layers.8.attn_hyper_connection.hc_norm",
1052
+ "model.language_model.layers.8.attn_hyper_connection.input_mix_weight_down",
1053
+ "model.language_model.layers.8.attn_hyper_connection.input_mix_weight_up",
1054
+ "model.language_model.layers.8.linear_attn.A_log",
1055
+ "model.language_model.layers.8.linear_attn.conv1d",
1056
+ "model.language_model.layers.8.linear_attn.dt_bias",
1057
+ "model.language_model.layers.8.linear_attn.in_proj_a",
1058
+ "model.language_model.layers.8.linear_attn.in_proj_b",
1059
+ "model.language_model.layers.8.linear_attn.in_proj_qkv",
1060
+ "model.language_model.layers.8.linear_attn.in_proj_z",
1061
+ "model.language_model.layers.8.linear_attn.norm",
1062
+ "model.language_model.layers.8.linear_attn.out_proj",
1063
+ "model.language_model.layers.8.mlp.gate",
1064
+ "model.language_model.layers.8.mlp.shared_expert.down_proj",
1065
+ "model.language_model.layers.8.mlp.shared_expert.gate_proj",
1066
+ "model.language_model.layers.8.mlp.shared_expert.up_proj",
1067
+ "model.language_model.layers.8.mlp.shared_expert_gate",
1068
+ "model.language_model.layers.8.mlp_hyper_connection.block_inject_weight",
1069
+ "model.language_model.layers.8.mlp_hyper_connection.hc_norm",
1070
+ "model.language_model.layers.8.mlp_hyper_connection.input_mix_weight_down",
1071
+ "model.language_model.layers.8.mlp_hyper_connection.input_mix_weight_up",
1072
+ "model.language_model.layers.9.attn_hyper_connection.block_inject_weight",
1073
+ "model.language_model.layers.9.attn_hyper_connection.hc_norm",
1074
+ "model.language_model.layers.9.attn_hyper_connection.input_mix_weight_down",
1075
+ "model.language_model.layers.9.attn_hyper_connection.input_mix_weight_up",
1076
+ "model.language_model.layers.9.linear_attn.A_log",
1077
+ "model.language_model.layers.9.linear_attn.conv1d",
1078
+ "model.language_model.layers.9.linear_attn.dt_bias",
1079
+ "model.language_model.layers.9.linear_attn.in_proj_a",
1080
+ "model.language_model.layers.9.linear_attn.in_proj_b",
1081
+ "model.language_model.layers.9.linear_attn.in_proj_qkv",
1082
+ "model.language_model.layers.9.linear_attn.in_proj_z",
1083
+ "model.language_model.layers.9.linear_attn.norm",
1084
+ "model.language_model.layers.9.linear_attn.out_proj",
1085
+ "model.language_model.layers.9.mlp.gate",
1086
+ "model.language_model.layers.9.mlp.shared_expert.down_proj",
1087
+ "model.language_model.layers.9.mlp.shared_expert.gate_proj",
1088
+ "model.language_model.layers.9.mlp.shared_expert.up_proj",
1089
+ "model.language_model.layers.9.mlp.shared_expert_gate",
1090
+ "model.language_model.layers.9.mlp_hyper_connection.block_inject_weight",
1091
+ "model.language_model.layers.9.mlp_hyper_connection.hc_norm",
1092
+ "model.language_model.layers.9.mlp_hyper_connection.input_mix_weight_down",
1093
+ "model.language_model.layers.9.mlp_hyper_connection.input_mix_weight_up",
1094
+ "model.visual.blocks.0.attn.proj",
1095
+ "model.visual.blocks.0.attn.qkv",
1096
+ "model.visual.blocks.0.mlp.linear_fc1",
1097
+ "model.visual.blocks.0.mlp.linear_fc2",
1098
+ "model.visual.blocks.0.norm1",
1099
+ "model.visual.blocks.0.norm2",
1100
+ "model.visual.blocks.1.attn.proj",
1101
+ "model.visual.blocks.1.attn.qkv",
1102
+ "model.visual.blocks.1.mlp.linear_fc1",
1103
+ "model.visual.blocks.1.mlp.linear_fc2",
1104
+ "model.visual.blocks.1.norm1",
1105
+ "model.visual.blocks.1.norm2",
1106
+ "model.visual.blocks.10.attn.proj",
1107
+ "model.visual.blocks.10.attn.qkv",
1108
+ "model.visual.blocks.10.mlp.linear_fc1",
1109
+ "model.visual.blocks.10.mlp.linear_fc2",
1110
+ "model.visual.blocks.10.norm1",
1111
+ "model.visual.blocks.10.norm2",
1112
+ "model.visual.blocks.11.attn.proj",
1113
+ "model.visual.blocks.11.attn.qkv",
1114
+ "model.visual.blocks.11.mlp.linear_fc1",
1115
+ "model.visual.blocks.11.mlp.linear_fc2",
1116
+ "model.visual.blocks.11.norm1",
1117
+ "model.visual.blocks.11.norm2",
1118
+ "model.visual.blocks.12.attn.proj",
1119
+ "model.visual.blocks.12.attn.qkv",
1120
+ "model.visual.blocks.12.mlp.linear_fc1",
1121
+ "model.visual.blocks.12.mlp.linear_fc2",
1122
+ "model.visual.blocks.12.norm1",
1123
+ "model.visual.blocks.12.norm2",
1124
+ "model.visual.blocks.13.attn.proj",
1125
+ "model.visual.blocks.13.attn.qkv",
1126
+ "model.visual.blocks.13.mlp.linear_fc1",
1127
+ "model.visual.blocks.13.mlp.linear_fc2",
1128
+ "model.visual.blocks.13.norm1",
1129
+ "model.visual.blocks.13.norm2",
1130
+ "model.visual.blocks.14.attn.proj",
1131
+ "model.visual.blocks.14.attn.qkv",
1132
+ "model.visual.blocks.14.mlp.linear_fc1",
1133
+ "model.visual.blocks.14.mlp.linear_fc2",
1134
+ "model.visual.blocks.14.norm1",
1135
+ "model.visual.blocks.14.norm2",
1136
+ "model.visual.blocks.15.attn.proj",
1137
+ "model.visual.blocks.15.attn.qkv",
1138
+ "model.visual.blocks.15.mlp.linear_fc1",
1139
+ "model.visual.blocks.15.mlp.linear_fc2",
1140
+ "model.visual.blocks.15.norm1",
1141
+ "model.visual.blocks.15.norm2",
1142
+ "model.visual.blocks.16.attn.proj",
1143
+ "model.visual.blocks.16.attn.qkv",
1144
+ "model.visual.blocks.16.mlp.linear_fc1",
1145
+ "model.visual.blocks.16.mlp.linear_fc2",
1146
+ "model.visual.blocks.16.norm1",
1147
+ "model.visual.blocks.16.norm2",
1148
+ "model.visual.blocks.17.attn.proj",
1149
+ "model.visual.blocks.17.attn.qkv",
1150
+ "model.visual.blocks.17.mlp.linear_fc1",
1151
+ "model.visual.blocks.17.mlp.linear_fc2",
1152
+ "model.visual.blocks.17.norm1",
1153
+ "model.visual.blocks.17.norm2",
1154
+ "model.visual.blocks.18.attn.proj",
1155
+ "model.visual.blocks.18.attn.qkv",
1156
+ "model.visual.blocks.18.mlp.linear_fc1",
1157
+ "model.visual.blocks.18.mlp.linear_fc2",
1158
+ "model.visual.blocks.18.norm1",
1159
+ "model.visual.blocks.18.norm2",
1160
+ "model.visual.blocks.19.attn.proj",
1161
+ "model.visual.blocks.19.attn.qkv",
1162
+ "model.visual.blocks.19.mlp.linear_fc1",
1163
+ "model.visual.blocks.19.mlp.linear_fc2",
1164
+ "model.visual.blocks.19.norm1",
1165
+ "model.visual.blocks.19.norm2",
1166
+ "model.visual.blocks.2.attn.proj",
1167
+ "model.visual.blocks.2.attn.qkv",
1168
+ "model.visual.blocks.2.mlp.linear_fc1",
1169
+ "model.visual.blocks.2.mlp.linear_fc2",
1170
+ "model.visual.blocks.2.norm1",
1171
+ "model.visual.blocks.2.norm2",
1172
+ "model.visual.blocks.20.attn.proj",
1173
+ "model.visual.blocks.20.attn.qkv",
1174
+ "model.visual.blocks.20.mlp.linear_fc1",
1175
+ "model.visual.blocks.20.mlp.linear_fc2",
1176
+ "model.visual.blocks.20.norm1",
1177
+ "model.visual.blocks.20.norm2",
1178
+ "model.visual.blocks.21.attn.proj",
1179
+ "model.visual.blocks.21.attn.qkv",
1180
+ "model.visual.blocks.21.mlp.linear_fc1",
1181
+ "model.visual.blocks.21.mlp.linear_fc2",
1182
+ "model.visual.blocks.21.norm1",
1183
+ "model.visual.blocks.21.norm2",
1184
+ "model.visual.blocks.22.attn.proj",
1185
+ "model.visual.blocks.22.attn.qkv",
1186
+ "model.visual.blocks.22.mlp.linear_fc1",
1187
+ "model.visual.blocks.22.mlp.linear_fc2",
1188
+ "model.visual.blocks.22.norm1",
1189
+ "model.visual.blocks.22.norm2",
1190
+ "model.visual.blocks.23.attn.proj",
1191
+ "model.visual.blocks.23.attn.qkv",
1192
+ "model.visual.blocks.23.mlp.linear_fc1",
1193
+ "model.visual.blocks.23.mlp.linear_fc2",
1194
+ "model.visual.blocks.23.norm1",
1195
+ "model.visual.blocks.23.norm2",
1196
+ "model.visual.blocks.24.attn.proj",
1197
+ "model.visual.blocks.24.attn.qkv",
1198
+ "model.visual.blocks.24.mlp.linear_fc1",
1199
+ "model.visual.blocks.24.mlp.linear_fc2",
1200
+ "model.visual.blocks.24.norm1",
1201
+ "model.visual.blocks.24.norm2",
1202
+ "model.visual.blocks.25.attn.proj",
1203
+ "model.visual.blocks.25.attn.qkv",
1204
+ "model.visual.blocks.25.mlp.linear_fc1",
1205
+ "model.visual.blocks.25.mlp.linear_fc2",
1206
+ "model.visual.blocks.25.norm1",
1207
+ "model.visual.blocks.25.norm2",
1208
+ "model.visual.blocks.26.attn.proj",
1209
+ "model.visual.blocks.26.attn.qkv",
1210
+ "model.visual.blocks.26.mlp.linear_fc1",
1211
+ "model.visual.blocks.26.mlp.linear_fc2",
1212
+ "model.visual.blocks.26.norm1",
1213
+ "model.visual.blocks.26.norm2",
1214
+ "model.visual.blocks.3.attn.proj",
1215
+ "model.visual.blocks.3.attn.qkv",
1216
+ "model.visual.blocks.3.mlp.linear_fc1",
1217
+ "model.visual.blocks.3.mlp.linear_fc2",
1218
+ "model.visual.blocks.3.norm1",
1219
+ "model.visual.blocks.3.norm2",
1220
+ "model.visual.blocks.4.attn.proj",
1221
+ "model.visual.blocks.4.attn.qkv",
1222
+ "model.visual.blocks.4.mlp.linear_fc1",
1223
+ "model.visual.blocks.4.mlp.linear_fc2",
1224
+ "model.visual.blocks.4.norm1",
1225
+ "model.visual.blocks.4.norm2",
1226
+ "model.visual.blocks.5.attn.proj",
1227
+ "model.visual.blocks.5.attn.qkv",
1228
+ "model.visual.blocks.5.mlp.linear_fc1",
1229
+ "model.visual.blocks.5.mlp.linear_fc2",
1230
+ "model.visual.blocks.5.norm1",
1231
+ "model.visual.blocks.5.norm2",
1232
+ "model.visual.blocks.6.attn.proj",
1233
+ "model.visual.blocks.6.attn.qkv",
1234
+ "model.visual.blocks.6.mlp.linear_fc1",
1235
+ "model.visual.blocks.6.mlp.linear_fc2",
1236
+ "model.visual.blocks.6.norm1",
1237
+ "model.visual.blocks.6.norm2",
1238
+ "model.visual.blocks.7.attn.proj",
1239
+ "model.visual.blocks.7.attn.qkv",
1240
+ "model.visual.blocks.7.mlp.linear_fc1",
1241
+ "model.visual.blocks.7.mlp.linear_fc2",
1242
+ "model.visual.blocks.7.norm1",
1243
+ "model.visual.blocks.7.norm2",
1244
+ "model.visual.blocks.8.attn.proj",
1245
+ "model.visual.blocks.8.attn.qkv",
1246
+ "model.visual.blocks.8.mlp.linear_fc1",
1247
+ "model.visual.blocks.8.mlp.linear_fc2",
1248
+ "model.visual.blocks.8.norm1",
1249
+ "model.visual.blocks.8.norm2",
1250
+ "model.visual.blocks.9.attn.proj",
1251
+ "model.visual.blocks.9.attn.qkv",
1252
+ "model.visual.blocks.9.mlp.linear_fc1",
1253
+ "model.visual.blocks.9.mlp.linear_fc2",
1254
+ "model.visual.blocks.9.norm1",
1255
+ "model.visual.blocks.9.norm2",
1256
+ "model.visual.merger.linear_fc1",
1257
+ "model.visual.merger.linear_fc2",
1258
+ "model.visual.merger.norm",
1259
+ "model.visual.patch_embed.proj",
1260
+ "model.visual.pos_embed",
1261
+ "mtp.fc_embedding",
1262
+ "mtp.fc_hidden",
1263
+ "mtp.hyper_connection_mixer.hc_norm",
1264
+ "mtp.hyper_connection_mixer.input_mix_weight_down",
1265
+ "mtp.hyper_connection_mixer.input_mix_weight_up",
1266
+ "mtp.layers.0.attn_hyper_connection.block_inject_weight",
1267
+ "mtp.layers.0.attn_hyper_connection.hc_norm",
1268
+ "mtp.layers.0.attn_hyper_connection.input_mix_weight_down",
1269
+ "mtp.layers.0.attn_hyper_connection.input_mix_weight_up",
1270
+ "mtp.layers.0.mlp.gate",
1271
+ "mtp.layers.0.mlp.shared_expert.down_proj",
1272
+ "mtp.layers.0.mlp.shared_expert.gate_proj",
1273
+ "mtp.layers.0.mlp.shared_expert.up_proj",
1274
+ "mtp.layers.0.mlp.shared_expert_gate",
1275
+ "mtp.layers.0.mlp_hyper_connection.block_inject_weight",
1276
+ "mtp.layers.0.mlp_hyper_connection.hc_norm",
1277
+ "mtp.layers.0.mlp_hyper_connection.input_mix_weight_down",
1278
+ "mtp.layers.0.mlp_hyper_connection.input_mix_weight_up",
1279
+ "mtp.layers.0.self_attn.indexer.index_qk_proj",
1280
+ "mtp.layers.0.self_attn.indexer.k_layernorm",
1281
+ "mtp.layers.0.self_attn.indexer.q_layernorm",
1282
+ "mtp.layers.0.self_attn.k_norm",
1283
+ "mtp.layers.0.self_attn.k_proj",
1284
+ "mtp.layers.0.self_attn.o_proj",
1285
+ "mtp.layers.0.self_attn.q_norm",
1286
+ "mtp.layers.0.self_attn.q_proj",
1287
+ "mtp.layers.0.self_attn.v_proj",
1288
+ "mtp.pre_fc_norm_embedding",
1289
+ "mtp.pre_fc_norm_hidden"
1290
+ ],
1291
+ "input_scale_calibration": "streaming_top_tail_4_5_6_proxy",
1292
+ "input_scale_granularity": "per-tensor",
1293
+ "input_scale_quantile": 0.9999,
1294
+ "learned_rotation": false,
1295
+ "learned_rotation_objective": null,
1296
+ "mse_optimal_clipping": false,
1297
+ "mtp_input_scale_k": 4,
1298
+ "mtp_input_scale_quantile": 0.95,
1299
+ "num_samples": 128,
1300
+ "quant_algo": "NVFP4",
1301
+ "quant_method": "modelopt",
1302
+ "quarot_r1_fold": false,
1303
+ "quarot_r1_fold_block_size": 32,
1304
+ "rotate": false,
1305
+ "scale_search": false,
1306
+ "seq_len": 2048,
1307
+ "smoothquant_alpha": null,
1308
+ "smoothquant_dualscale": false,
1309
+ "smoothquant_dualscale_round": 1,
1310
+ "smoothquant_salient_ratio": 1.0,
1311
+ "weight_scale_2_search_factors": null,
1312
+ "with_input_scale": true
1313
+ },
1314
+ "text_config": {
1315
+ "attention_bias": false,
1316
+ "attention_dropout": 0.0,
1317
+ "bos_token_id": 248044,
1318
+ "dtype": "bfloat16",
1319
+ "eos_token_id": 248044,
1320
+ "full_attention_interval": 4,
1321
+ "hc_count": 4,
1322
+ "hc_lowrank": 320,
1323
+ "head_dim": 256,
1324
+ "heads_per_ngram": 8,
1325
+ "hidden_act": "silu",
1326
+ "hidden_size": 2560,
1327
+ "indexer_budget": 2048,
1328
+ "indexer_compress_ratio": 4,
1329
+ "indexer_head_dim": 128,
1330
+ "indexer_kv_heads": 1,
1331
+ "indexer_n_heads": 4,
1332
+ "initializer_range": 0.02,
1333
+ "layer_types": [
1334
+ "linear_attention",
1335
+ "linear_attention",
1336
+ "linear_attention",
1337
+ "full_attention",
1338
+ "linear_attention",
1339
+ "linear_attention",
1340
+ "linear_attention",
1341
+ "full_attention",
1342
+ "linear_attention",
1343
+ "linear_attention",
1344
+ "linear_attention",
1345
+ "full_attention",
1346
+ "linear_attention",
1347
+ "linear_attention",
1348
+ "linear_attention",
1349
+ "full_attention",
1350
+ "linear_attention",
1351
+ "linear_attention",
1352
+ "linear_attention",
1353
+ "full_attention",
1354
+ "linear_attention",
1355
+ "linear_attention",
1356
+ "linear_attention",
1357
+ "full_attention",
1358
+ "linear_attention",
1359
+ "linear_attention",
1360
+ "linear_attention",
1361
+ "full_attention",
1362
+ "linear_attention",
1363
+ "linear_attention",
1364
+ "linear_attention",
1365
+ "full_attention",
1366
+ "linear_attention",
1367
+ "linear_attention",
1368
+ "linear_attention",
1369
+ "full_attention",
1370
+ "linear_attention",
1371
+ "linear_attention",
1372
+ "linear_attention",
1373
+ "full_attention",
1374
+ "linear_attention",
1375
+ "linear_attention",
1376
+ "linear_attention",
1377
+ "full_attention",
1378
+ "linear_attention",
1379
+ "linear_attention",
1380
+ "linear_attention",
1381
+ "full_attention"
1382
+ ],
1383
+ "linear_conv_kernel_dim": 4,
1384
+ "linear_key_head_dim": 128,
1385
+ "linear_num_key_heads": 16,
1386
+ "linear_num_value_heads": 48,
1387
+ "linear_value_head_dim": 128,
1388
+ "make_ngram_vocab_size_divisible_by": 128,
1389
+ "mamba_ssm_dtype": "float32",
1390
+ "max_position_embeddings": 262144,
1391
+ "model_type": "qwen4_exp_text",
1392
+ "moe_intermediate_size": 640,
1393
+ "mtp": {
1394
+ "hybrid": true,
1395
+ "layer_types": [
1396
+ "full_attention"
1397
+ ],
1398
+ "mtp_use_hidden_state_from_layer": null,
1399
+ "num_hidden_layers": 1,
1400
+ "rope_theta": 10000000
1401
+ },
1402
+ "mtp_num_hidden_layers": 1,
1403
+ "mtp_use_dedicated_embeddings": false,
1404
+ "ngram_size": 3,
1405
+ "ngram_vocab_size_base": 20000000,
1406
+ "num_attention_heads": 24,
1407
+ "num_experts": 512,
1408
+ "num_experts_per_tok": 10,
1409
+ "num_hidden_layers": 48,
1410
+ "num_key_value_heads": 2,
1411
+ "output_gate_type": "sigmoid",
1412
+ "output_router_logits": false,
1413
+ "pad_token_id": null,
1414
+ "partial_rotary_factor": 0.25,
1415
+ "ple_conv_kernel_size": 4,
1416
+ "ple_embed_dim": 2560,
1417
+ "ple_layer_ids": [
1418
+ 2
1419
+ ],
1420
+ "ple_quantization_config": {
1421
+ "block_scale_dtype": "float8_e4m3fn",
1422
+ "format": "qwen38-nvfp4-ple-v1",
1423
+ "global_scale_dtype": "float32",
1424
+ "group_size": 16,
1425
+ "output_dtype": "bfloat16",
1426
+ "packed_dtype": "uint8",
1427
+ "packing": "low-nibble-first",
1428
+ "value_dtype": "e2m1"
1429
+ },
1430
+ "rms_norm_eps": 1e-06,
1431
+ "rope_parameters": {
1432
+ "mrope_interleaved": true,
1433
+ "mrope_section": [
1434
+ 11,
1435
+ 11,
1436
+ 10
1437
+ ],
1438
+ "partial_rotary_factor": 0.25,
1439
+ "rope_theta": 10000000,
1440
+ "rope_type": "default"
1441
+ },
1442
+ "router_aux_loss_coef": 0.001,
1443
+ "shared_expert_intermediate_size": 640,
1444
+ "split_ngram_parts": 128,
1445
+ "tie_word_embeddings": false,
1446
+ "use_cache": true,
1447
+ "vocab_size": 248320
1448
+ },
1449
+ "tie_word_embeddings": false,
1450
+ "transformers_version": "5.8.0.dev0",
1451
+ "video_token_id": 248057,
1452
+ "vision_config": {
1453
+ "deepstack_visual_indexes": [],
1454
+ "depth": 27,
1455
+ "hidden_act": "gelu_pytorch_tanh",
1456
+ "hidden_size": 1152,
1457
+ "in_channels": 3,
1458
+ "initializer_range": 0.02,
1459
+ "intermediate_size": 4304,
1460
+ "model_type": "qwen4_exp",
1461
+ "num_heads": 16,
1462
+ "num_position_embeddings": 2304,
1463
+ "out_hidden_size": 2560,
1464
+ "patch_size": 16,
1465
+ "spatial_merge_size": 2,
1466
+ "temporal_patch_size": 2
1467
+ },
1468
+ "vision_end_token_id": 248054,
1469
+ "vision_start_token_id": 248053
1470
+ }
generation_config.json ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 248044,
3
+ "do_sample": true,
4
+ "eos_token_id": [
5
+ 248046,
6
+ 248044
7
+ ],
8
+ "pad_token_id": 248044,
9
+ "temperature": 1.0,
10
+ "top_k": 20,
11
+ "top_p": 0.95
12
+ }
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
model-00002-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dea5f9ebc78eeac6f1c2751758e7365e3ba7fbeef39d723a9caa8206798767d0
3
+ size 4980717000
model-00003-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0883c2edbae8e2f0bf6240561536a9cb8059ba368e5209911deb1d704d3f24be
3
+ size 4996346000
model-00004-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:526f2738015ef06df7cd10f15cd811c7a49f6490b4da292f7820056173c252f9
3
+ size 816384304
model.safetensors.index.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3f0003bf179800ac047e0247633a462626418ac186f8dda856dd4d732fad483a
3
+ size 35742446
nvfp4_experts-00001-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f37b5ed37a7e598c3b125c5cf095f860896b0c3c070b8393487984c129fa0d52
3
+ size 4249228128
nvfp4_experts-00002-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e89dace962c46e042f1bcd78889b1159762ac2c7d0ff7e179f68410826ac3796
3
+ size 4249228128
nvfp4_experts-00003-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5043148ee50f5a04b3a8120f54c24ab67ae0863eeb047f6d2b3f30466bf4b5e9
3
+ size 4249228128
nvfp4_experts-00004-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:63523da74874b77aae413beea23741b0b974ad5f6b1b1e9e4d1fb2e8ed4363d5
3
+ size 4249240416
nvfp4_experts-00005-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:963bfea776731902876d7fcb47d65fed7448404020f48c71d531e24138cece72
3
+ size 4249246560
nvfp4_experts-00006-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ecf4b4e6b50ed701bda0e2708bb983aa98fa98ee10196b0e4d6c3e79f700689f
3
+ size 4249246560
nvfp4_experts-00007-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a06fc550d212d86e69846c9ed0fb92f0c927565d9ddd7bb669d8bb193d55bee1
3
+ size 4249246560
nvfp4_experts-00008-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a9f9de0f1de86159e9f1e5e4573e6375e6f786ec941d42d1533395071b24ff52
3
+ size 4249246560
nvfp4_experts-00009-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:369c707829a36045fa6570b1a1e716d70fad2bfb3b3aac90adeccb980eeb470b
3
+ size 4249246560
nvfp4_experts-00010-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dace02ef08e672d7646e95eee078b7268cd7644b849e28bfcdab3f66e6dec58a
3
+ size 4249246560
nvfp4_experts-00011-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:351e24abcd554e790da4a523d73ca6fb0406e5af76a683de91989df4337a2685
3
+ size 4249246560
nvfp4_experts-00012-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:459cc1a0e56b48f67aecd3d48039dd095e2a8805050b8bbc31cf44a9ca33f33c
3
+ size 4249246560
nvfp4_experts-00013-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5af8d781f5077d6504ea58d3acb7ad1a14e8e8eae1bf77ab815cac3f44503701
3
+ size 4249246560
nvfp4_experts-00014-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8ec308f1e1bfc14f1759e6e059bb5a4876bbf4b7e0281ee9fc3f5b8ab135032b
3
+ size 4249246560
nvfp4_experts-00015-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a33be5adf5d5a1ea7306ce47c00ebd60465b9e15afeeaee3f0bdd0b94fc080ab
3
+ size 4249246560
nvfp4_experts-00016-of-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:76fb6d93b3788ccd371a0b927c98e92e2fd8225e8ab3f356de1f60d7232c7249
3
+ size 4249246560
nvfp4_experts_mtp.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0d44e6d705d2313c713e60114e56874adf358ed5f646dc8704bb5be15f5ddbf7
3
+ size 1597441088
ple-nvfp4-00001-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3637f1778cafefb2392dfbe824b8152ee08b5fd8e3f3a0006b3fb9d2bacbcd92
3
+ size 225001588
ple-nvfp4-00002-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:34c38184c7f0eae8e515d753f584e17e2fab70d63e630a9a999c72c75a97ed43
3
+ size 225001588
ple-nvfp4-00003-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1a3d2fc69b4a39157557531e25e8bf6d16c86e7c2ce448cc2be2d03b3b2d9b40
3
+ size 225001588
ple-nvfp4-00004-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b7e9478e689a6f867a0930986f89fbce50a2ff2ff519c34dff94d77a8d5a0602
3
+ size 225001588
ple-nvfp4-00005-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9a088caee78e57c8c6883b548a9dbd28a8d2c68d620b7a4eef6abeb988f995d4
3
+ size 225001588
ple-nvfp4-00006-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:68a251dcdbe0dc7e53b07fd1809e98c62d789514ab2a0b1b98fb06056ed9c157
3
+ size 225001588
ple-nvfp4-00007-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f09a309d7bf8040bc7ae4593474fa95c4e456207971058473a4482ddd99d9b40
3
+ size 225001588
ple-nvfp4-00008-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:653f1e2f375c6a694f37cca0bd951f47a008d6ef5cb432d547f821ebc29a4e35
3
+ size 225001588
ple-nvfp4-00009-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fc17299303dd93a37e98a546b48e09002184814254c6da1bbede3a1bd17ef728
3
+ size 225001588
ple-nvfp4-00010-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9f3a52379c164519928def1d163f89f4f4fb642dcd96a0f113e8a14077f56ade
3
+ size 225001588
ple-nvfp4-00011-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e717777234b38a441b6e57f7a4b3285f7b0a1d7ed12346d9836d6ddecad6b530
3
+ size 225001596
ple-nvfp4-00012-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:efd2d836751b2b8b8c3e5462fcfc16758326522007893b729f8a126d8c872372
3
+ size 225001596
ple-nvfp4-00013-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:734d1c62b47ebdffffa634ea3481f7fc7ae5becf889b1497669191f103ed7e44
3
+ size 225001596
ple-nvfp4-00014-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:aaf535afcd2aafc17676e0996d9d3fab3d0bc72731a8ad95d89a4a6bfecf25fa
3
+ size 225001596
ple-nvfp4-00015-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5714fe9b0c7a82b8cd70f7af047c5eb7d5d1352b150645e07dd8693818437189
3
+ size 225001596
ple-nvfp4-00016-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d0c4857ab6c01f346614876847bb4415509d476831306a285e887e9fc7ab2135
3
+ size 225001596
ple-nvfp4-00017-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:648af85aacced6f5aaf4001054e5bb00972da781202bd6a1134327b337a99a7d
3
+ size 225001596
ple-nvfp4-00018-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:48f611887c887eaef0b0cb230938869e6c5e9e860e099174dfb78fdd59dc7a81
3
+ size 225001596
ple-nvfp4-00019-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0e3ba8ae09cb8322a83a4dfccee18cd5639c74cd317875868d1ab186fa7b4caa
3
+ size 225001596
ple-nvfp4-00020-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07ecf05fa9dfcad38e27e64c319ace82e4492ec93eaa4335cdc9944eaad2809e
3
+ size 225001596
ple-nvfp4-00021-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:71cd949bacc574838b27b19d9f212c2e9b3b25af6666bdaeacc4985edd607170
3
+ size 225001596
ple-nvfp4-00022-of-00128.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5c445dfb3a4717620df6b979aa6d47f3280ab0d02ae2ef5d21df512939d11973
3
+ size 225001596