programmer-666 commited on
Commit
ad88aaa
·
verified ·
1 Parent(s): 00e1121

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +119 -120
README.md CHANGED
@@ -13,127 +13,126 @@ tags:
13
  - qwen35moe
14
  - apple-silicon
15
  - speculative-decoding
16
- - multi-token-prediction
17
  model-index:
18
- - name: Ornith-1.0-35B-oQ7
19
- results:
20
- - task:
21
- type: text-generation
22
- dataset:
23
- name: MMLU
24
- type: cais/mmlu
25
- metrics:
26
- - name: Accuracy (30-sample, thinking enabled)
27
- type: accuracy
28
- value: 86.7
29
- - task:
30
- type: text-generation
31
- dataset:
32
- name: MMLU-Pro
33
- type: TIGER-Lab/MMLU-Pro
34
- metrics:
35
- - name: Accuracy (30-sample, thinking enabled)
36
- type: accuracy
37
- value: 76.7
38
- - task:
39
- type: text-generation
40
- dataset:
41
- name: HellaSwag
42
- type: Rowan/hellaswag
43
- metrics:
44
- - name: Accuracy (30-sample, thinking enabled)
45
- type: accuracy
46
- value: 86.7
47
- - task:
48
- type: text-generation
49
- dataset:
50
- name: TruthfulQA
51
- type: truthful_qa
52
- metrics:
53
- - name: Accuracy (30-sample, thinking enabled)
54
- type: accuracy
55
- value: 90.0
56
- - task:
57
- type: text-generation
58
- dataset:
59
- name: ARC Challenge
60
- type: allenai/ai2_arc
61
- metrics:
62
- - name: Accuracy (30-sample, thinking enabled)
63
- type: accuracy
64
- value: 93.3
65
- - task:
66
- type: text-generation
67
- dataset:
68
- name: Winogrande
69
- type: winogrande
70
- metrics:
71
- - name: Accuracy (30-sample, thinking enabled)
72
- type: accuracy
73
- value: 86.7
74
- - task:
75
- type: text-generation
76
- dataset:
77
- name: GSM8K
78
- type: openai/gsm8k
79
- metrics:
80
- - name: Accuracy (30-sample, thinking enabled)
81
- type: accuracy
82
- value: 96.7
83
- - task:
84
- type: text-generation
85
- dataset:
86
- name: MathQA
87
- type: math_qa
88
- metrics:
89
- - name: Accuracy (30-sample, thinking enabled)
90
- type: accuracy
91
- value: 93.3
92
- - task:
93
- type: text-generation
94
- dataset:
95
- name: HumanEval
96
- type: openai/openai_humaneval
97
- metrics:
98
- - name: Pass@1 (30-sample, thinking enabled)
99
- type: code_eval
100
- value: 90.0
101
- - task:
102
- type: text-generation
103
- dataset:
104
- name: MBPP
105
- type: google-research-datasets/mbpp
106
- metrics:
107
- - name: Pass@1 (30-sample, thinking enabled)
108
- type: code_eval
109
- value: 90.0
110
- - task:
111
- type: text-generation
112
- dataset:
113
- name: LiveCodeBench
114
- type: livecodebench/code_generation_lite
115
- metrics:
116
- - name: Accuracy (30-sample, thinking enabled)
117
- type: code_eval
118
- value: 63.3
119
- - task:
120
- type: text-generation
121
- dataset:
122
- name: BBQ
123
- type: herojhc/bbq
124
- metrics:
125
- - name: Accuracy (30-sample, thinking enabled)
126
- type: accuracy
127
- value: 93.3
128
- - task:
129
- type: text-generation
130
- dataset:
131
- name: SafetyBench
132
- type: thu-coai/SafetyBench
133
- metrics:
134
- - name: Accuracy (30-sample, thinking enabled)
135
- type: accuracy
136
- value: 86.7
137
  ---
138
 
139
  # Ornith-1.0-35B-oQ7
 
13
  - qwen35moe
14
  - apple-silicon
15
  - speculative-decoding
 
16
  model-index:
17
+ - name: Ornith-1.0-35B-oQ7
18
+ results:
19
+ - task:
20
+ type: text-generation
21
+ dataset:
22
+ name: MMLU
23
+ type: cais/mmlu
24
+ metrics:
25
+ - name: Accuracy (30-sample, thinking enabled)
26
+ type: accuracy
27
+ value: 86.7
28
+ - task:
29
+ type: text-generation
30
+ dataset:
31
+ name: MMLU-Pro
32
+ type: TIGER-Lab/MMLU-Pro
33
+ metrics:
34
+ - name: Accuracy (30-sample, thinking enabled)
35
+ type: accuracy
36
+ value: 76.7
37
+ - task:
38
+ type: text-generation
39
+ dataset:
40
+ name: HellaSwag
41
+ type: Rowan/hellaswag
42
+ metrics:
43
+ - name: Accuracy (30-sample, thinking enabled)
44
+ type: accuracy
45
+ value: 86.7
46
+ - task:
47
+ type: text-generation
48
+ dataset:
49
+ name: TruthfulQA
50
+ type: truthful_qa
51
+ metrics:
52
+ - name: Accuracy (30-sample, thinking enabled)
53
+ type: accuracy
54
+ value: 90
55
+ - task:
56
+ type: text-generation
57
+ dataset:
58
+ name: ARC Challenge
59
+ type: allenai/ai2_arc
60
+ metrics:
61
+ - name: Accuracy (30-sample, thinking enabled)
62
+ type: accuracy
63
+ value: 93.3
64
+ - task:
65
+ type: text-generation
66
+ dataset:
67
+ name: Winogrande
68
+ type: winogrande
69
+ metrics:
70
+ - name: Accuracy (30-sample, thinking enabled)
71
+ type: accuracy
72
+ value: 86.7
73
+ - task:
74
+ type: text-generation
75
+ dataset:
76
+ name: GSM8K
77
+ type: openai/gsm8k
78
+ metrics:
79
+ - name: Accuracy (30-sample, thinking enabled)
80
+ type: accuracy
81
+ value: 96.7
82
+ - task:
83
+ type: text-generation
84
+ dataset:
85
+ name: MathQA
86
+ type: math_qa
87
+ metrics:
88
+ - name: Accuracy (30-sample, thinking enabled)
89
+ type: accuracy
90
+ value: 93.3
91
+ - task:
92
+ type: text-generation
93
+ dataset:
94
+ name: HumanEval
95
+ type: openai/openai_humaneval
96
+ metrics:
97
+ - name: Pass@1 (30-sample, thinking enabled)
98
+ type: code_eval
99
+ value: 90
100
+ - task:
101
+ type: text-generation
102
+ dataset:
103
+ name: MBPP
104
+ type: google-research-datasets/mbpp
105
+ metrics:
106
+ - name: Pass@1 (30-sample, thinking enabled)
107
+ type: code_eval
108
+ value: 90
109
+ - task:
110
+ type: text-generation
111
+ dataset:
112
+ name: LiveCodeBench
113
+ type: livecodebench/code_generation_lite
114
+ metrics:
115
+ - name: Accuracy (30-sample, thinking enabled)
116
+ type: code_eval
117
+ value: 63.3
118
+ - task:
119
+ type: text-generation
120
+ dataset:
121
+ name: BBQ
122
+ type: herojhc/bbq
123
+ metrics:
124
+ - name: Accuracy (30-sample, thinking enabled)
125
+ type: accuracy
126
+ value: 93.3
127
+ - task:
128
+ type: text-generation
129
+ dataset:
130
+ name: SafetyBench
131
+ type: thu-coai/SafetyBench
132
+ metrics:
133
+ - name: Accuracy (30-sample, thinking enabled)
134
+ type: accuracy
135
+ value: 86.7
136
  ---
137
 
138
  # Ornith-1.0-35B-oQ7