Regis-RCR commited on
Commit
f3ecdad
·
verified ·
1 Parent(s): 5b1b36e

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +166 -2
README.md CHANGED
@@ -10,16 +10,180 @@ tags:
10
  - MLX
11
  ---
12
 
 
 
13
  <p>
14
- This model is a straight MLX oQ8 quant of google/gemma-4-31B-it for local Apple Silicon inference.
15
 
16
  This model was quantized using (<a href="https://github.com/jundot/omlx" target="_blank">oMLX</a> v0.3.5) mixed-precision quantization.
17
 
18
  No other edits, additions, merges, or behavioral changes have been made to the model beyond the quantization/export step.
19
-
20
  </p>
21
 
22
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
23
  <div align="center">
24
  <img src=https://ai.google.dev/gemma/images/gemma4_banner.png>
25
  </div>
 
10
  - MLX
11
  ---
12
 
13
+
14
+ # Gemma Quantized Models Benchmark Card
15
  <p>
16
+ This repository provides benchmark results for several quantized Gemma instruction-tuned variants evaluated on reasoning, truthfulness, coding, and live coding tasks.
17
 
18
  This model was quantized using (<a href="https://github.com/jundot/omlx" target="_blank">oMLX</a> v0.3.5) mixed-precision quantization.
19
 
20
  No other edits, additions, merges, or behavioral changes have been made to the model beyond the quantization/export step.
 
21
  </p>
22
 
23
 
24
+ ## Benchmark Summary
25
+
26
+ <div style="overflow-x:auto;">
27
+ <table>
28
+ <thead>
29
+ <tr>
30
+ <th align="left">Benchmark</th>
31
+ <th align="left">Mode</th>
32
+ <th align="left">Sampled</th>
33
+ <th align="right">E2B oQ8</th>
34
+ <th align="right">E4B oQ8</th>
35
+ <th align="right">26B-A4B oQ8</th>
36
+ <th align="right">31B oQ8</th>
37
+ </tr>
38
+ </thead>
39
+ <tbody>
40
+ <tr>
41
+ <td><strong>MMLU</strong></td>
42
+ <td>Sample</td>
43
+ <td>100 / 14042</td>
44
+ <td align="right">55.0%</td>
45
+ <td align="right">71.0%</td>
46
+ <td align="right">85.0%</td>
47
+ <td align="right">87.0%</td>
48
+ </tr>
49
+ <tr>
50
+ <td><strong>TRUTHFULQA</strong></td>
51
+ <td>Full</td>
52
+ <td>817</td>
53
+ <td align="right">60.0%</td>
54
+ <td align="right">72.5%</td>
55
+ <td align="right">85.4%</td>
56
+ <td align="right">89.5%</td>
57
+ </tr>
58
+ <tr>
59
+ <td><strong>HUMANEVAL</strong></td>
60
+ <td>Full</td>
61
+ <td>164</td>
62
+ <td align="right">80.5%</td>
63
+ <td align="right">89.6%</td>
64
+ <td align="right">96.3%</td>
65
+ <td align="right">95.1%</td>
66
+ </tr>
67
+ <tr>
68
+ <td><strong>LIVECODEBENCH</strong></td>
69
+ <td>Sample</td>
70
+ <td>30 / 1055</td>
71
+ <td align="right">33.3%</td>
72
+ <td align="right">50.0%</td>
73
+ <td align="right">50.0%</td>
74
+ <td align="right">73.3%</td>
75
+ </tr>
76
+ </tbody>
77
+ </table>
78
+ </div>
79
+
80
+ ## Per-model Details
81
+
82
+ <details>
83
+ <summary><strong>gemma-4-E2B-it-oQ8</strong></summary>
84
+
85
+ <br>
86
+
87
+ <table>
88
+ <thead>
89
+ <tr>
90
+ <th align="left">Benchmark</th>
91
+ <th align="right">Accuracy</th>
92
+ <th align="right">Correct</th>
93
+ <th align="right">Total</th>
94
+ <th align="right">Time (s)</th>
95
+ <th align="left">Think</th>
96
+ </tr>
97
+ </thead>
98
+ <tbody>
99
+ <tr><td>MMLU</td><td align="right">55.0%</td><td align="right">55</td><td align="right">100</td><td align="right">42.9</td><td>No</td></tr>
100
+ <tr><td>TRUTHFULQA</td><td align="right">60.0%</td><td align="right">490</td><td align="right">817</td><td align="right">293.9</td><td>No</td></tr>
101
+ <tr><td>HUMANEVAL</td><td align="right">80.5%</td><td align="right">132</td><td align="right">164</td><td align="right">302.9</td><td>No</td></tr>
102
+ <tr><td>LIVECODEBENCH</td><td align="right">33.3%</td><td align="right">10</td><td align="right">30</td><td align="right">165.4</td><td>No</td></tr>
103
+ </tbody>
104
+ </table>
105
+ </details>
106
+
107
+ <details>
108
+ <summary><strong>gemma-4-E4B-it-oQ8</strong></summary>
109
+
110
+ <br>
111
+
112
+ <table>
113
+ <thead>
114
+ <tr>
115
+ <th align="left">Benchmark</th>
116
+ <th align="right">Accuracy</th>
117
+ <th align="right">Correct</th>
118
+ <th align="right">Total</th>
119
+ <th align="right">Time (s)</th>
120
+ <th align="left">Think</th>
121
+ </tr>
122
+ </thead>
123
+ <tbody>
124
+ <tr><td>MMLU</td><td align="right">71.0%</td><td align="right">71</td><td align="right">100</td><td align="right">59.6</td><td>No</td></tr>
125
+ <tr><td>TRUTHFULQA</td><td align="right">72.5%</td><td align="right">592</td><td align="right">817</td><td align="right">336.3</td><td>No</td></tr>
126
+ <tr><td>HUMANEVAL</td><td align="right">89.6%</td><td align="right">147</td><td align="right">164</td><td align="right">422.5</td><td>No</td></tr>
127
+ <tr><td>LIVECODEBENCH</td><td align="right">50.0%</td><td align="right">15</td><td align="right">30</td><td align="right">247.3</td><td>No</td></tr>
128
+ </tbody>
129
+ </table>
130
+ </details>
131
+
132
+ <details>
133
+ <summary><strong>gemma-4-26B-A4B-it-oQ8</strong></summary>
134
+
135
+ <br>
136
+
137
+ <table>
138
+ <thead>
139
+ <tr>
140
+ <th align="left">Benchmark</th>
141
+ <th align="right">Accuracy</th>
142
+ <th align="right">Correct</th>
143
+ <th align="right">Total</th>
144
+ <th align="right">Time (s)</th>
145
+ <th align="left">Think</th>
146
+ </tr>
147
+ </thead>
148
+ <tbody>
149
+ <tr><td>MMLU</td><td align="right">85.0%</td><td align="right">85</td><td align="right">100</td><td align="right">75.1</td><td>No</td></tr>
150
+ <tr><td>TRUTHFULQA</td><td align="right">85.4%</td><td align="right">698</td><td align="right">817</td><td align="right">404.9</td><td>No</td></tr>
151
+ <tr><td>HUMANEVAL</td><td align="right">96.3%</td><td align="right">158</td><td align="right">164</td><td align="right">340.6</td><td>No</td></tr>
152
+ <tr><td>LIVECODEBENCH</td><td align="right">50.0%</td><td align="right">15</td><td align="right">30</td><td align="right">421.7</td><td>No</td></tr>
153
+ </tbody>
154
+ </table>
155
+ </details>
156
+
157
+ <details>
158
+ <summary><strong>gemma-4-31B-it-oQ8</strong></summary>
159
+
160
+ <br>
161
+
162
+ <table>
163
+ <thead>
164
+ <tr>
165
+ <th align="left">Benchmark</th>
166
+ <th align="right">Accuracy</th>
167
+ <th align="right">Correct</th>
168
+ <th align="right">Total</th>
169
+ <th align="right">Time (s)</th>
170
+ <th align="left">Think</th>
171
+ </tr>
172
+ </thead>
173
+ <tbody>
174
+ <tr><td>MMLU</td><td align="right">87.0%</td><td align="right">87</td><td align="right">100</td><td align="right">306.4</td><td>No</td></tr>
175
+ <tr><td>TRUTHFULQA</td><td align="right">89.5%</td><td align="right">731</td><td align="right">817</td><td align="right">846.1</td><td>No</td></tr>
176
+ <tr><td>HUMANEVAL</td><td align="right">95.1%</td><td align="right">156</td><td align="right">164</td><td align="right">1072.2</td><td>No</td></tr>
177
+ <tr><td>LIVECODEBENCH</td><td align="right">73.3%</td><td align="right">22</td><td align="right">30</td><td align="right">968.6</td><td>No</td></tr>
178
+ </tbody>
179
+ </table>
180
+ </details>
181
+
182
+ ## Evaluation Notes
183
+
184
+ - MMLU and LiveCodeBench were run on sampled subsets rather than the full benchmark.
185
+ - TruthfulQA and HumanEval were evaluated on the full set shown in the table above.
186
+
187
  <div align="center">
188
  <img src=https://ai.google.dev/gemma/images/gemma4_banner.png>
189
  </div>