File size: 1,439 Bytes
57d8b5d
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
---
license: apache-2.0
language:
- pl
base_model:
- speakleash/Bielik-4.5B-v3.0-Instruct
pipeline_tag: text-generation
library_name: transformers
tags:
- bielik
- polish
- nvfp4
- fp4
- compressed-tensors
- vllm
- quantized
---

# Bielik-4.5B-v3.0-Instruct — NVFP4 (W4A4)

Kwantyzacja **NVFP4 (W4A4)** modelu [speakleash/Bielik-4.5B-v3.0-Instruct](https://huggingface.co/speakleash/Bielik-4.5B-v3.0-Instruct),
w formacie `compressed-tensors` (`nvfp4-pack-quantized`) gotowym do **vLLM**.

- **Wagi:** 4-bit (FP4 E2M1), grupy po 16, blokowe skale FP8 (E4M3) + globalna skala FP32
- **Aktywacje:** 4-bit FP4 (dynamiczne, per-grupa)
- **Pominięte:** `lm_head` (pełna precyzja)
- **Rozmiar:** ~8,9 GB (bf16) → **~2,7 GB**

## Kalibracja

PTQ przez [`llm-compressor`](https://github.com/vllm-project/llm-compressor), 512 próbek polskiej Wikipedii,
długość sekwencji 2048. Kalibracja na polskim tekście dla zachowania jakości w języku docelowym.

## Sprzęt

NVFP4 jest akcelerowany sprzętowo na **Blackwellu (sm_100+)**. Na starszych GPU (np. Ada/RTX 4090) vLLM
ładuje model przez kernel **Marlin (weight-only FP4)** — działa wszędzie, zysk to mniejszy VRAM.

## Użycie (vLLM)

```bash
vllm serve <repo>/Bielik-4.5B-v3.0-Instruct-NVFP4 --max-model-len 8192
```

## Licencja i atrybucja

Apache-2.0, dziedziczona z modelu bazowego (SpeakLeash & ACK Cyfronet AGH).
Ten checkpoint to wyłącznie kwantyzacja oryginalnych wag.